LLM 맥락과 토큰
토큰 한도는 Assistela가 하나의 모델 맥락에 보낼 수 있는 텍스트와 도구 데이터의 양을 정합니다. 메시지 수나 답변 하나의 가격이 아닙니다.
여기서 토큰이 뜻하는 것
토큰은 LLM이 처리하는 작은 텍스트 단위입니다. 맥락에는 현재 요청, 최근 채팅, 메모리, 임시 정보, 도구 설명과 결과가 포함됩니다. 맥락이 길면 더 많은 기록을 볼 수 있지만 더 느리고 비쌀 수 있습니다.
최대 사용 가능 맥락은 “답변 하나의 토큰 수”가 아닙니다. Assistela가 사용할 수 있는 전체 작업 입력 영역의 예산이며 일부 공간은 모델 출력용으로 자동 예약됩니다.
한도를 바꾸는 위치
AI 계정 열기
Assistela → 설정 → AI 계정을 선택하고 왼쪽에서 계정을 선택합니다.
모델 탭 열기
모델이나 제공업체가 보고한 감지된 한도와 Assistela가 실제로 쓰는 사용 한도가 표시됩니다.
수동 토큰 한도 펼치기
모델 제약을 알고 있거나 비용을 의도적으로 제한할 때만 최대에 토큰 수를 입력합니다.
안전한 값 선택
안전한 128K 기본값 사용은 권장 상한을 복원합니다. 모델 최대값 사용은 감지된 기술 한도를 사용합니다. 더 낮은 값은 비용 상한이 될 수 있습니다.
저장, 확인 및 테스트
계정을 저장하고 연결을 확인한 뒤 평소 쓰는 도구로 더 긴 대화를 테스트합니다.
모델이 세부 내용을 더 빨리 잃고, 기록 압축이 더 자주 일어나며 여러 도구를 쓰는 복잡한 작업이 들어가지 않을 수 있습니다. 일반 계정에 전문가용 최소값을 사용하지 마세요.
자동 기록 압축
설정 → 고급 → 앱 작동의 이전 채팅을 요약하는 시점 표에서 압축 방식을 볼 수 있습니다. Assistela는 전체 한도에 도달하기 전에 이전 기록을 줄이고 최근 대화 일부와 출력 공간을 보존합니다. 대략적인 임계값은 모델 맥락 크기에 따라 달라집니다.
같은 페이지에 임시 정보, 개인 비서 이메일, Calendar 일수와 미리 알림 일수의 한도도 있습니다. 이는 사용 가능한 맥락의 몫입니다. 높은 값이 항상 좋은 것은 아닙니다. 오래된 이메일이 많으면 현재 요청이나 도구 결과가 밀려날 수 있습니다.
도구 스키마와 작업 단계
- 효율적/점진적 로딩: 도구 목록을 먼저 보내고 필요할 때 전체 정보를 불러옵니다. 권장 방식이며 맥락을 절약합니다.
- 상세/전체 스키마: 모든 도구 설명을 즉시 보냅니다. 특정 모델이 점진적 모드에서 도구를 인식하지 못할 때만 사용하세요.
- 메시지 하나의 작업 단계 한도: Assistela가 수행할 수 있는 부분 단계 수를 정합니다. 높은 한도가 답변을 더 똑똑하게 만들지는 않고 더 긴 실행만 허용합니다.
기타 모델 옵션
- 모델 추론 사용: 추론을 지원하는 모델에서만 켭니다. 높은 노력은 품질을 높일 수 있지만 시간과 비용도 늘립니다.
- 이 모델은 텍스트만 지원: 이미지를 처리할 수 없을 때 켜면 Assistela가 이미지 데이터를 보내지 않습니다.
- 모델이 작업을 약속할 때 도구 호출 요구: 실제 도구를 호출하지 않고 작업했다고 말하는 모델에 도움이 됩니다.
- 이전 도구 출력 요약: 오래된 긴 결과가 맥락을 채우지 않도록 켜 둡니다.
안전한 128K 기본값, 점진적 스키마 로딩과 자동 압축을 유지하세요. 특정 모델, 오류 또는 예산 때문에만 한도를 바꾸고 Assistela가 계속 대화를 정확히 따르는지 확인합니다.