Контекст LLM и токены
Ограничения токенов определяют, сколько текста и данных инструментов Assistela может отправить в одном контексте модели; это не число сообщений и не цена одного ответа.
Что здесь означает токен
Токен — небольшая единица текста, обрабатываемая LLM. Контекст включает текущий запрос, недавний чат, память, временную информацию, описания инструментов и их результаты. Более длинный контекст позволяет модели видеть больше истории, но может работать медленнее и стоить дороже.
Максимальный доступный контекст — не «количество токенов в одном ответе». Это бюджет всей рабочей входной области, которую может использовать Assistela. Часть места автоматически резервируется для вывода модели.
Где изменить ограничение
Откройте учётную запись AI
Выберите Assistela → Настройки → Учётные записи AI и нажмите нужную учётную запись слева.
Откройте вкладку «Модель»
Вы увидите Обнаруженное ограничение, сообщённое моделью или поставщиком, и Используемое ограничение, фактически применяемое Assistela.
Разверните «Ручные ограничения токенов»
Вводите число токенов в поле Максимум только тогда, когда знаете ограничение модели или намеренно хотите контролировать расходы.
Выберите безопасное значение
Использовать безопасное значение 128K по умолчанию возвращает рекомендуемый предел. Использовать максимум модели применяет обнаруженное техническое ограничение. Более низкое значение может ограничивать расходы.
Сохраните, проверьте и испытайте
Сохраните учётную запись, выполните проверку подключения и испытайте более длинный разговор с обычно используемым инструментом.
Модель быстрее теряет подробности, Assistela чаще сжимает историю, а сложная работа с несколькими инструментами может не поместиться. Не используйте экспертные минимальные значения для обычной учётной записи.
Автоматическое сжатие истории
В разделе Настройки → Расширенные → Работа приложения таблица Когда создаётся сводка старого чата показывает работу сжатия. Assistela сокращает старую историю до достижения полного ограничения, сохраняет часть недавнего разговора и резервирует место для вывода. Приблизительный порог зависит от размера контекста модели.
На той же странице показаны ограничения Временной информации, электронной почты Персонального ассистента, числа дней Календаря и Напоминаний. Это доли доступного контекста. Большее значение не всегда лучше: избыток старой почты может вытеснить текущий запрос или результаты инструментов.
Схема инструментов и рабочие шаги
- Эффективная / поэтапная загрузка: сначала отправляет список инструментов, а полные сведения загружает по необходимости. Рекомендуется и экономит контекст.
- Подробная / полная схема: сразу отправляет описание каждого инструмента. Используйте только тогда, когда конкретная модель не распознаёт инструменты в поэтапном режиме.
- Ограничение рабочих шагов на одно сообщение: определяет, сколько частичных шагов может выполнить Assistela. Более высокое ограничение не делает ответ умнее, а лишь разрешает более долгий запуск.
Другие параметры модели
- Использовать рассуждение модели: включайте только для модели, поддерживающей рассуждение. Большее усилие может повысить качество, увеличив время и стоимость.
- Эта модель поддерживает только текст: включите, если она не может обрабатывать изображения; Assistela не будет отправлять данные изображений.
- Требовать вызов инструмента, когда модель обещает действие: помогает моделям, которые иногда утверждают, что выполнили действие, не вызвав инструмент.
- Создавать сводку старого вывода инструментов: оставьте включённым, чтобы длинные старые результаты не заполняли контекст.
Сохраняйте безопасное значение 128K по умолчанию, поэтапную загрузку схемы и автоматическое сжатие. Меняйте ограничения только для конкретной модели, ошибки или бюджета и проверяйте, что Assistela по-прежнему правильно следует разговору.