Assistela Assistela 文档
高级功能

LLM 上下文和令牌

令牌上限控制 Assistela 可在单个模型上下文中发送的文字和工具数据量;它不是消息数量,也不是一次回答的价格。

这里的令牌是什么

令牌是 LLM 处理的一小段文字单位。上下文包括当前请求、近期聊天、记忆、临时信息、工具说明和工具结果。上下文越长,模型能看到的历史记录越多,但速度可能更慢、成本也可能更高。

最大可用上下文 不是“一次回答中的令牌数”,而是 Assistela 可以使用的完整工作输入预算。系统会自动为模型输出预留一部分空间。

在哪里更改上限

1

打开 AI 账户

选择 Assistela → 设置 → AI 账户,然后选择左侧账户。

2

打开“模型”标签页

你会看到模型或提供商报告的 检测到的上限,以及 Assistela 实际使用的 使用上限

3

展开“手动令牌上限”

只有在了解模型限制或有意控制成本时,才在 最大值 中输入令牌数。

4

选择安全值

使用安全的 128K 默认值 可恢复建议上限。使用模型最大值 会采用检测到的技术上限。较低的值可用作成本上限。

5

保存、检查并测试

保存账户,运行连接检查,并使用平时常用的工具测试一段较长对话。

上限过低会导致问题

模型会更早丢失细节,Assistela 会更频繁地压缩历史记录,涉及多个工具的复杂工作也可能放不下。普通账户不要使用仅适合专家的最低值。

自动压缩历史记录

设置 → 高级 → 应用运行 中的 何时总结较早聊天 表格会显示压缩方式。Assistela 会在达到完整上限前缩短较早历史记录,保留一部分近期对话并预留输出空间。大致阈值取决于模型上下文大小。

同一页面还显示临时信息、个人助理电子邮件、日历天数和提醒事项天数的上限。这些内容会占用可用上下文。数值越高不一定越好:更多旧邮件可能挤占当前请求或工具结果的空间。

工具架构和工作步骤

  • 高效 / 渐进式加载:先发送工具列表,按需加载完整详情。建议使用此方式,可节省上下文。
  • 详细 / 完整架构:立即发送每项工具说明。只有特定模型无法在渐进模式中识别工具时才使用。
  • 单条消息的工作步骤上限:控制 Assistela 可执行多少个中间步骤。提高上限不会让回答更聪明,只会允许运行更长时间。

其他模型选项

  • 使用模型推理:只为支持推理的模型启用。更高的推理强度可以提高质量,但也会增加时间和成本。
  • 此模型仅支持文字:如果模型无法处理图像,请启用;Assistela 将不发送图像数据。
  • 模型承诺执行操作时要求工具调用:有助于处理有时声称已操作却没有调用工具的模型。
  • 总结较早的工具输出:保持启用,避免冗长的旧结果填满上下文。
给大多数用户的建议

请保留安全的 128K 默认值、渐进式架构加载和自动压缩。只针对具体模型、故障或预算更改上限,并验证 Assistela 仍能正确衔接对话。