高级功能
LLM 上下文和令牌
令牌上限控制 Assistela 可在单个模型上下文中发送的文字和工具数据量;它不是消息数量,也不是一次回答的价格。
这里的令牌是什么
令牌是 LLM 处理的一小段文字单位。上下文包括当前请求、近期聊天、记忆、临时信息、工具说明和工具结果。上下文越长,模型能看到的历史记录越多,但速度可能更慢、成本也可能更高。
最大可用上下文 不是“一次回答中的令牌数”,而是 Assistela 可以使用的完整工作输入预算。系统会自动为模型输出预留一部分空间。
在哪里更改上限
打开 AI 账户
选择 Assistela → 设置 → AI 账户,然后选择左侧账户。
打开“模型”标签页
你会看到模型或提供商报告的 检测到的上限,以及 Assistela 实际使用的 使用上限。
展开“手动令牌上限”
只有在了解模型限制或有意控制成本时,才在 最大值 中输入令牌数。
选择安全值
使用安全的 128K 默认值 可恢复建议上限。使用模型最大值 会采用检测到的技术上限。较低的值可用作成本上限。
保存、检查并测试
保存账户,运行连接检查,并使用平时常用的工具测试一段较长对话。
上限过低会导致问题
模型会更早丢失细节,Assistela 会更频繁地压缩历史记录,涉及多个工具的复杂工作也可能放不下。普通账户不要使用仅适合专家的最低值。
自动压缩历史记录
设置 → 高级 → 应用运行 中的 何时总结较早聊天 表格会显示压缩方式。Assistela 会在达到完整上限前缩短较早历史记录,保留一部分近期对话并预留输出空间。大致阈值取决于模型上下文大小。
同一页面还显示临时信息、个人助理电子邮件、日历天数和提醒事项天数的上限。这些内容会占用可用上下文。数值越高不一定越好:更多旧邮件可能挤占当前请求或工具结果的空间。
工具架构和工作步骤
- 高效 / 渐进式加载:先发送工具列表,按需加载完整详情。建议使用此方式,可节省上下文。
- 详细 / 完整架构:立即发送每项工具说明。只有特定模型无法在渐进模式中识别工具时才使用。
- 单条消息的工作步骤上限:控制 Assistela 可执行多少个中间步骤。提高上限不会让回答更聪明,只会允许运行更长时间。
其他模型选项
- 使用模型推理:只为支持推理的模型启用。更高的推理强度可以提高质量,但也会增加时间和成本。
- 此模型仅支持文字:如果模型无法处理图像,请启用;Assistela 将不发送图像数据。
- 模型承诺执行操作时要求工具调用:有助于处理有时声称已操作却没有调用工具的模型。
- 总结较早的工具输出:保持启用,避免冗长的旧结果填满上下文。
给大多数用户的建议
请保留安全的 128K 默认值、渐进式架构加载和自动压缩。只针对具体模型、故障或预算更改上限,并验证 Assistela 仍能正确衔接对话。