LLM 情境與 token
Token 限制控制 Assistela 在單一模型情境中可傳送的文字與工具資料量;它不是訊息數量,也不是一則答案的價格。
此處的 token 代表什麼
Token 是 LLM 處理文字時使用的小型單位。情境包含目前要求、近期聊天、記憶、暫存資訊、工具描述與工具結果。較長的情境能讓模型看到更多記錄,但速度可能較慢、費用也可能較高。
最大可用情境並不是「一則答案的 token 數量」,而是 Assistela 可使用的完整工作輸入區域預算。系統會自動保留部分空間供模型輸出。
變更限制的位置
開啟 AI 帳戶
選擇 Assistela → 設定 → AI 帳戶,並在左側選取帳戶。
開啟「模型」分頁
您會看到模型或供應商回報的偵測到的限制,以及 Assistela 實際使用的使用限制。
展開「手動 token 限制」
只有在您知道模型限制,或刻意要控制成本時,才在最大值中輸入 token 數量。
選擇安全值
使用安全的 128K 預設值會回復建議上限。使用模型最大值會採用偵測到的技術限制。較低的值可作為成本上限。
儲存、檢查並測試
儲存帳戶、執行連線檢查,再以較長的對話及您平常使用的工具進行測試。
模型會更快失去細節、Assistela 會更常壓縮記錄,而且使用多個工具的複雜工作可能無法容納。一般帳戶請勿使用僅供專家使用的最低值。
自動壓縮聊天記錄
在 設定 → 進階 → 應用程式操作 下,較舊聊天的摘要時機表格會顯示壓縮方式。Assistela 會在達到完整限制前縮短較舊記錄、保留部分近期對話,並預留輸出空間。大約的臨界值取決於模型的情境大小。
同一頁也會顯示「暫存資訊」、「個人助理」電子郵件、行事曆天數及提醒事項天數的限制。這些限制是可用情境的占比。數字越高不一定越好:過多舊電子郵件可能會排擠目前要求或工具結果。
工具結構描述與工作步驟
- 高效率/漸進式載入:先傳送工具列表,再視需要載入完整詳細資訊。建議使用此模式,可節省情境。
- 詳細/完整結構描述:立即傳送每項工具描述。只有特定模型在漸進模式下無法辨識工具時才使用。
- 單則訊息的工作步驟上限:控制 Assistela 可進行多少個局部步驟。較高的上限不會讓答案更聰明,只是允許更長的執行過程。
其他模型選項
- 使用模型推理:只有模型支援推理時才啟用。較高的推理強度可能提升品質,也會增加時間與成本。
- 此模型只支援文字:若模型無法處理影像,請啟用此選項;Assistela 將不會傳送影像資料。
- 模型承諾執行動作時必須呼叫工具:有助於避免某些模型聲稱已操作,卻未呼叫工具。
- 摘要較舊的工具輸出:請保持啟用,避免冗長的舊結果填滿情境。
保留安全的 128K 預設值、漸進式結構描述載入及自動壓縮。只有針對特定模型、故障或預算時才變更限制,並確認 Assistela 仍能正確理解對話脈絡。