LLMのコンテキストとトークン
トークン上限は、Assistelaから1つのモデルコンテキストへ送信できるテキストとツールデータの量を制御します。メッセージ数や1回答の価格ではありません。
ここでいうトークンとは
トークンは、LLMが処理するテキストの小さな単位です。コンテキストには、現在のリクエスト、最近のチャット、メモリ、一時情報、ツールの説明、ツールの結果が含まれます。コンテキストが長いほどモデルが見られる履歴は増えますが、処理が遅くなり、費用が高くなる場合があります。
「利用可能な最大コンテキスト」は「1回の回答に含まれるトークン数」ではなく、Assistelaが使える作業入力全体の予算です。モデルの出力用に一部の領域が自動的に確保されます。
上限を変更する場所
AIアカウントを開く
Assistela → 設定 → AIアカウントを選び、左側でアカウントを選びます。
「モデル」タブを開く
モデルまたはプロバイダーから報告された「検出された上限」と、Assistelaが実際に使う「使用上限」が表示されます。
「手動トークン上限」を開く
モデルの制限を理解している場合、または意図的にコストを管理する場合に限り、「最大」へトークン数を入力します。
安全な値を選ぶ
「安全な128Kデフォルトを使用」で推奨上限へ戻せます。「モデルの最大値を使用」では、検出された技術上限を使います。低い値はコスト上限として使えます。
保存、確認、テストする
アカウントを保存して接続チェックを実行し、普段使うツールを含む長めの会話でテストします。
モデルが早い段階で詳細を失い、Assistelaが履歴を頻繁に圧縮し、複数のツールを使う複雑な作業が収まらない場合があります。一般的なアカウントでは、専門家向けの最小値を使わないでください。
履歴の自動圧縮
設定 → 高度 → アプリ実行にある「過去のチャットを要約する時期」の表には、圧縮方法が表示されます。Assistelaは上限全体へ達する前に過去の履歴を短縮し、最近の会話を一部残して出力用の領域を確保します。おおよそのしきい値は、モデルのコンテキストサイズによって異なります。
同じページには、一時情報、パーソナルアシスタントのメール、カレンダーの日数、リマインダーの日数の上限も表示されます。これらも利用可能なコンテキストを使います。大きい値が常に良いとは限りません。古いメールを増やすと、現在のリクエストやツール結果の領域が圧迫される場合があります。
ツールスキーマと作業ステップ
- 効率的 / 段階的な読み込み:まずツール一覧を送り、必要に応じて完全な詳細を読み込みます。コンテキストを節約できる推奨方式です。
- 詳細 / 完全なスキーマ:すべてのツール説明を最初から送ります。特定のモデルが段階的モードでツールを認識できない場合に限って使います。
- 1メッセージあたりの作業ステップ上限:Assistelaが実行できる中間ステップ数を制御します。上限を上げても回答が賢くなるわけではなく、長時間の実行が可能になるだけです。
その他のモデルオプション
- モデルの推論を使用:推論に対応したモデルにだけ有効にします。推論強度を高くすると品質が上がる場合がありますが、時間と費用も増えます。
- このモデルはテキスト専用:画像を扱えないモデルで有効にすると、Assistelaから画像データを送りません。
- モデルが操作すると述べた場合にツール呼び出しを要求:ツールを呼び出さずに操作したと主張することがあるモデルに役立ちます。
- 過去のツール出力を要約:長い古い結果でコンテキストが埋まらないよう、有効のままにします。
安全な128Kデフォルト、段階的なスキーマ読み込み、自動圧縮をそのまま使ってください。特定のモデル、不具合、予算に対してだけ上限を変更し、Assistelaが会話を正しく継続できることを確認します。