LLM-Kontext und Token
Token-Limits steuern, wie viel Text und Tool-Daten Assistela in einem Modellkontext senden darf; sie sind weder eine Nachrichtenanzahl noch der Preis einer Antwort.
Was ein Token hier bedeutet
Ein Token ist eine kleine Texteinheit, die von einem LLM verarbeitet wird. Der Kontext umfasst die aktuelle Anfrage, den jüngsten Chat, Erinnerung, temporäre Informationen, Tool-Beschreibungen und Tool-Ergebnisse. Ein längerer Kontext lässt das Modell mehr Verlauf sehen, kann aber langsamer und teurer sein.
Maximal nutzbarer Kontext ist nicht die „Anzahl der Token in einer Antwort“. Es ist das Budget für den gesamten Arbeitseingabebereich, den Assistela verwenden darf. Ein Teil wird automatisch für die Modellausgabe reserviert.
Wo Sie das Limit ändern
AI-Konto öffnen
Wählen Sie Assistela → Einstellungen → AI-Konten und links das Konto aus.
Registerkarte „Modell“ öffnen
Sie sehen das vom Modell oder Anbieter gemeldete Erkannte Limit und das von Assistela tatsächlich verwendete Verwendete Limit.
Manuelle Token-Limits erweitern
Geben Sie unter Maximum nur dann eine Token-Anzahl ein, wenn Sie die Modellbeschränkung kennen oder die Kosten bewusst steuern möchten.
Sicheren Wert auswählen
Sicheren 128K-Standard verwenden stellt die empfohlene Obergrenze wieder her. Modellmaximum verwenden nutzt das erkannte technische Limit. Ein niedrigerer Wert kann als Kostenobergrenze dienen.
Speichern, prüfen und testen
Speichern Sie das Konto, führen Sie die Verbindungsprüfung aus und testen Sie eine längere Unterhaltung mit einem Tool, das Sie normalerweise verwenden.
Das Modell verliert Details früher, Assistela komprimiert den Verlauf häufiger und komplexe Aufgaben mit mehreren Tools passen möglicherweise nicht in den Kontext. Verwenden Sie für ein normales Konto keine nur für Fachleute gedachten Mindestwerte.
Automatische Komprimierung des Verlaufs
Unter Einstellungen → Erweitert → App-Betrieb zeigt die Tabelle Wann ältere Chats zusammengefasst werden, wie die Komprimierung funktioniert. Assistela kürzt ältere Verläufe, bevor das volle Limit erreicht ist, behält einen Teil der jüngsten Unterhaltung bei und reserviert Platz für die Ausgabe. Der ungefähre Schwellenwert hängt von der Kontextgröße des Modells ab.
Dieselbe Seite zeigt Limits für Temporäre Informationen, E-Mails des Persönlichen Assistenten, Kalendertage und Erinnerungstage. Dabei handelt es sich um Anteile des verfügbaren Kontexts. Eine höhere Zahl ist nicht immer besser: Mehr alte E-Mails können die aktuelle Anfrage oder Tool-Ergebnisse verdrängen.
Tool-Schema und Arbeitsschritte
- Effizientes / progressives Laden: Sendet zuerst die Tool-Liste und lädt vollständige Details bei Bedarf. Diese Einstellung wird empfohlen und spart Kontext.
- Detailliertes / vollständiges Schema: Sendet sofort jede Tool-Beschreibung. Verwenden Sie diese Einstellung nur, wenn ein bestimmtes Modell Tools im progressiven Modus nicht erkennt.
- Arbeitsschrittlimit für eine Nachricht: Steuert, wie viele Teilschritte Assistela ausführen darf. Ein höheres Limit macht eine Antwort nicht klüger; es erlaubt lediglich einen längeren Lauf.
Weitere Modelloptionen
- Modell-Reasoning verwenden: Nur bei einem Modell aktivieren, das Reasoning unterstützt. Ein höherer Aufwand kann die Qualität verbessern, erhöht aber Zeit und Kosten.
- Dieses Modell unterstützt nur Text: Aktivieren, wenn es keine Bilder verarbeiten kann; Assistela sendet dann keine Bilddaten.
- Tool-Aufruf verlangen, wenn das Modell eine Aktion verspricht: Hilft bei Modellen, die manchmal behaupten, gehandelt zu haben, ohne ein Tool aufzurufen.
- Ältere Tool-Ausgaben zusammenfassen: Aktiviert lassen, damit lange alte Ergebnisse den Kontext nicht füllen.
Behalten Sie den sicheren 128K-Standard, progressives Laden des Schemas und automatische Komprimierung bei. Ändern Sie Limits nur für ein bestimmtes Modell, einen Fehler oder ein Budget und prüfen Sie, ob Assistela der Unterhaltung weiterhin richtig folgt.