Kontext a tokeny LLM
Tokenové limity určují, kolik textu a nástrojových dat smí Assistela poslat modelu v jednom kontextu; nejde o počet zpráv ani cenu jedné odpovědi.
Co je token v tomto nastavení
Token je malý kus textu, který LLM zpracovává. Do kontextu se počítá aktuální zadání, nedávný chat, paměť, dočasné informace, popisy nástrojů a jejich výsledky. Delší kontext pomáhá modelu vidět více historie, ale může být pomalejší a dražší.
Maximální použitelný kontext není „počet tokenů jedné odpovědi“. Je to rozpočet celé pracovní vstupní oblasti, kterou Assistela smí využít. Část prostoru automaticky rezervuje pro výstup modelu.
Kde limit změnit
Otevřete AI účet
Zvolte Assistela → Nastavení → AI účty a vlevo vyberte účet.
Otevřete kartu Model
Uvidíte Zjištěný limit, který model nebo provider oznámil, a Použitý limit, se kterým skutečně pracuje Assistela.
Rozbalte Ruční limity tokenů
Do pole Maximum zadejte počet tokenů jen tehdy, když znáte omezení modelu nebo chcete vědomě řídit náklady.
Vyberte bezpečnou hodnotu
Použít bezpečné výchozí 128K vrátí doporučený strop. Použít maximum modelu využije zjištěný technický limit. Nižší hodnota může fungovat jako cenový strop.
Uložte, zkontrolujte a otestujte
Uložte účet, použijte kontrolu připojení a zkuste delší konverzaci s nástrojem, který běžně používáte.
Model bude dřív zapomínat podrobnosti, Assistela bude častěji zkracovat historii a složitá práce s více nástroji se nemusí vejít. Hodnoty označené jako expertní minimum nepoužívejte pro běžný účet.
Automatická komprese historie
V Nastavení → Pokročilé → Provoz aplikace najdete tabulku Kdy se starší chat shrnuje. Assistela začne starší historii zkracovat dřív, než zaplní celý limit, ponechá část nedávné konverzace a rezervuje prostor pro odpověď. Přibližný práh závisí na velikosti kontextu modelu.
Na stejné stránce můžete vidět limity pro dočasné informace, e-mail Osobního asistenta, počet dní kalendáře a Připomínek. Jde o podíly z dostupného kontextu. Vyšší číslo není vždy lepší: více starých e-mailů může vytlačit aktuální zadání nebo výsledky nástrojů.
Schéma nástrojů a pracovní kroky
- Efektivní / postupné načítání: nejdřív pošle jen seznam nástrojů a úplný popis načte podle potřeby. Je doporučené a šetří kontext.
- Podrobné / úplné schéma: pošle popis všech nástrojů okamžitě. Použijte jen když konkrétní model v postupném režimu nástroje nerozpoznává.
- Limit pracovních kroků pro jednu zprávu: určuje, kolik dílčích kroků smí Assistela udělat. Vyšší limit neznamená chytřejší odpověď; pouze dovolí delší běh.
Další volby modelu
- Použít reasoning: zapněte jen pro model, který reasoning skutečně podporuje. Vyšší úroveň může zvýšit kvalitu i cenu a čas.
- Model podporuje pouze text: zapněte, pokud daný model neumí obrázky; Assistela mu je nebude posílat.
- Vyžadovat tool call, když model slíbí akci: pomáhá u modelů, které někdy napíší, že něco udělaly, ale žádný nástroj nevolají.
- Shrnovat starší výstupy nástrojů: ponechte zapnuté, aby staré dlouhé výsledky nezaplňovaly kontext.
Ponechte bezpečných 128K, postupné načítání schématu a automatické zkracování. Limity měňte jen kvůli konkrétnímu modelu, chybě nebo rozpočtu a po změně sledujte, zda Assistela stále správně navazuje.