Contexto e tokens do LLM
Os limites de tokens controlam quanto texto e quantos dados de ferramentas a Assistela pode enviar em um contexto do modelo; eles não representam uma contagem de mensagens nem o preço de uma resposta.
O que significa token neste contexto
Um token é uma pequena unidade de texto processada por um LLM. O contexto inclui a solicitação atual, o Chat recente, a memória, as informações temporárias, as descrições das ferramentas e os resultados delas. Um contexto maior permite que o modelo consulte uma parte maior do histórico, mas pode ser mais lento e mais caro.
O Contexto máximo utilizável não é o “número de tokens em uma resposta”. Ele é o orçamento para toda a área de entrada de trabalho que a Assistela pode usar. Uma parte do espaço é reservada automaticamente para a saída do modelo.
Onde alterar o limite
Abra a conta de IA
Escolha Assistela → Ajustes → Contas de IA e selecione a conta à esquerda.
Abra a aba Modelo
Você verá o Limite detectado, informado pelo modelo ou provedor, e o Limite usado, que a Assistela realmente utiliza.
Expanda Limites manuais de tokens
Insira uma quantidade de tokens em Máximo somente quando souber qual é a restrição do modelo ou quiser controlar os custos deliberadamente.
Escolha um valor seguro
A opção Usar o padrão seguro de 128K restaura o limite máximo recomendado. Usar o máximo do modelo usa o limite técnico detectado. Um valor menor pode funcionar como teto de custos.
Salve, verifique e teste
Salve a conta, execute a verificação de conexão e teste uma conversa mais longa com uma ferramenta que você usa normalmente.
O modelo perde detalhes mais cedo, a Assistela compacta o histórico com maior frequência e um trabalho complexo com várias ferramentas pode não caber no contexto. Não use valores mínimos destinados a especialistas em uma conta comum.
Compactação automática do histórico
Em Ajustes → Avançado → Funcionamento do Aplicativo, a tabela Quando o Chat antigo é resumido mostra como funciona a compactação. A Assistela encurta o histórico antigo antes que o limite total seja atingido, preserva uma parte da conversa recente e reserva espaço para a saída. O limite aproximado depende do tamanho do contexto do modelo.
A mesma página mostra os limites para Informações Temporárias, e-mails do Assistente Pessoal, dias da Agenda e dias de Lembretes. Eles representam parcelas do contexto disponível. Um número maior nem sempre é melhor: mais e-mails antigos podem ocupar o espaço da solicitação atual ou dos resultados das ferramentas.
Esquema de ferramentas e etapas de trabalho
- Carregamento eficiente/progressivo: envia primeiro a lista de ferramentas e carrega os detalhes completos conforme necessário. É a opção recomendada e economiza contexto.
- Esquema detalhado/completo: envia imediatamente todas as descrições de ferramentas. Use-o somente quando um modelo específico não reconhecer as ferramentas no modo progressivo.
- Limite de etapas de trabalho para uma mensagem: controla quantas etapas parciais a Assistela pode executar. Um limite maior não torna a resposta mais inteligente; apenas permite uma execução mais longa.
Outras opções de modelo
- Usar o raciocínio do modelo: ative somente em um modelo compatível com raciocínio. Um esforço maior pode melhorar a qualidade, mas aumenta o tempo e o custo.
- Este modelo aceita somente texto: ative quando ele não puder processar imagens; a Assistela não enviará dados de imagens.
- Exigir uma chamada de ferramenta quando o modelo prometer uma ação: ajuda com modelos que às vezes afirmam ter agido sem chamar uma ferramenta.
- Resumir saídas de ferramentas antigas: mantenha ativado para evitar que resultados antigos e extensos preencham o contexto.
Mantenha o padrão seguro de 128K, o carregamento progressivo do esquema e a compactação automática. Altere os limites somente por causa de um modelo, uma falha ou um orçamento específico e confirme que a Assistela continua acompanhando a conversa corretamente.