Assistela Assistela Documentación
Opciones avanzadas

Contexto y tokens del LLM

Los límites de tokens controlan cuánto texto y datos de herramientas puede enviar Assistela en un contexto de modelo; no representan un número de mensajes ni el precio de una respuesta.

Qué significa aquí un token

Un token es una pequeña unidad de texto que procesa un LLM. El contexto incluye la solicitud actual, el chat reciente, la memoria, la información temporal, las descripciones de herramientas y sus resultados. Un contexto más largo permite al modelo ver más historial, pero puede ser más lento y costoso.

El contexto máximo utilizable no es el «número de tokens de una respuesta». Es el presupuesto para toda el área de entrada de trabajo que Assistela puede usar. Parte del espacio se reserva automáticamente para la salida del modelo.

Dónde cambiar el límite

1

Abre la cuenta de IA

Elige Assistela → Ajustes → Cuentas de IA y selecciona la cuenta de la izquierda.

2

Abre la pestaña Modelo

Verás el Límite detectado que comunica el modelo o proveedor y el Límite utilizado que Assistela usa realmente.

3

Amplía Límites manuales de tokens

Introduce una cantidad de tokens en Máximo solo cuando conozcas la restricción del modelo o quieras controlar deliberadamente el coste.

4

Elige un valor seguro

Usar el valor seguro predeterminado de 128K restablece el máximo recomendado. Usar el máximo del modelo utiliza el límite técnico detectado. Un valor inferior puede servir como tope de coste.

5

Guarda, comprueba y prueba

Guarda la cuenta, ejecuta su comprobación de conexión y prueba una conversación más larga con una herramienta que uses normalmente.

Un límite demasiado bajo causa problemas

El modelo pierde los detalles antes, Assistela comprime el historial con más frecuencia y quizá no quepan trabajos complejos con varias herramientas. No uses valores mínimos reservados a expertos en una cuenta normal.

Compresión automática del historial

En Ajustes → Avanzado → Funcionamiento de la aplicación, la tabla Cuándo se resume el chat antiguo muestra cómo funciona la compresión. Assistela acorta el historial antiguo antes de alcanzar el límite completo, conserva parte de la conversación reciente y reserva espacio para la salida. El umbral aproximado depende del tamaño de contexto del modelo.

La misma página muestra límites para Información temporal, correo del Asistente personal, días de Calendario y días de Recordatorios. Son proporciones del contexto disponible. Un número mayor no siempre es mejor: una mayor cantidad de correo antiguo puede desplazar la solicitud actual o los resultados de las herramientas.

Esquema de herramientas y pasos de trabajo

  • Carga eficiente o progresiva: envía primero la lista de herramientas y carga los detalles completos según sean necesarios. Es la opción recomendada y ahorra contexto.
  • Esquema detallado o completo: envía inmediatamente la descripción de cada herramienta. Úsalo solo cuando un modelo concreto no reconozca las herramientas en el modo progresivo.
  • Límite de pasos de trabajo por mensaje: controla cuántos pasos parciales puede dar Assistela. Un límite mayor no hace que una respuesta sea más inteligente; solo permite una ejecución más larga.

Otras opciones del modelo

  • Usar el razonamiento del modelo: actívalo únicamente con un modelo que admita razonamiento. Un esfuerzo mayor puede mejorar la calidad a costa de más tiempo y dinero.
  • Este modelo solo admite texto: actívalo si no puede procesar imágenes; Assistela no enviará datos de imagen.
  • Exigir una llamada a herramienta cuando el modelo promete una acción: ayuda con modelos que a veces afirman haber actuado sin llamar a una herramienta.
  • Resumir salidas antiguas de herramientas: mantenlo activado para que los resultados antiguos y largos no llenen el contexto.
Recomendación para la mayoría de los usuarios

Conserva el valor seguro predeterminado de 128K, la carga progresiva del esquema y la compresión automática. Cambia los límites solo por un modelo, fallo o presupuesto concreto y comprueba que Assistela sigue correctamente la conversación.