Los Context Language Models permiten a un agente editar el historial que leerá después, convirtiendo la gestión del contexto de un paso fijo de resumen en una acción aprendida.

Rulin Shao y 12 coautores representan el contexto activo como un archivo. El modelo puede reescribir, borrar o reordenar ese archivo mientras trabaja y después continuar desde la versión editada, en lugar de arrastrar una transcripción cada vez más extensa o aceptar un resumen elegido por el software que lo rodea.

Por qué importa

Para un desarrollador que ejecuta un agente de investigación o programación durante mucho tiempo, el contexto es tanto memoria como cómputo. Introducir repetidamente los tokens antiguos consume tiempo, mientras que una compactación agresiva puede descartar evidencias necesarias más adelante. Un modelo que decide qué conservar podría ajustar ese equilibrio para cada tarea.

El artículo denomina al enfoque Context Language Model, o CLM. Separa el archivo de contexto editable de la interacción actual, de modo que un agente pueda mantener un registro de trabajo compacto mientras el entorno original sigue produciendo observaciones.

El método básico no requiere una arquitectura especial de modelo. Los autores prueban instrucciones que indican a los modelos existentes cómo gestionar el archivo y después mejoran la política mediante aprendizaje por refuerzo y un ciclo de optimización de habilidades. Un repositorio público incluye la implementación y ejemplos, y los autores también publicaron un complemento para el entorno de ejecución de agentes Pi.

En una tarea de gestión del contexto reservada para evaluación, los autores señalan que las instrucciones optimizadas en lenguaje natural mejoraron la precisión hasta en 35,9 puntos porcentuales y redujeron el cómputo. El resultado «hasta en» es el mayor cambio comunicado, pero procede de la evaluación de los autores y varía según la configuración.

La edición cambia tanto la caché como el texto

La edición del contexto crea un problema de inferencia. Los servidores de transformers normalmente reutilizan una caché de claves y valores para un prefijo que no ha cambiado. Reescribir texto en medio invalida los estados posteriores almacenados en caché porque se calcularon a partir de la versión anterior.

Los autores proponen reutilizar parcialmente la caché para evitar recalcularlo todo. Esa optimización tiene consecuencias: reutilizar estados posteriores a una edición puede dejar la caché desactualizada, mientras que recalcular desde el punto de edición ahorra menos trabajo. El artículo señala que su aproximación conservó la precisión en las configuraciones probadas, pero lectores de la comunidad ya han identificado este aspecto como un objetivo importante para la reproducción.

El archivo editable también cambia el perímetro de seguridad. Las salidas de herramientas, las instrucciones del usuario y las notas escritas por el modelo pueden persistir juntas hasta que el modelo las elimine. Una instrucción maliciosa que llegue al archivo puede, por tanto, sobrevivir más tiempo que en una respuesta transitoria de una herramienta. El artículo estudia la gestión del contexto, sin ofrecer una procedencia autenticada ni una defensa completa contra la inyección de prompts.

El estudio evalúa modelos Qwen y de la familia Claude en tareas de gestión del contexto y con agentes de larga duración. Las mejoras comunicadas tras el aprendizaje por refuerzo muestran que la edición puede enseñarse, más allá de solicitarla mediante prompts, pero no establecen que todos los agentes deban controlar su propio registro. Los flujos de trabajo regulados o de análisis forense pueden necesitar una transcripción inmutable junto al contexto de trabajo editable.

El preprint se presentó el 29 de septiembre de 2026. El repositorio de código es público, por lo que las próximas evidencias útiles pueden proceder de reproducciones que comparen el recálculo completo, la reutilización parcial de la caché y la compactación habitual en las mismas tareas.

Verificación

AfirmaciónEtiquetaFuente primariaVerificación independiente
Los CLM presentan el contexto como un archivo que el modelo puede reescribir, borrar y reordenarSEGÚN LA EMPRESAPreprint de CLMimplementación pública
El método funciona con arquitecturas de modelos existentesSEGÚN LA EMPRESAPreprint de CLMimplementación disponible en el repositorio
Las instrucciones optimizadas mejoraron la precisión en datos reservados hasta en 35,9 puntos y redujeron el cómputoSEGÚN LA EMPRESAPreprint de CLMninguna; evaluación de los autores
La reutilización parcial de la caché conservó la precisión en las configuraciones probadasSEGÚN LA EMPRESAPreprint de CLMno se encontró una reproducción independiente
El contexto editable puede conservar las instrucciones inyectadas durante más tiempoANÁLISISPreprint de CLMla amenaza se deriva de la persistencia del contexto escrito por el modelo
El código y un complemento para Pi son públicosVERIFICADORepositorio de CLMrepositorio disponible
El preprint se presentó el 29 de septiembre de 2026VERIFICADORegistro de arXivmetadatos de arXiv