/ AI Engineering

Alquiler de contexto: el coste que pagas cada vez que tu agente lee un manifiesto deficiente

Una corrección sobre agent-manifest: la investigación se interpretó mal, la estadística principal era errónea y del fallo surgió un proceso mejor.

En julio publiqué agent-manifest con una afirmación de la que estaba seguro: los archivos de contexto generados por LLM reducen las tasas de éxito de las tareas en más de un 20 %. Dos artículos de arXiv, cifras claras, una narrativa limpia. El tipo de estadística que hace que una publicación de LinkedIn funcione.

Había un problema. La estadística era errónea.

No inventada: mal interpretada. Mi skill leyó el >20 % de Gloaguen como éxito de las tareas, cuando se refiere al coste de inferencia. También atribuyó a Lulla un hallazgo sobre calidad que ese artículo nunca formuló. Dos errores en el mismo bloque de citas. Leí los artículos correctos, extraje las cifras correctas y las asocié a las afirmaciones equivocadas.

Cómo lo descubrí

No fui yo quien lo detectó. Matthew Mirman, fundador de chat.dev y doctor en IA por ETH, adaptó agent-manifest a su plataforma bajo el nombre de Lean Agent Manifest. Lo llamó «la regla de Aleksandar». En su versión las citas estaban bien; en la mía, no. Nunca lo señaló de forma explícita. Su adaptación simplemente lo hacía bien, discretamente.

Advertí la discrepancia al comparar ambas versiones. Su nota de investigación establecía la relación correcta entre los datos y las afirmaciones. La mía contenía la que yo quería que fuese cierta.

Corregí el repositorio ese mismo día, le atribuí el hallazgo y recuperé dos decisiones de diseño de su versión que mejoraban la mía: exigir dos evidencias para cada dato candidato, en lugar de una, y devolver una lista de completitud en vez de hacer suposiciones cuando falta conocimiento del mantenedor. La segunda permite que la skill funcione sin supervisión, cosa que la mía no lograba.

El historial de commits muestra exactamente qué cambió y por qué.

Alquiler de contexto

Mirman acuñó el término en su publicación: tratar los resúmenes obvios del stack como un alquiler de contexto que nadie ha pedido pagar. Confirmé que era el nombre adecuado porque captura algo que las cifras en bruto no reflejan.

Un manifiesto no es un coste puntual. Cada vez que se ejecuta tu agente, lee ese contexto. Si el manifiesto es abultado, impreciso o ha sido alucinado por un LLM que nunca vio el codebase real, estás pagando un alquiler por un contexto deficiente. En cada invocación.

La «regla de los 10» de agent-manifest es mi intento de ofrecer una respuesta práctica: 10 segundos para encontrar un archivo, 10 líneas para comprender una convención, 10 palabras para saber qué no hacer. Si tu manifiesto no supera esa prueba, el agente está gastando tokens en interpretar ruido en lugar de resolver tu problema.

El alquiler de contexto vuelve tangible el marco del coste. No se trata de «tu manifiesto podría mejorar», sino de «estás pagando porque este manifiesto es malo cada vez que ejecutas el agente, y seguirás pagando hasta que lo corrijas».

Lo que sí se sostiene

La tesis original sigue en pie: un manifiesto generado por un LLM sin revisión humana empeora a tu agente. Los artículos lo respaldan. Lo que no respaldan es el encuadre específico que utilicé. La diferencia entre «cuesta más» y «tiene menos éxito» importa, y yo la aplané.

Los manifiestos bien elaborados reducen el tiempo de ejecución en aproximadamente un 28 % y el uso de tokens en aproximadamente un 16 %. Esa es la cifra real. Es significativa. Simplemente no es la cifra que publiqué.

La parte que me importa

Escribo mucho sobre presión adversarial: sobre por qué quien intenta romper algo encuentra fallos que un juez aprobaría; sobre por qué una segunda opinión debe ser hostil, no solo independiente.

Esto es lo mismo aplicado a mis propias afirmaciones. Yo era el juez de mi propia publicación. Leí los artículos, me gustó la cifra y construí una narrativa a su alrededor. Nadie me indujo al error. Sencillamente, no sometí a presión la correspondencia entre los datos y mi encuadre. Hizo falta que otra persona trabajara sobre una versión de mi propio trabajo para que la brecha quedara a la vista.

La corrección no destruyó la credibilidad. La publicación siguió dando lugar a un concepto con nombre, a una adaptación para otra plataforma y a mejoras de diseño que devolví a mi propio repositorio. Lo que habría destruido la credibilidad es que el error hubiera permanecido allí mientras la idea se difundía.

Audita tus fuentes. Sobre todo cuando la cifra te conviene.

agent-manifest

El repositorio es de código abierto: github.com/aleksandarlabs/agent-manifest

Allí están la regla de los 10, la skill del manifiesto y la evidencia corregida. Si estás creando agentes de código y tu archivo de contexto fue generado por un LLM sin revisión, probablemente estés pagando más alquiler de contexto del que crees.