El sistema SoL-Pi de Nvidia reduce a la mitad el uso de tokens de los agentes de IA al optimizar la lógica de control
Investigadores de Nvidia han desarrollado SoL-Pi, un sistema automatizado que reescribe el harness de control para agentes de codificación de IA, reduciendo el consumo de tokens en casi la mitad sin sacrificar el rendimiento de las tareas.

Optimización Automatizada del Harness Reduce los Costos de Tokens de los Agentes
Los investigadores de Nvidia han presentado SoL-Pi, un sistema que optimiza automáticamente la capa de control —conocida como harness— utilizada por agentes autónomos de codificación de IA. Detallado en un artículo publicado el 26 de septiembre de 2026, el marco reduce el uso de tokens de los agentes entre un 44,7 y un 49 por ciento, manteniendo la precisión de las tareas aproximadamente igual a la de las configuraciones de referencia.
A medida que los agentes de IA operan sin supervisión a lo largo de flujos de trabajo extensos, los costos aumentan drásticamente, ya que consultas simples al modelo se convierten en largas cadenas de razonamiento, llamadas repetidas a herramientas y bucles de retroalimentación de ejecución. Mientras que las técnicas de eficiencia estándar se centran en optimizaciones a nivel de modelo —como cuantización, kernels de atención más rápidos o el reemplazo por modelos más pequeños— SoL-Pi se dirige al harness subyacente que gestiona cómo los agentes rastrean el estado, ejecutan herramientas y comprimen el contexto. Basándose en principios de auto‑mejora recursiva, el marco utiliza un agente de investigación para observar trazas de ejecución de herramientas como Codex, Claude Code y OpenClaw, proponer una lógica de control más ligera y evaluar automáticamente los cambios candidatos en entornos aislados.
Cuatro Mecanismos Clave y Rendimiento en Benchmarks
Para buscar un código de control más ligero, Nvidia ejecutó más de 3.000 corridas que comprendieron más de 60.000 interacciones agente‑entorno en 535 entornos ejecutables, que incluyeron 495 pares de issue‑pull‑request de GitHub y 40 casos de prueba sintéticos. Para evitar que el sistema automatizado se sobreajustara a sus tareas de entrenamiento, los investigadores aislaron estrictamente la retroalimentación de búsqueda de la evaluación final reservando el benchmark EdgeBench. De los 51 tareas públicas de EdgeBench, 11 se usaron para una validación única de candidatos, mientras que las 40 restantes se reservaron estrictamente para pruebas finales sin cegamiento.
La búsqueda automatizada produjo cuatro mecanismos operacionales distintos:
- Action Fusion: Fusiona dos pasos secuenciales, como la edición de código y la ejecución de pruebas, en una sola acción para eliminar una llamada completa al modelo de lenguaje.
- Online Context Compact: Recorta el contexto acumulado no esencial directamente después de los pasos de planificación.
- ObservationPack: Archiva salidas extensas de herramientas y las reemplaza con resúmenes concisos en los pasos de procesamiento posteriores.
- Evidence-Preserving Reducer: Redirige grandes registros de errores y salidas de pruebas a través de un modelo secundario más económico para extraer hallazgos clave, respaldado por un paso de verificación automatizado que recupera detalles críticos si se omiten.
En EdgeBench, la configuración más eficiente de SoL-Pi —que combina los cuatro mecanismos— redujo el consumo de tokens en un 49 por ciento mientras alcanzaba el 93,7 por ciento del rendimiento del harness Pi de referencia, disminuyendo los costos totales de ejecución de pruebas de $1,339 a $894. Una variante centrada en el rendimiento que selecciona solo el mecanismo más fuerte superó la puntuación del harness Pi original en un 5,3 por ciento, manteniendo la reducción del uso de tokens. Con las tarifas actuales de API, los autores estiman ahorros operativos por hora de $8.75 a $13.50 en comparación con los harness nativos de Codex y Claude Code, y de $4.36 a $5.71 por hora frente a configuraciones estándar de Pi.
Los investigadores desarrollaron inicialmente el sistema usando GPT-5.6 Sol y posteriormente lo trasladaron a Opus 5 de Anthropic sin modificaciones estructurales, manteniendo el 94,3 por ciento del rendimiento de referencia de Pi. Más allá de EdgeBench, SoL-Pi resolvió 15 de 63 tareas de CPU en Terminal-Bench 4 —en comparación con 18 resueltas por Codex y Pi estándar— con una reducción de costos del 25 por ciento. En tareas formales de verificación matemática en Lean 4 del benchmark IMO 2026, SoL-Pi resolvió tres de seis problemas al menor costo por tarea resuelta. Adicionalmente, un experimento de enjambre con 20 trabajadores SoL-Pi obtuvo los mejores resultados en optimización de kernels mientras reducía los costos en un 26,8 por ciento frente a un enjambre Pi de referencia.
La Demanda Industrial Aumenta a Medida que Crece la Sobrecarga de los Agentes
El desarrollo de SoL-Pi llega en un momento en que los equipos de software enfrentan costos en aumento impulsados por flujos de trabajo de agentes autónomos. El analista de OpenRouter, Peter Walker, señaló que el consumo de tokens por parte de los agentes ha aumentado 14 veces desde febrero de 2026, con casi el 70 por ciento de ese volumen proveniente de prompts almacenados en caché. El impacto estructural de los harness se destacó en una evaluación de agosto realizada por la empresa de herramientas Composio, que ejecutó DeepSeek V4 Flash en cuatro configuraciones de framework —incluyendo Claude Code y Oh My Pi— y descubrió que el costo por tarea resuelta variaba casi tres veces a pesar de usar exactamente el mismo modelo subyacente.
Sin embargo, el recorte agresivo de los harness presenta compromisos técnicos. Acortar las ventanas de contexto puede interrumpir la reutilización de la caché de prompts, compensando ocasionalmente los ahorros teóricos de tokens. Además, estudios independientes sobre compresión de contexto demuestran que los prompts condensados conservan en promedio solo el 17 por ciento de las instrucciones iniciales del usuario. Los diseños multi‑agente también encuentran límites de escalado; el desarrollador de Codex, Eric Provencher, advirtió recientemente que desplegar más de dos sub‑agentes casi siempre consume tokens sin mejorar la calidad del resultado, ya que los agentes gastan cómputo excesivo validando el trabajo de los demás. De cara al futuro, los investigadores de Nvidia proponen preentrenar los harness en amplias bibliotecas de tareas para lograr ganancias de eficiencia recursiva en sistemas venideros.

