El costo de igualar el rendimiento de la IA de frontera se desploma hasta 13 veces al año
Investigaciones de Epoch AI y el MIT revelan que el precio para alcanzar puntuaciones fijas en benchmarks cae a un ritmo sin precedentes, impulsado por una combinación de avances algorítmicos, hardware más económico y una intensa competencia de mercado.

Los costos de los benchmarks de IA se desploman a un ritmo histórico
El costo de alcanzar hitos fijos de rendimiento en los principales benchmarks de inteligencia artificial está cayendo más rápido que el de cualquier tecnología transformadora anterior. Según hallazgos de Epoch AI, una organización de investigación que monitorea las tendencias de la IA, el precio para alcanzar un nivel determinado de capacidad en benchmarks seleccionados se ha reducido un promedio de un 47 % por trimestre desde 2023, lo que equivale a una reducción aproximada de 13 veces al año.
Un estudio paralelo realizado por investigadores del MIT, dirigido por Hans Gundlach, siguió tendencias comparables utilizando datos de la plataforma de evaluación de IA Artificial Analysis entre abril de 2024 y noviembre de 2025. El equipo del MIT observó que los costos disminuyeron entre 5 y 10 veces al año en un conjunto más amplio de modelos. Si bien estas cifras reflejan una caída en picada de los precios de mercado para replicar capacidades pasadas, los investigadores señalan que el costo de ejecutar los modelos más avanzados (state-of-the-art) en tareas complejas puede, en realidad, aumentar debido a las altas demandas computacionales de las arquitecturas de razonamiento más recientes.
El desglose: avance algorítmico, hardware y guerra de precios
La caída en los costos operativos para igualar los modelos de frontera anteriores es pronunciada. Epoch destacó el modelo o3 de OpenAI, que alcanzó un puntaje de precisión del 75 % en el benchmark científico de nivel doctoral GPQA Diamond a principios de 2025 a un costo estimado de 30 centavos por pregunta. En un plazo de 18 meses, un modelo de la familia GPT-5.6 logró la misma puntuación por solo 0,04 centavos por pregunta: una reducción de precio de 1/725. Para ilustrar la escala, Epoch señaló que si la fabricación de automóviles mejorara al mismo ritmo, un vehículo de 50.000 € caería a menos de 70 €. El lanzamiento de los modelos de menor costo GPT-6 Sol y Luna de OpenAI indica que el costo base sigue disminuyendo.
Sin embargo, los precios del mercado no reflejan únicamente las mejoras algorítmicas. Cuando los investigadores del MIT aislaron las dinámicas del mercado examinando modelos abiertos y eliminando el impacto del hardware más económico y de la agresiva competencia de precios, calcularon que la tasa subyacente de ganancias por pura eficiencia algorítmica se sitúa en torno a 3 veces por año. La cifra más alta de Epoch (13 veces) captura todo el entorno de mercado sin desglosar el hardware y los descuentos competitivos.
Además, obtener puntuaciones más altas en los benchmarks no siempre equivale a contar con sistemas más eficientes. El MIT descubrió que los modelos de razonamiento modernos suelen aumentar la precisión destinando cantidades significativas de cómputo adicional en tiempo de prueba (test-time compute) a los problemas, lo que incrementa la potencia de procesamiento y el costo por consulta, incluso mientras el precio base por token disminuye.
Cómputo en tiempo de prueba, 'benchmaxxing' y disyuntivas del mundo real
Las métricas divergentes ponen de relieve la creciente desconexión entre las puntuaciones brutas de los benchmarks y los costos prácticos de implementación. Dado que los resultados de los benchmarks compuestos combinan mejoras en datos, arquitectura, eficiencia de entrenamiento y cómputo en tiempo de prueba, los puntajes máximos pueden ocultar mayores gastos de ejecución. Los investigadores también se enfrentan al benchmaxxing, una práctica en la que los desarrolladores optimizan los sistemas específicamente para superar pruebas públicas. Epoch intentó tener esto en cuenta incorporando una prueba privada, "Mystery Game Puzzles"; los costos en ese benchmark disminuyeron al ritmo más lento de su muestra, lo que apunta a una menor optimización en pruebas no publicadas o a diferencias en los formatos de las tareas.
Para las empresas que adoptan estas tecnologías, la caída generalizada de precios no determina automáticamente la elección del modelo. Los requisitos operativos a menudo pesan más que las métricas de costo por token: modelos con grandes descuentos pero con una latencia significativa resultan inviables para chatbots de atención al cliente en tiempo real, mientras que los modelos de razonamiento lentos pueden generar cuellos de botella en los flujos de trabajo automatizados. Por el contrario, implementar un modelo de frontera más costoso puede traducirse en menores costos operativos totales si su precisión superior en el primer intento elimina la necesidad de realizar consultas repetidas y ciclos de corrección de errores.

