Custo para igualar o desempenho de IAs de ponta despenca até 13 vezes ao ano
Pesquisas da Epoch AI e do MIT revelam que o preço para atingir pontuações fixas em benchmarks está caindo a um ritmo sem precedentes, impulsionado por avanços algorítmicos, hardware mais barato e forte concorrência de mercado.

Custos de benchmarks de IA despencam em ritmo histórico
O custo para atingir marcos fixos de desempenho nos principais benchmarks de inteligência artificial está caindo mais rápido do que o de qualquer tecnologia transformadora anterior. De acordo com descobertas da Epoch AI, organização de pesquisa que monitora tendências em IA, o preço para alcançar um determinado nível de capacidade em benchmarks selecionados caiu, em média, 47% por trimestre desde 2023 — o que equivale a uma redução de aproximadamente 13 vezes ao ano.
Um estudo paralelo feito por pesquisadores do MIT, liderado por Hans Gundlach, acompanhou tendências semelhantes usando dados da plataforma de avaliação de IA Artificial Analysis entre abril de 2024 e novembro de 2025. A equipe do MIT observou que os custos caíram entre 5x e 10x anualmente em um conjunto mais amplo de modelos. Embora esses números reflitam uma queda vertiginosa nos preços de mercado para replicar capacidades anteriores, os pesquisadores alertam que o custo para rodar os modelos mais avançados do estado da arte em tarefas complexas pode, na verdade, aumentar, devido às pesadas demandas computacionais das novas arquiteturas de raciocínio.
Entendendo o progresso algorítmico, o hardware e a guerra de preços
A redução nos custos operacionais para igualar antigos modelos de fronteira é drástica. A Epoch destacou o modelo o3 da OpenAI, que alcançou uma precisão de 75% no benchmark científico de nível de doutorado GPQA Diamond no início de 2025, a um custo estimado de 30 centavos por pergunta. Em 18 meses, um modelo da família GPT-5.6 atingiu a mesma pontuação por apenas 0,04 centavo por pergunta — uma redução de preço de 1/725. Para ilustrar a dimensão dessa mudança, a Epoch observou que, se a fabricação de automóveis evoluísse no mesmo ritmo, o preço de um veículo de € 50.000 cairia para menos de € 70. O lançamento dos modelos mais acessíveis GPT-6 Sol e Luna, da OpenAI, indica que o custo-base continua em queda livre.
No entanto, os preços de mercado não refletem apenas os aprimoramentos algorítmicos. Quando os pesquisadores do MIT isolaram a dinâmica mercadológica ao analisar modelos abertos e desconsiderar o impacto de hardwares mais baratos e da concorrência agressiva de preços, calcularam que a taxa subjacente de ganhos reais de eficiência algorítmica é de cerca de 3x ao ano. O número mais expressivo de 13x apontado pela Epoch capta o cenário de mercado como um todo, sem separar o avanço do hardware dos descontos competitivos.
Além disso, pontuações mais altas em benchmarks nem sempre significam sistemas mais enxutos. O MIT identificou que os modelos de raciocínio modernos costumam aumentar sua precisão aplicando volumes substanciais de computação adicional no momento da inferência (test-time compute) aos problemas, o que eleva a exigência de processamento e o custo por consulta, mesmo com a queda no preço-base dos tokens.
Test-Time Compute, 'Benchmaxxing' e os trade-offs do mundo real
A divergência entre as métricas evidencia um descompasso crescente entre as pontuações brutas em benchmarks e os custos práticos de implementação. Como os resultados consolidados dessas avaliações combinam melhorias em dados, arquitetura, eficiência de treinamento e computação no momento do teste, pontuações de ponta podem mascarar despesas operacionais consideravelmente maiores. Os pesquisadores também enfrentam o "benchmaxxing", prática em que desenvolvedores otimizam sistemas especificamente para se saírem bem em testes públicos. A Epoch tentou contornar esse efeito incluindo um teste privado, o "Mystery Game Puzzles"; os custos nesse benchmark caíram no ritmo mais lento de toda a amostra, sugerindo menor otimização prévia em testes não públicos ou diferenças no formato das tarefas.
Para as empresas, as quedas generalizadas de preço não determinam automaticamente a escolha de um modelo. Muitas vezes, exigências operacionais pesam mais do que métricas de custo por token: modelos extremamente baratos, mas com alta latência, são inviáveis para chatbots de suporte em tempo real, enquanto modelos de raciocínio lentos podem sobrecarregar pipelines automatizados. Por outro lado, implementar um modelo de ponta mais caro pode resultar em custos operacionais totais menores se sua precisão logo na primeira tentativa eliminar consultas repetidas e ciclos de correção de erros.

