Agentes de IA programadores transformam fotos em cenas 3D, mas têm dificuldade para avaliar o próprio trabalho
Pesquisadores da Universidade de Maryland e da AWS apresentaram o LEGO-Anything, revelando que, embora agentes de codificação consigam construir cenas 3D no Blender a partir de fotos de forma iterativa, sua autoavaliação de precisão geométrica continua próxima ao nível do acaso.

Pesquisadores da Universidade de Maryland e da AWS revelaram o LEGO-Anything, um framework que utiliza agentes de IA programadores para converter uma única fotografia bidimensional em uma cena 3D totalmente editável. Ao gerar e executar código passo a passo no Blender, o sistema produz ambientes 3D transparentes e consultáveis.
No entanto, um novo benchmark desenvolvido para acompanhar o projeto revela um gargalo fundamental: embora os agentes consigam escrever código 3D funcional, eles têm dificuldade em avaliar se suas reconstruções são geometricamente precisas, frequentemente sabotando o próprio progresso.
A abordagem Image-to-Code e o LEGO-Bench
Os pipelines generativos 3D tradicionais costumam gerar malhas rígidas ou representações neurais diretamente. Em contrapartida, o LEGO-Anything adota o paradigma "Image-to-Code" (imagem para código). Um agente de codificação recebe uma única imagem de referência e escreve iterativamente scripts em Python para o Blender, o software 3D de código aberto. O agente executa o código, inspeciona o resultado renderizado e revisa o script até que a cena sintetizada se assemelhe à imagem de entrada. Como o resultado final é um programa executável, os usuários podem modificar objetos diretamente, ajustar ângulos de câmera ou inspecionar layouts geométricos.
Para avaliar esse fluxo de trabalho, a equipe de pesquisa criou o LEGO-Bench. Como fotos do mundo real não possuem uma verdade fundamental (ground truth) 3D precisa e ambientes sintéticos básicos parecem artificiais, o LEGO-Bench utiliza 208 imagens renderizadas a partir de 104 cenas de simuladores internas e externas projetadas profissionalmente, contando com 443 recursos registrados. Essa configuração permite que os pesquisadores ocultem a geometria exata, a profundidade e os parâmetros dos objetos para utilizá-los como um gabarito automatizado de pontuação.
O benchmark avalia as cenas geradas pelos agentes por meio de três métricas:
- Validade: Se o código é executado com sucesso e entrega um artefato de cena 3D utilizável.
- Reconstrução: O quão precisamente a geometria 3D visível corresponde ao ground truth.
- Aparência: Uma comparação visual pixel a pixel entre a cena renderizada novamente e a foto de referência original.
Pontos fortes, regressões e julgamentos ao nível do acaso
Ao longo de experimentos que testaram seis configurações de GPT, todos os modelos produziram cenas funcionais no Blender de forma confiável. No entanto, a precisão estrutural variou amplamente entre os modelos e os tipos de cena.
O modelo de melhor desempenho, o GPT-6 Astra, alcançou uma pontuação de precisão de 53,4% em ambientes internos e 39,6% em ambientes externos. Configurações mais fracas ficaram bem atrás, pontuando cerca de 15%. No geral, cenas complexas e espaços ao ar livre se mostraram significativamente mais difíceis do que layouts internos.
Aumentar o orçamento de raciocínio dos modelos levou a saltos notáveis de desempenho. Em um subconjunto dedicado a escritórios, a pontuação do GPT-6 Astra subiu de 32,3% para 61,8% quando recebeu mais tempo computacional para pensar.
Apesar desses ganhos, os pesquisadores identificaram falhas graves durante a edição iterativa. Frequentemente, os agentes faziam tentativas iniciais deficientes ou realizavam edições que desfaziam sucessos anteriores. Em um caso documentado, o GPT-6 Astra degradou a própria cena em uma etapa avançada do pipeline de geração, fazendo com que sua pontuação de precisão despencasse de 33,9% para 4,4%.
A raiz do problema reside na avaliação espacial: quando solicitados a escolher qual de duas versões correspondia mais fielmente à imagem de referência, os julgamentos geométricos dos modelos caíram para perto ou abaixo do nível do acaso. Em suma, os agentes de IA não conseguiam determinar se uma atualização havia melhorado ou arruinado o layout 3D.
Corrigindo a avaliação com o LEGO-Plugin
Para lidar com a autoavaliação visual falha dos agentes, os pesquisadores desenvolveram o LEGO-Plugin, um complemento que não exige ajuste fino (fine-tuning). O plugin ancora a configuração inicial da cena diretamente à imagem de referência, substitui o julgamento visual subjetivo do agente por medições determinísticas e impede que edições regressivas sobrescrevam uma geometria correta.
O LEGO-Plugin aprimorou os resultados em todas as seis configurações testadas. Os agentes mais fracos obtiveram as melhorias mais expressivas, com ganhos chegando a até 62,7%. Já para o modelo topo de linha, o plugin adicionou cerca de dois pontos percentuais à sua linha de base já elevada.
Aplicações downstream e o ecossistema 3D
A equipe também avaliou se as reconstruções 3D baseadas em código poderiam auxiliar em tarefas posteriores (downstream) de visão computacional sem a necessidade de treinamento específico para a tarefa. Como as cenas existem como ambientes programáticos, dados como mapas de profundidade, máscaras de segmentação e caixas delimitadoras podem ser extraídos automaticamente.
As cenas reconstruídas apresentaram resultados funcionais, embora ainda fiquem atrás de arquiteturas especializadas de visão:
- Detecção de Objetos: Alcançou aproximadamente metade do desempenho do modelo dedicado DINO.
- Segmentação e Estimativa de Profundidade: Apresentou diferenças de desempenho ainda maiores quando comparado a ferramentas especializadas como SAM 3 e Depth Anything 3.
Os pesquisadores observam que, embora a geração 3D orientada por código seja um caminho promissor, ainda existe uma lacuna substancial entre gerar um script executável e obter uma reconstrução geometricamente fiel.
As descobertas surgem em um momento no qual o setor de IA em geral se volta rapidamente para a compreensão espacial. O pesquisador de IA Yoav Artzi destacou que o GPT-6 Astra representa um avanço significativo no raciocínio espacial, provavelmente impulsionado pelo treinamento em extensos conjuntos de dados 3D, como scripts do Blender. Enquanto isso, motores de jogos comerciais avançam em paralelo; a Unity lançou recentemente integrações oficiais para assistentes de programação como o Claude Code e o OpenAI Codex. Outros grupos de pesquisa estão explorando alternativas que não dependem de código, incluindo o modelo de mundo Atlas, da World Labs, e o GenCeption, da Google DeepMind, que aproveita modelos de vídeo para lidar com estimativa de profundidade e segmentação.

