AI RACE— La carrera de la IA
Research

Los agentes de programación con IA pueden convertir fotos en escenas 3D, pero les cuesta evaluar su propio trabajo

Investigadores de la Universidad de Maryland y AWS presentaron LEGO-Anything, revelando que, aunque los agentes de programación pueden construir escenas 3D en Blender a partir de fotos de forma iterativa, su autoevaluación de la precisión geométrica sigue estando cerca del nivel del azar.

03/10/2026, 15:31
AI viết code có thể biến ảnh chụp thành cảnh 3D nhưng lại bất lực trong việc tự đánh giá sản phẩm của mình

Investigadores de la Universidad de Maryland y AWS han presentado LEGO-Anything, un framework que utiliza agentes de programación con IA para convertir una sola fotografía bidimensional en una escena 3D totalmente editable. Al generar y ejecutar código paso a paso en Blender, el sistema produce entornos 3D transparentes y consultables.

Sin embargo, un nuevo benchmark desarrollado junto con el proyecto revela un cuello de botella fundamental: aunque los agentes pueden escribir código 3D funcional, les cuesta evaluar si sus reconstrucciones son geométricamente precisas, saboteando a menudo su propio progreso.

El enfoque «Image-to-Code» y LEGO-Bench

Los pipelines tradicionales de generación 3D suelen producir mallas rígidas o representaciones neuronales de forma directa. En contraste, LEGO-Anything adopta un paradigma de «Image-to-Code» (de imagen a código). A un agente de programación se le proporciona una única imagen de referencia y, de manera iterativa, escribe scripts en Python para Blender, el software 3D de código abierto. El agente ejecuta el código, inspecciona el resultado renderizado y revisa el script hasta que la escena sintetizada se asemeje a la entrada. Dado que el resultado final es un programa ejecutable, los usuarios pueden modificar objetos directamente, ajustar los ángulos de cámara o inspeccionar las distribuciones geométricas.

Para evaluar este flujo de trabajo, el equipo de investigación creó LEGO-Bench. Debido a que las fotos del mundo real carecen de una verdad fundamental (ground truth) 3D precisa y los entornos sintéticos básicos lucen artificiales, LEGO-Bench utiliza 208 imágenes renderizadas a partir de 104 escenas de simulación profesionales en interiores y exteriores, que cuentan con 443 elementos registrados. Esta configuración permite a los investigadores ocultar la geometría exacta, la profundidad y los parámetros de los objetos para utilizarlos como una clave de puntuación automatizada.

El benchmark evalúa las escenas generadas por los agentes mediante tres métricas:

  • Validez: Si el código se ejecuta con éxito y genera un artefacto de escena 3D utilizable.
  • Reconstrucción: Qué tan precisamente coincide la geometría 3D visible con el ground truth.
  • Apariencia: Una comparación visual píxel por píxel entre la escena renderizada nuevamente y la foto de referencia original.

Fortalezas, regresiones y juicios a nivel de azar

A lo largo de los experimentos que evaluaron seis configuraciones de GPT, todos los modelos produjeron de manera confiable escenas funcionales en Blender. Sin embargo, la precisión estructural varió enormemente según el modelo y el tipo de escena.

El modelo con mejor rendimiento, GPT-6 Astra, logró una puntuación de precisión del 53,4 % en entornos interiores y del 39,6 % en exteriores. Las configuraciones más débiles quedaron muy por detrás, situándose alrededor del 15 %. En general, las escenas complejas y los espacios exteriores resultaron significativamente más difíciles que las distribuciones en interiores.

Aumentar el presupuesto de razonamiento de los modelos generó mejoras notables en el rendimiento. En un subconjunto específico de oficinas, la puntuación de GPT-6 Astra subió del 32,3 % al 61,8 % cuando se le dio más tiempo de cómputo para pensar.

A pesar de estos avances, los investigadores identificaron fallos graves durante la edición iterativa. Con frecuencia, los agentes realizaban intentos iniciales defectuosos o ejecutaban modificaciones que arruinaban los aciertos previos. En un caso documentado, GPT-6 Astra degradó su propia escena en una fase avanzada del pipeline de generación, provocando que su puntuación de precisión se desplomara del 33,9 % al 4,4 %.

El problema de fondo radica en la evaluación espacial: cuando se les pedía elegir cuál de dos versiones coincidía mejor con la imagen de referencia, los juicios geométricos de los modelos cayeron cerca o por debajo del nivel del azar. En esencia, los agentes de IA no podían determinar si una actualización mejoraba o arruinaba la distribución 3D.

Corrigiendo la evaluación con LEGO-Plugin

Para solucionar la deficiente autoevaluación visual de los agentes, los investigadores desarrollaron LEGO-Plugin, un complemento que no requiere ajuste fino (fine-tuning). El plugin ancla la configuración inicial de la escena directamente a la imagen de referencia, sustituye el juicio visual subjetivo del agente por mediciones deterministas y evita que las modificaciones regresivas sobrescriban una geometría precisa.

LEGO-Plugin mejoró los resultados en las seis configuraciones evaluadas. Los agentes más débiles experimentaron las mejoras más drásticas, con incrementos de hasta el 62,7 %. En el caso del modelo de gama más alta, el plugin añadió aproximadamente dos puntos porcentuales a su ya elevada línea base.

Aplicaciones derivadas y el ecosistema 3D

El equipo también evaluó si las reconstrucciones 3D basadas en código podían asistir en tareas posteriores (downstream) de visión artificial sin necesidad de entrenamiento específico para cada tarea. Debido a que las escenas existen como entornos programáticos, datos como mapas de profundidad, máscaras de segmentación y cuadros delimitadores (bounding boxes) pueden extraerse automáticamente.

Las escenas reconstruidas ofrecieron resultados operativos, aunque todavía se quedan atrás frente a arquitecturas de visión especializadas:

  • Detección de objetos: Logró aproximadamente la mitad del rendimiento del modelo dedicado DINO.
  • Segmentación y estimación de profundidad: Mostró brechas de rendimiento más amplias al compararse con herramientas especializadas como SAM 3 y Depth Anything 3.

Los investigadores señalan que, si bien la generación 3D basada en código es una dirección prometedora, aún existe una brecha sustancial entre generar un script ejecutable y lograr una reconstrucción geométricamente fiel.

Estos hallazgos llegan en un momento en que el sector de la IA en general gira rápidamente hacia la comprensión espacial. El investigador de IA Yoav Artzi señaló que GPT-6 Astra representa un paso significativo en el razonamiento espacial, probablemente facilitado por el entrenamiento con extensos conjuntos de datos en 3D, como scripts de Blender. Mientras tanto, los motores de videojuegos comerciales avanzan en paralelo; Unity lanzó recientemente integraciones oficiales para asistentes de programación como Claude Code y OpenAI Codex. Otros grupos de investigación están explorando alternativas no basadas en código, entre ellas el modelo de mundo Atlas de World Labs y GenCeption de Google DeepMind, que aprovecha modelos de video para realizar la estimación de profundidad y la segmentación.

◗ Fuentes

The Decoder3/10

Historias relacionadas