AI 코딩 에이전트, 사진을 3D 장면으로 변환하지만 자체 평가 능력은 한계
메릴랜드 대학교와 AWS 연구진이 공개한 'LEGO-Anything' 연구에 따르면, 코딩 에이전트가 사진을 바탕으로 Blender 3D 장면을 반복 구축할 수는 있으나 기하학적 정확도에 대한 자체 평가는 무작위 추측 수준에 머무는 것으로 나타났다.

메릴랜드 대학교(University of Maryland)와 AWS 연구진이 AI 코딩 에이전트를 활용해 한 장의 2차원 사진을 완전히 편집 가능한 3D 장면으로 변환하는 프레임워크인 'LEGO-Anything'을 공개했다. 이 시스템은 Blender 내에서 코드를 단계별로 생성하고 실행함으로써 투명하고 쿼리 가능한(queryable) 3D 환경을 구축한다.
그러나 이 프로젝트와 함께 개발된 새로운 벤치마크에서는 근본적인 병목 현상이 드러났다. 에이전트가 기능적으로 동작하는 3D 코드를 작성할 수는 있지만, 재구성된 결과물이 기하학적으로 정확한지 스스로 평가하는 데 어려움을 겪으며 종종 작업 성과를 스스로 망친다는 점이다.
'이미지 투 코드' 접근법과 LEGO-Bench
기존의 생성형 3D 파이프라인은 주로 고정된 메시(mesh)나 신경망 표현(neural representation)을 직접 출력하는 방식을 취했다. 반면 LEGO-Anything은 '이미지 투 코드(Image-to-Code)' 패러다임을 채택했다. 코딩 에이전트는 한 장의 참조 이미지를 입력받아 오픈소스 3D 소프트웨어인 Blender용 Python 스크립트를 반복해서 작성한다. 에이전트는 코드를 실행하고, 렌더링된 결과물을 점검한 뒤, 합성된 장면이 입력 이미지와 유사해질 때까지 스크립트를 수정한다. 최종 출력물이 실행 가능한 프로그램 형태이므로 사용자는 오브젝트를 직접 수정하거나 카메라 각도를 조절하고, 기하학적 배치를 점검할 수 있다.
이러한 워크플로를 평가하기 위해 연구팀은 'LEGO-Bench'를 구축했다. 실제 사진은 정밀한 3D 정답 데이터(ground truth)가 부족하고, 단순 합성 환경은 부자연스럽다는 한계가 있다. 이에 LEGO-Bench는 443개의 등록된 에셋이 포함된 전문적으로 설계된 104개의 실내외 시뮬레이터 장면에서 렌더링한 208개의 이미지를 활용한다. 연구진은 이를 통해 정확한 지오메트리, 깊이(depth), 객체 파라미터를 숨겨두고 자동 채점 기준으로 활용할 수 있도록 구성했다.
이 벤치마크는 에이전트가 생성한 장면을 세 가지 지표로 평가한다.
- 유효성(Validity): 코드가 성공적으로 실행되어 사용 가능한 3D 장면 결과물을 도출하는지 여부.
- 재구성(Reconstruction): 가시적인 3D 지오메트리가 정답 데이터와 얼마나 정밀하게 일치하는지 여부.
- 외형(Appearance): 다시 렌더링된 장면과 원본 참조 사진 간의 픽셀 단위 시각적 비교.
강점, 성능 퇴행, 그리고 찍기 수준의 판단력
6가지 GPT 구성을 테스트한 실험 전반에서 모든 모델이 정상 작동하는 Blender 장면을 안정적으로 생성해냈다. 그러나 구조적 정밀도는 모델과 장면 유형에 따라 큰 차이를 보였다.
최고 성능을 기록한 모델인 GPT-6 Astra는 실내 환경에서 53.4%, 실외 환경에서 39.6%의 정확도 점수를 기록했다. 성능이 떨어지는 구성 모델들은 약 15%를 기록하며 크게 뒤처졌다. 전반적으로 복잡한 장면과 실외 공간은 실내 배치보다 훨씬 더 높은 난이도를 보였다.
모델의 추론 예산(reasoning budget)을 늘리자 눈에 띄는 성능 향상이 나타났다. 오피스 환경을 다룬 특정 하위 데이터셋에서 GPT-6 Astra는 생각할 수 있는 연산 시간이 더 주어졌을 때 점수가 32.3%에서 61.8%로 급등했다.
이러한 성과에도 불구하고 연구진은 반복 편집 과정에서 심각한 결함을 발견했다. 에이전트가 초기에 잘못된 시도를 하거나, 앞서 거둔 성과를 무너뜨리는 방향으로 편집을 진행하는 경우가 빈번했다. 한 기록 사례에서는 GPT-6 Astra가 생성 파이프라인 후반부에 스스로 장면 품질을 떨어뜨려 정확도 점수가 33.9%에서 4.4%로 급락하기도 했다.
근본적인 문제는 공간 평가 능력에 있었다. 두 가지 버전 중 참조 이미지와 더 잘 일치하는 것을 고르라는 질문을 받았을 때, 모델의 기하학적 판단 능력은 무작위 추측(chance level) 수준이나 그 이하로 떨어졌다. 사실상 AI 에이전트는 자신의 수정 작업이 3D 레이아웃을 개선했는지 아니면 망쳤는지조차 구분하지 못했던 셈이다.
LEGO-Plugin을 통한 평가 문제 해결
에이전트의 불완전한 시각적 자체 평가를 해결하기 위해 연구진은 파인튜닝이 필요 없는 애드온인 'LEGO-Plugin'을 개발했다. 이 플러그인은 초기 장면 설정을 참조 이미지에 직접 고정(anchor)하고, 에이전트의 주관적인 시각 판단을 결정론적 측정값으로 대체하며, 퇴행적인 수정이 정확한 지오메트리를 덮어쓰지 못하도록 방지한다.
LEGO-Plugin은 테스트된 6개 구성 모두에서 결과물을 개선했다. 상대적으로 성능이 낮았던 에이전트들에서 가장 극적인 개선이 나타나 최대 62.7%의 성능 향상을 기록했다. 최상위 모델의 경우 이미 높았던 기준치에서 약 2%포인트 추가 향상되었다.
다운스트림 응용 분야와 3D 생태계
연구팀은 특정 작업별 학습 없이도 코드 기반의 3D 재구성이 다운스트림 컴퓨터 비전 작업을 지원할 수 있는지 여부도 평가했다. 장면이 프로그래밍된 환경으로 존재하기 때문에 뎁스 맵(depth map), 세그멘테이션 마스크, 바운딩 박스 등의 데이터를 자동으로 추출할 수 있다.
재구성된 장면들은 실제로 기능하는 결과를 냈으나, 여전히 전문 비전 아키텍처에는 미치지 못했다.
- 객체 감지(Object Detection): 전용 모델인 DINO 성능의 약 절반 수준을 달성했다.
- 세그멘테이션 및 깊이 추정(Segmentation and Depth Estimation): SAM 3 및 Depth Anything 3과 같은 특화 도구와 비교했을 때 더 큰 성능 격차를 보였다.
연구진은 코드 기반 3D 생성이 유망한 방향이긴 하지만, 실행 가능한 스크립트를 작성하는 것과 기하학적으로 충실한 재구성을 달성하는 것 사이에는 여전히 상당한 격차가 존재한다고 지적했다.
이번 연구 결과는 AI 업계 전반이 공간 이해(spatial understanding)로 급격히 방향을 틀고 있는 시점에 발표되었다. AI 연구자 요아브 아르치(Yoav Artzi)는 GPT-6 Astra가 공간 추론 능력에서 상당한 진전을 보여주었으며, 이는 Blender 스크립트 등 방대한 3D 데이터셋 학습 덕분일 가능성이 높다고 언급했다. 한편 상용 게임 엔진 진영도 발맞춰 움직이고 있다. Unity는 최근 Claude Code 및 OpenAI Codex 같은 코딩 어시스턴트를 위한 공식 연동 기능을 출시했다. 다른 연구 그룹들 역시 비(非)코드 대안을 모색 중이며, 여기에는 World Labs의 Atlas 세계 모델과 비디오 모델을 활용해 깊이 추정 및 세그멘테이션을 수행하는 Google DeepMind의 GenCeption 등이 포함된다.

