AI RACE— The AI Race
Research

写真から3Dシーンを生成できるAIコーディングエージェント、自身の成果物の評価には課題

メリーランド大学とAWSの研究チームが「LEGO-Anything」を発表。コーディングエージェントが写真からBlenderの3Dシーンを反復構築できる一方、幾何学的精度の自己評価は偶然確率レベルにとどまることが判明した。

2026/10/03 15:31
AI viết code có thể biến ảnh chụp thành cảnh 3D nhưng lại bất lực trong việc tự đánh giá sản phẩm của mình

メリーランド大学とAWSの研究者らは、AIコーディングエージェントを活用して1枚の2次元写真から完全に編集可能な3Dシーンを生成するフレームワーク「LEGO-Anything」を発表した。Blender内でコードをステップ・バイ・ステップで生成・実行することにより、透明性が高く、クエリ可能な3D環境を構築する。

しかし、同プロジェクトに伴って開発された新たなベンチマークにより、根本的なボトルネックが明らかになった。エージェントは機能的な3Dコードを記述できるものの、自身の再構成結果が幾何学的に正確かどうかを評価することが難しく、自らの進捗を損なってしまうケースが頻発するという。

「Image-to-Code」アプローチとLEGO-Bench

従来の生成型3Dパイプラインは、リジッドメッシュやニューラル表現を直接出力することが多い。対照的に、LEGO-Anythingは「Image-to-Code(画像からコードへ)」パラダイムを採用している。コーディングエージェントに1枚の参照画像を与えると、オープンソースの3DソフトウェアであるBlender向けのPythonスクリプトを反復的に記述する。エージェントはコードを実行し、レンダリングされた出力を確認したうえで、合成されたシーンが入力画像に近づくまでスクリプトを修正していく。最終出力が実行可能なプログラムであるため、ユーザーはオブジェクトを直接編集したり、カメラアングルを調整したり、幾何学的レイアウトを精査したりすることが可能だ。

このワークフローを評価するため、研究チームは「LEGO-Bench」を策定した。現実世界の写真には正確な3Dグラウンドトゥルース(正解データ)が存在せず、基本的な合成環境では不自然さが残るため、LEGO-Benchではプロが設計した104種類の屋内・屋外シミュレーターシーンからレンダリングされた208枚の画像(登録アセット数443点)を使用している。この構成により、正確なジオメトリ、深度、オブジェクトパラメータを隠蔽し、自動採点の正解キーとして活用できるようにしている。

同ベンチマークは、エージェントが生成したシーンを以下の3つの指標でスコア化する。

  • 妥当性(Validity): コードが正常に実行され、使用可能な3Dシーン成果物が得られるかどうか。
  • 再構成精度(Reconstruction): 目に見える3Dジオメトリがグラウンドトゥルースとどの程度正確に一致しているか。
  • 外観(Appearance): 再レンダリングされたシーンと元の参照写真とのピクセル単位の視覚的比較。

強み、性能低下、そして偶然確率レベルの判断力

6種類のGPT構成をテストした実験全体を通じて、すべてのモデルが一貫して機能するBlenderシーンを生成した。しかし、構造的な精度はモデルやシーンの種類によって大きく異なった。

最高性能を示したモデル「GPT-6 Astra」は、屋内環境で53.4パーセント、屋外環境で39.6パーセントの精度スコアを記録した。一方、下位の構成は大幅に遅れをとり、スコアは約15パーセントにとどまった。全体として、複雑なシーンや屋外空間は、屋内のレイアウトに比べて格段に難易度が高いことが示された。

モデルの推論バジェット(思考時間)を増やすと、顕著なパフォーマンス向上が見られた。専用のオフィスサブセットにおいて、GPT-6 Astraは思考のための計算時間を多く与えられた場合、スコアが32.3パーセントから61.8パーセントへと跳ね上がった。

こうした成果の一方で、研究チームは反復編集のプロセスにおける深刻な欠陥を特定した。エージェントは初回の試行で誤ったアプローチを取ったり、それまでの成果を壊してしまうような編集を実行したりすることが頻繁にあった。記録されたある事例では、GPT-6 Astraが生成パイプラインの終盤で自身のシーンを劣化させ、精度スコアが33.9パーセントから4.4パーセントへと急落した。

根本的な問題は空間評価にある。参照画像により忠実なのは2つのバージョンのうちどちらかを問われた際、モデルの幾何学的判断力は偶然確率(チャンスレベル)付近、あるいはそれを下回る水準まで低下した。要するに、AIエージェントは更新によって3Dレイアウトが改善されたのか、それとも改悪されたのかを判別できなかったのである。

LEGO-Pluginによる評価の修正

エージェントの不完全な視覚的自己評価に対処するため、研究者らはファインチューニングを必要としないアドオン「LEGO-Plugin」を開発した。このプラグインは、初期シーンのセットアップを参照画像に直接アンカー付けし、エージェントの主観的な視覚判断を決定論的な測定値に置き換えることで、精度の高いジオメトリが改悪な編集によって上書きされるのを防ぐ。

LEGO-Pluginの導入により、テストされた6つの構成すべてにおいて出力が改善した。下位のエージェントほど劇的な改善が見られ、最大で62.7パーセントの向上が記録された。最上位モデルにおいても、すでに高水準にあったベースラインから約2パーセントのスコア上積みが確認された。

ダウンストリームへの応用と3Dエコシステム

研究チームはまた、コードベースの3D再構成が、タスク固有のトレーニングを行うことなくダウンストリームのコンピュータビジョンタスクに寄与できるかどうかも評価した。シーンがプログラム可能な環境として存在するため、深度マップ、セグメンテーションマスク、バウンディングボックスといったデータを自動的に抽出できる。

再構成されたシーンは実用的な結果を示したものの、特化型のビジョンアーキテクチャには依然として及ばない。

  • 物体検出: 特化型モデル「DINO」の約半分の性能を記録。
  • セグメンテーションおよび深度推定: 「SAM 3」や「Depth Anything 3」といった専用ツールと比較して、より大きな性能差が見られた。

研究者らは、コード駆動型の3D生成は有望な方向性であるものの、実行可能なスクリプトを生成することと、幾何学的に忠実な再構成を達成することの間には依然として大きな隔たりがあると指摘している。

この研究成果は、AI業界全体が急速に空間認識へと軸足を移す中で発表された。AI研究者のYoav Artzi氏は、GPT-6 Astraが空間的推論において大きな前進を遂げていると指摘し、その背景にはBlenderスクリプトなど膨大な3Dデータセットを用いたトレーニングがあるとみている。一方で、商用ゲームエンジンも並行して進化を遂げており、Unityは最近、Claude CodeやOpenAI Codexといったコーディングアシスタントの公式統合を開始した。また、他の研究グループも非コード系のアプローチを模索しており、World Labsのワールドモデル「Atlas」や、動画モデルを活用して深度推定やセグメンテーションを処理するGoogle DeepMindの「GenCeption」などが開発されている。

関連記事

Research

中国製AIモデルが機微な質問を厳格に検閲し、蒸留先モデルへもバイアスが波及している実態が調査で判明

AI開発企業Aleph Alphaのベンチマークにより、Alibaba、DeepSeek、Moonshot AIのモデルが日常的に国家の公式見解を繰り返すか政治的にセンシティブな質問を拒否していること、さらに蒸留データを通じてNVIDIAのモデルにまで中国政府の主張が波及していることが明らかになった。

昨日