AI RACE— 每日追蹤 AI 競爭賽局
Research

AI 寫程式代理能將照片轉為 3D 場景,卻難以評估自身成果的幾何精準度

馬里蘭大學與 AWS 研究人員推出 LEGO-Anything,揭示雖然寫程式代理能透過迭代從照片構建 3D Blender 場景,但其對幾何精確度的自我評估能力仍接近隨機猜測水準。

2026/10/03 15:31
AI viết code có thể biến ảnh chụp thành cảnh 3D nhưng lại bất lực trong việc tự đánh giá sản phẩm của mình

來自馬里蘭大學與 AWS 的研究團隊發表了 LEGO-Anything,這套架構利用人工智慧寫程式代理(Coding Agents),能將單張 2D 照片轉換為完全可編輯的 3D 場景。透過在 Blender 中逐步生成並執行程式碼,該系統能夠打造出具透明度且便於查詢的 3D 環境。

然而,該專案同步推出的全新基準測試揭露了一個根本瓶頸:儘管這些代理能撰寫出可運行的 3D 程式碼,卻難以評估重建結果在幾何上是否精準,甚至經常破壞自己先前的成果。

「圖像轉程式碼」架構與 LEGO-Bench

傳統的生成式 3D 流程通常直接輸出固定的網格(Mesh)或神經表徵。相比之下,LEGO-Anything 採用了「圖像轉程式碼(Image-to-Code)」典範。寫程式代理接收一張參考圖像後,會逐步為開源 3D 軟體 Blender 撰寫 Python 腳本。代理接著執行該程式碼、檢視渲染成果,並反覆修改腳本,直到合成的場景與輸入照片相符。由於最終輸出是可執行的程式,使用者可以直接修改物件、調整攝影機角度,或是檢視幾何佈局。

為了評估這個工作流程,研究團隊建立了基準測試 LEGO-Bench。由於真實世界照片缺乏精確的 3D 地面真值(Ground Truth),而基礎的合成環境又顯得過於虛假,因此 LEGO-Bench 採用了從 104 個由專業人士設計的室內與室外模擬器場景中渲染出的 208 張圖像,內含 443 個註冊資產。這項設計讓研究人員得以隱藏精確的幾何、深度與物件參數,並將其作為自動化評分標準。

該基準測試從三個維度對代理生成的場景進行評分:

  • 有效性(Validity): 程式碼是否能成功執行,並產生可用的 3D 場景成果。
  • 重建度(Reconstruction): 可見的 3D 幾何結構與地面真值的吻合精確度。
  • 外觀(Appearance): 重新渲染的場景與原始參考照片之間進行逐像素的視覺比對。

優勢、退化問題與隨機水準的判斷能力

在針對六種 GPT 設定進行的實驗中,所有模型都能穩定生成可運行的 Blender 場景。然而,結構精確度在不同模型與場景類型之間存在顯著差異。

表現最佳的模型 GPT-6 Astra 在室內環境獲得了 53.4% 的準確度分數,在室外環境則為 39.6%。表現較弱的設定則大幅落後,得分約為 15%。整體而言,複雜場景與室外空間的挑戰性顯著高於室內佈局。

增加模型的推理運算資源帶來了顯著的效能提升。在專門的辦公室測試子集中,當給予更多思考計算時間時,GPT-6 Astra 的得分從 32.3% 飆升至 61.8%。

儘管有所進步,研究人員仍在迭代編輯過程中發現了嚴重的缺陷。代理經常在初期嘗試時出現錯誤,或是進行了破壞先前成果的編輯。在記錄到的一個案例中,GPT-6 Astra 在生成流程的後段損壞了自己的場景,導致準確度分數從 33.9% 暴跌至 4.4%。

問題的根源在於空間評估能力:當被要求從兩個版本中選出哪一個更貼近參考圖像時,模型的幾何判斷能力降至接近甚至低於隨機猜測水準(Chance Level)。本質上,這些人工智慧代理無法辨別某次修改究竟是改善了 3D 佈局,還是摧毀了它。

利用 LEGO-Plugin 修正評估缺陷

為了解決代理視覺自我評估缺陷的問題,研究團隊開發了無需微調的外掛程式 LEGO-Plugin。該外掛程式將初始場景設定直接錨定至參考圖像,以確定性的測量數據取代代理的主觀視覺判斷,並防止退步性的編輯覆蓋正確的幾何結構。

LEGO-Plugin 提升了所有六種受測設定的輸出表現。較弱的代理獲得了最顯著的改善,進步幅度高達 62.7%。對於頂尖模型而言,該外掛程式也在其原本就很高的高基準線上,再提升了約兩個百分點。

下游應用與 3D 生態系

團隊同時也評估了這些以程式碼為基礎的 3D 重建成果,是否能在無需特定任務訓練的情況下協助下游的電腦視覺任務。由於這些場景是以程式化環境存在,系統能夠自動提取深度圖(Depth Maps)、分割遮罩(Segmentation Masks)和邊界框(Bounding Boxes)等資料。

重建後的場景帶來了切實可行的成果,但與專用視覺架構相比仍有差距:

  • 物件偵測: 達到了專用模型 DINO 約一半的效能。
  • 分割與深度估算: 與 SAM 3 和 Depth Anything 3 等專門工具相比,效能差距更為顯著。

研究人員指出,儘管程式碼驅動的 3D 生成是一個極具前景的方向,但要從「生成可運行的腳本」跨越到「實現幾何忠實度高的重建」,兩者之間仍有巨大鴻溝。

這項研究發表之際,正值更廣泛的人工智慧領域迅速轉向空間理解。人工智慧研究員 Yoav Artzi 指出,GPT-6 Astra 代表了空間推理的重大進展,這很可能得益於大量 3D 資料集(如 Blender 腳本)的訓練。與此同時,商業遊戲引擎也同步推進;Unity 近期推出了針對 Claude Code 與 OpenAI Codex 等寫程式助理的官方整合功能。其他研究團隊也正在探索非程式碼的替代方案,包括 World Labs 的 Atlas 世界模型,以及 Google DeepMind 利用影片模型進行深度估算與分割的 GenCeption。

◗ 參考來源

The Decoder10/03

相關文章