AI viết code có thể biến ảnh chụp thành cảnh 3D nhưng lại bất lực trong việc tự đánh giá sản phẩm của mình
Các nhà nghiên cứu từ Đại học Maryland và AWS vừa giới thiệu LEGO-Anything, cho thấy dù các AI agent lập trình có thể dựng cảnh 3D trên Blender từ ảnh chụp theo cơ chế lặp, khả năng tự đánh giá độ chính xác hình học của chúng lại gần như chỉ tương đương đoán mò.

Các nhà nghiên cứu đến từ Đại học Maryland và AWS vừa trình làng LEGO-Anything, một framework sử dụng các AI agent lập trình (coding agent) để chuyển đổi một bức ảnh 2D duy nhất thành một không gian 3D hoàn chỉnh và có thể chỉnh sửa tự do. Bằng cách tự động tạo và thực thi mã lệnh từng bước bên trong Blender, hệ thống này mang lại các môi trường 3D minh bạch và dễ dàng truy vấn dữ liệu.
Tuy nhiên, bộ benchmark mới được phát triển đi kèm dự án đã chỉ ra một điểm nghẽn cốt tử: dù các agent có thể viết code 3D chạy mượt mà, chúng lại rất chật vật trong việc đánh giá xem liệu mô hình tái tạo có chuẩn xác về mặt hình học hay không, thậm chí thường xuyên tự tay phá hỏng tiến trình của chính mình.
Hướng tiếp cận Image-to-Code và bộ benchmark LEGO-Bench
Các quy trình dựng 3D tạo sinh truyền thống thường xuất thẳng ra dạng lưới đa giác cứng (rigid mesh) hoặc biểu diễn mạng nơ-ron (neural representation). Ngược lại, LEGO-Anything áp dụng mô hình "Chuyển ảnh thành code" (Image-to-Code). Một AI agent lập trình sẽ nhận vào một ảnh tham chiếu duy nhất, sau đó viết lặp đi lặp lại các đoạn mã Python dành cho Blender — phần mềm đồ họa 3D mã nguồn mở phổ biến. Agent sẽ chạy code, kiểm tra kết quả render và liên tục sửa đổi script cho đến khi cảnh dựng tổng hợp trông tương đồng với ảnh gốc. Do sản phẩm đầu ra cuối cùng là một chương trình có thể thực thi, người dùng có thể trực tiếp can thiệp chỉnh sửa vật thể, đổi góc máy quay hay kiểm tra cấu trúc hình học.
Để đánh giá quy trình làm việc này, nhóm nghiên cứu đã xây dựng LEGO-Bench. Vì các bức ảnh chụp ngoài đời thực thiếu dữ liệu 3D chuẩn xác (ground truth) để đối chiếu, còn môi trường giả lập cơ bản lại quá thô cứng, LEGO-Bench đã sử dụng 208 hình ảnh được render từ 104 cảnh mô phỏng nội - ngoại thất do giới chuyên nghiệp thiết kế, bao gồm 443 tài nguyên (asset) đã được chuẩn hóa. Thiết lập này cho phép các nhà nghiên cứu ẩn đi các thông số chuẩn xác về hình học, độ sâu và vật thể để làm bộ đáp án chấm điểm tự động.
Hệ thống benchmark sẽ chấm điểm các cảnh do AI tạo ra dựa trên ba tiêu chí:
- Tính hợp lệ (Validity): Liệu mã nguồn có chạy thành công và tạo ra một sản phẩm cảnh 3D khả dụng hay không.
- Độ tái tạo (Reconstruction): Mức độ chính xác giữa cấu trúc hình học 3D nhìn thấy được so với dữ liệu chuẩn (ground truth).
- Diện mạo (Appearance): So sánh trực quan từng điểm ảnh (pixel) giữa cảnh được render lại với bức ảnh tham chiếu ban đầu.
Điểm sáng, sự thụt lùi và những phán đoán mang tính "may rủi"
Qua các thử nghiệm trên sáu cấu hình GPT khác nhau, tất cả các mô hình đều tạo ra được những cảnh Blender hoạt động tốt một cách ổn định. Tuy nhiên, độ chính xác về mặt cấu trúc lại có sự chênh lệch rất lớn giữa các mô hình và loại cảnh.
Mô hình đạt hiệu năng cao nhất, GPT-6 Astra, ghi nhận điểm độ chính xác 53,4% ở môi trường trong nhà và 39,6% ở môi trường ngoài trời. Các cấu hình yếu hơn xếp sau khá xa, chỉ đạt quanh mức 15%. Nhìn chung, các bối cảnh phức tạp và không gian ngoài trời luôn làm khó AI hơn nhiều so với không gian nội thất.
Việc tăng dung lượng tài nguyên tính toán cho suy luận (reasoning budget) mang lại bước nhảy vọt đáng kể về hiệu năng. Trên một tập dữ liệu thử nghiệm riêng biệt về không gian văn phòng, điểm số của GPT-6 Astra đã tăng từ 32,3% lên 61,8% khi được cấp thêm thời gian để "suy nghĩ".
Dẫu có những bước tiến này, các nhà nghiên cứu đã phát hiện ra những lỗ hổng nghiêm trọng trong quá trình chỉnh sửa lặp lại. Các agent thường đưa ra những phác thảo ban đầu sai sót, hoặc thực hiện những bước sửa đổi vô tình phá hủy luôn các kết quả dựng đúng trước đó. Trong một trường hợp được ghi nhận, GPT-6 Astra đã tự làm hỏng cảnh của mình ở giai đoạn cuối của pipeline tạo sinh, khiến điểm chính xác tụt dốc không phanh từ 33,9% xuống chỉ còn 4,4%.
Gốc rễ của vấn đề nằm ở khả năng đánh giá không gian: khi được yêu cầu chọn xem phiên bản nào trong hai bản dựng khớp với ảnh tham chiếu hơn, khả năng phán đoán hình học của mô hình giảm xuống mức ngang ngửa đoán mò (chance level), thậm chí còn thấp hơn. Về cơ bản, các AI agent không thể phân định được liệu một chỉnh sửa vừa thực hiện đang giúp cải thiện hay thực chất là phá nát bố cục 3D.
Cứu cánh đánh giá bằng LEGO-Plugin
Nhằm khắc phục điểm yếu tự đánh giá thị giác của các agent, nhóm nghiên cứu đã phát triển LEGO-Plugin, một tiện ích bổ sung không đòi hỏi phải tinh chỉnh mô hình (fine-tuning). Plugin này neo trực tiếp thiết lập cảnh ban đầu vào ảnh tham chiếu, thay thế phán đoán thị giác chủ quan của agent bằng các phép đo mang tính tất định (deterministic), đồng thời ngăn chặn các sửa đổi thụt lùi ghi đè lên các cấu trúc hình học đã chuẩn xác.
LEGO-Plugin đã giúp nâng cao chất lượng đầu ra trên toàn bộ sáu cấu hình được thử nghiệm. Các agent thuộc nhóm yếu ghi nhận mức cải thiện ấn tượng nhất, với mức tăng lên tới 62,7%. Đối với mô hình hàng đầu, plugin cũng đóng góp thêm khoảng 2 điểm phần trăm vào mức nền tảng vốn đã rất cao của nó.
Ứng dụng hạ nguồn và Hệ sinh thái 3D
Nhóm nghiên cứu cũng đánh giá xem liệu các mô hình 3D dựng bằng code này có thể hỗ trợ các tác vụ thị giác máy tính hạ nguồn (downstream) mà không cần huấn luyện chuyên biệt hay không. Nhờ tồn tại dưới dạng môi trường lập trình được, các dữ liệu như bản đồ độ sâu (depth map), mặt nạ phân đoạn (segmentation mask) và hộp giới hạn (bounding box) đều có thể được trích xuất hoàn toàn tự động.
Các cảnh tái tạo đã mang lại kết quả khả dụng, dẫu vậy vẫn còn khoảng cách so với các kiến trúc thị giác chuyên dụng:
- Phát hiện vật thể (Object Detection): Đạt hiệu năng xấp xỉ một nửa so với mô hình chuyên dụng DINO.
- Phân đoạn hình ảnh và ước tính độ sâu: Khoảng cách hiệu năng nới rộng hơn khi đặt cạnh các công cụ chuyên trách như SAM 3 và Depth Anything 3.
Các nhà nghiên cứu lưu ý rằng dù tạo sinh 3D dựa trên code là một hướng đi đầy hứa hẹn, khoảng cách giữa việc tạo ra một đoạn script chạy được với việc đạt được một bản dựng tái tạo trung thực về mặt hình học vẫn còn rất lớn.
Những phát hiện này xuất hiện ngay giữa thời điểm toàn ngành AI đang chuyển dịch mạnh mẽ sang năng lực hiểu không gian (spatial understanding). Nhà nghiên cứu AI Yoav Artzi nhận định rằng GPT-6 Astra đánh dấu một bước tiến lớn trong tư duy không gian, nhiều khả năng nhờ vào việc được đào tạo trên các tập dữ liệu 3D quy mô lớn như các script Blender. Trong khi đó, các engine game thương mại cũng đang có những bước đi song hành; Unity gần đây đã chính thức tung ra các tích hợp cho các trợ lý lập trình như Claude Code và OpenAI Codex. Nhiều nhóm nghiên cứu khác lại theo đuổi các giải pháp không dùng code, tiêu biểu như mô hình thế giới Atlas của World Labs hay GenCeption từ Google DeepMind – vốn tận dụng các mô hình video để xử lý ước tính độ sâu và phân đoạn hình ảnh.

