AI RACE— Cuộc đua AI
Nghiên cứu

Hệ thống SoL‑Pi của Nvidia giảm tới nửa lượng token tiêu thụ của các agent lập trình nhờ tối ưu “harness”

Nghiên cứu mới của Nvidia giới thiệu SoL‑Pi, một khung tự động tinh chỉnh lớp điều khiển (harness) của các agent mã nguồn, cắt giảm 44‑49 % token sử dụng mà vẫn duy trì hiệu năng gần như không thay đổi.

17:30 26/09/2026
Hệ thống SoL‑Pi của Nvidia giảm tới nửa lượng token tiêu thụ của các agent lập trình nhờ tối ưu “harness”

Tin tức chính

Nvidia công bố một hệ thống mới mang tên SoL‑Pi (Self‑Optimizing Layer‑Pi) có khả năng tự động tối ưu lớp điều khiển – hay còn gọi là “harness” – của các agent lập trình như Codex, Claude Code hay OpenClaw. Nhờ vào việc giảm thiểu lượng token tiêu thụ, SoL‑Pi tiết kiệm gần một nửa chi phí tính toán so với các hệ thống hiện hành, trong khi hiệu năng vẫn duy trì ở mức tương đương.

Chi tiết kỹ thuật và kết quả

  • Cách hoạt động: SoL‑Pi triển khai một agent nghiên cứu, theo dõi các trace (dòng thực thi) của một agent khác, đề xuất các thay đổi cho harness và chỉ giữ lại những thay đổi không làm giảm hiệu năng. Quy trình này dựa trên nguyên tắc cải thiện tự động lặp lại (recursive self‑improvement) và tách riêng phần phản hồi tìm kiếm khỏi giai đoạn đánh giá cuối cùng.
  • Quy mô thử nghiệm: Hệ thống đã khám phá 152 hướng tối ưu trong 535 môi trường thực thi, bao gồm 495 nhiệm vụ lấy từ các cặp issue‑pull‑request trên GitHub và 40 trường hợp kiểm tra tổng hợp. Tổng cộng, hơn 3.000 lần chạy và hơn 60.000 tương tác agent‑môi trường đã được thực hiện.
  • Bốn cơ chế tiết kiệm:
  1. Action Fusion: gộp hai bước liên tiếp (ví dụ: chỉnh sửa mã + chạy test) thành một lời gọi mô hình duy nhất.
  2. Online Context Compact: rút gọn ngữ cảnh sau mỗi bước lập kế hoạch mà không mất thông tin quan trọng.
  3. ObservationPack: lưu trữ đầu ra công cụ dài và chỉ đưa vào một bản tóm tắt ngắn trong các bước sau.
  4. Evidence‑Preserving Reducer: chuyển các log lỗi và test lớn sang mô hình rẻ hơn để tóm tắt, đồng thời có bước kiểm chứng tự động để không bỏ sót thông tin quan trọng.
  • Kết quả trên EdgeBench (51 nhiệm vụ công khai):
  • Khi kết hợp cả bốn cơ chế, SoL‑Pi giảm 49 % token và đạt 93,7 % điểm số so với harness gốc Pi.
  • Khi chỉ dùng một cơ chế mạnh nhất, điểm số thậm chí vượt Pi lên 5,3 % đồng thời vẫn tiết kiệm token.
  • Tổng mức giảm token dao động từ 44,7 % đến 49 %, chi phí tính toán giảm từ 1 339 USD xuống 894 USD, tương đương tiết kiệm 8,75‑13,50 USD/giờ so với Codex/Claude Code và 4,36‑5,71 USD/giờ so với Pi.
  • Kiểm chứng trên mô hình khác: Khi áp dụng SoL‑Pi lên Opus 5 (dựa trên GPT‑5.6 Sol) mà không thay đổi gì, hệ thống vẫn giữ 94,3 % hiệu năng của Pi và mang lại mức tiết kiệm tương tự, dù các cơ chế được kích hoạt ít hơn.
  • Các benchmark phụ:
  • Trên Terminal‑Bench 4 (63 nhiệm vụ CPU) SoL‑Pi giải quyết 15 nhiệm vụ, so với 18 của Codex và Pi, nhưng chi phí vẫn thấp hơn khoảng 25 % so với Pi.
  • Trong các bài toán Lean 4 của IMO 2026, SoL‑Pi giải quyết 3/6 vấn đề với chi phí thấp nhất trên mỗi bài.
  • Thử nghiệm tối ưu kernel với bầy 20 worker SoL‑Pi cho thấy chi phí giảm 26,8 % so với bầy worker Pi.

Bối cảnh và triển vọng

Việc tối ưu “harness” đang trở thành một hướng đi mới để giảm chi phí chạy các agent AI, khi mà chi phí token đã tăng gấp 14 lần kể từ tháng 2/2026 và tới 70 % nguồn chi phí đến từ các prompt được lưu trong bộ nhớ cache. Các công cụ như Composio đã chứng minh rằng, ngay cả khi sử dụng cùng một mô hình (ví dụ Deepseek V4 Flash), chi phí mỗi nhiệm vụ hoàn thành có thể chênh lệch tới ba lần tùy thuộc vào cách harness được thiết kế. SoL‑Pi cho thấy tiềm năng giảm đáng kể chi phí mà không cần thay đổi mô hình nền tảng, mở ra khả năng “tiền huấn luyện” (pre‑training) cho harness trên quy mô lớn—một ý tưởng mà các tác giả mô tả là “recursive efficiency improvement”. Tuy nhiên, việc nén ngữ cảnh có thể làm mất đi một phần chỉ dẫn của người dùng (trung bình chỉ 17 % được bảo toàn) và việc sử dụng nhiều agent phụ đồng thời cũng làm tăng chi phí mà không cải thiện chất lượng. Vì vậy, việc cân bằng giữa tiết kiệm token và duy trì độ tin cậy vẫn là thách thức cần giải quyết trong các giai đoạn tiếp theo.

◗ Nguồn

The Decoder26-09

Tin liên quan