AI RACE— Cuộc đua AI
Model mới

OpenAI nâng cấp cơ chế Prompt Caching cho GPT-6: Tiết kiệm tới 90% chi phí và tăng tốc AI Agent

OpenAI vừa ra mắt hệ thống Prompt Caching cải tiến dành cho dòng mô hình GPT-6, giúp các AI Agent vận hành liên tục giảm tới 90% chi phí token đầu vào cùng bộ công cụ chẩn đoán chuyên sâu cho lập trình viên.

04:00 23/09/2026
Model mới

Nâng cấp bộ nhớ đệm prompt cho thế hệ GPT-6

OpenAI vừa công bố bản nâng cấp lớn cho cơ chế lưu tạm câu lệnh (prompt caching) dành riêng cho hệ sinh thái GPT-6. Tính năng này được thiết kế để giải quyết điểm nghẽn lớn nhất của các AI Agent vận hành liên tục (persistent agents): việc phải gửi đi gửi lại cùng một lượng ngữ cảnh khổng lồ qua từng lượt gọi API.

Với kiến trúc GPT-6, các tác vụ dài hơi kéo dài hàng giờ như tái cấu trúc mã nguồn phức tạp hay nghiên cứu tài liệu chuyên sâu đòi hỏi các cuộc gọi API liên tiếp mang theo cùng chỉ dẫn, định nghĩa công cụ và dữ liệu nền tảng. Hệ thống bộ nhớ đệm mới của OpenAI mặc định tăng tỷ lệ trúng bộ nhớ đệm (cache hit rate), áp dụng mức giảm giá chi phí đầu vào lên đến 90% cho các token được lưu tạm với thời gian tái sử dụng trong khung cửa sổ 30 phút.

Bổ sung công cụ chẩn đoán và cơ chế tối ưu chuyên sâu

Nhằm giúp các kỹ sư kiểm soát hiệu quả lưu trữ, OpenAI cung cấp hai công cụ giám sát trực quan: Bảng điều khiển Prompt Caching Dashboard và công cụ chẩn đoán sự cố bộ nhớ đệm (diagnostics tool). Bảng điều khiển cho phép theo dõi tỷ lệ hit rate theo thời gian thực và phân tích biểu đồ thành phần token đã cache so với token chưa cache. Khi xảy ra tình trạng "hụt" bộ nhớ đệm (cache miss), công cụ chẩn đoán sẽ đối chiếu yêu cầu hiện tại với phản hồi gần nhất để chỉ ra nguyên nhân cụ thể, ví dụ như sự thay đổi cấu trúc công cụ (tools_changed) cùng số lượng token bị ảnh hưởng.

Hệ thống GPT-6 cũng mang đến loạt tùy chọn tối ưu linh hoạt cho nhà phát triển:

  • Điều chỉnh mức độ suy luận không làm vỡ cache: Lập trình viên có thể tăng giảm mức suy luận (reasoning effort) giữa các lượt phản hồi thông qua tham số configuration_update mà không làm mất ngữ cảnh đã lưu tạm trước đó.
  • Điểm ngắt bộ nhớ đệm rõ ràng (Explicit breakpoints): Cho phép chủ động chọn phần tiền tố prompt cần tái sử dụng và giữ phần nội dung biến đổi ở cuối câu lệnh.
  • Bảo toàn cache khi đổi công cụ: Thay vì xóa định nghĩa công cụ khiến cache bị vô hiệu hóa, nhà phát triển có thể dùng allowed_tools hoặc gán tool_choice thành none, đồng thời dùng tin nhắn hệ thống mới nối vào cuối để cập nhật chỉ thị.
  • Tính năng Prewarming (Làm ấm cache): Nạp trước ngữ cảnh tĩnh, tài liệu tham khảo hoặc định nghĩa công cụ vào bộ nhớ đệm ngay khi khởi động ứng dụng trước khi người dùng đặt câu hỏi đầu tiên, loại bỏ độ trễ khởi tạo.

Hiệu quả thực tế đã được kiểm chứng bởi các đối tác lớn. Ông Mario Rodriguez, Giám đốc Sản phẩm của GitHub Copilot, cho biết tính năng prompt caching của OpenAI đã giúp nền tảng giảm hơn 50% tỷ lệ token cần xử lý lại trên hàng tỷ lượt yêu cầu, mang lại tốc độ phản hồi ban đầu vượt trội cho lập trình viên. Trong khi đó, ông Arian Hanifi, Giám đốc Công nghệ của Strawberry Browser, chia sẻ rằng công cụ chẩn đoán và cơ chế điểm ngắt rõ ràng đã giúp công ty tăng thêm vài phần trăm hit rate, qua đó cắt giảm 20% chi phí vận hành và mở ra khả năng rẽ nhánh các tác vụ ngầm một cách hiệu quả về mặt kinh tế.

Lời giải cho bài toán chi phí của AI Agent vận hành dài hạn

Khi các mô hình ngôn ngữ lớn dịch chuyển từ vai trò chatbot trả lời từng câu đơn lẻ sang các tác nhân tự hành (autonomous agents) giải quyết chuỗi công việc phức tạp, chi phí tính toán suy luận (inference) đã trở thành rào cản tài chính lớn nhất đối với các doanh nghiệp triển khai ở quy mô lớn.

Việc hạ tầng GPT-6 tối ưu hóa việc tái sử dụng tính toán không chỉ đơn thuần là bài toán giảm giá thành API, mà còn trực tiếp rút ngắn độ trễ phản hồi (time to first response). Cùng với các giải pháp chẩn đoán chuyên sâu và hỗ trợ từ công cụ lập trình Codex, OpenAI đang từng bước chuẩn hóa hạ tầng kỹ thuật để biến các tác nhân AI chạy nền liên tục trở nên khả thi về mặt kinh tế cho các nhà phát triển phần mềm trên toàn cầu.

◗ Nguồn

OpenAI News23-09

Tin liên quan