Cloudflare ra mắt dòng mô hình ra quyết định Clef, tự động hóa tác vụ của AI agent với tốc độ mạng biên
Cloudflare vừa trình làng Clef và Clef-flash, hai mô hình ra quyết định mã nguồn mở phát triển trên nền tảng Qwen, có khả năng gán xác suất cho các lựa chọn định sẵn với độ trễ chỉ từ 39 mili giây.

Cloudflare vừa chính thức giới thiệu Clef và Clef-flash – bộ đôi mô hình ra quyết định chuyên biệt nhằm tối ưu hóa cách các AI agent (tác tử AI) đánh giá dữ liệu và thực thi quy trình làm việc. Thay vì tạo văn bản mở như thông thường, hai mô hình này được thiết kế để gán xác suất cho các tùy chọn trắc nghiệm định sẵn, qua đó xóa bỏ điểm nghẽn phụ thuộc vào con người trong các luồng vận hành của agent và cho phép các hệ thống phía sau tự động kích hoạt hành động.
Màn ra mắt này đưa Cloudflare bước vào cuộc đối đầu trực tiếp với mô hình Jev của TypeSafe AI (vốn là đơn vị tiên phong với khái niệm này vào giữa tháng 9), cũng như Decisions API của OpenAI dựa trên GPT-6 Luna. Nhằm giúp người dùng dễ dàng tiếp cận và chuyển đổi, Cloudflare đã thiết kế API của Clef tương thích hoàn toàn với Jev.
Thu hẹp khoảng cách giữa các bộ phân loại truyền thống và LLM
Các mô hình ra quyết định (decision models) ra đời nhằm giải quyết một bài toán cấu trúc nan giải trong kiến trúc agentic. Dù các mô hình ngôn ngữ lớn (LLM) truyền thống rất xuất sắc ở khả năng suy luận và gọi công cụ, câu trả lời của chúng lại thiếu tính nhất quán, dễ gặp hiện tượng "ảo giác" (hallucination) và có độ trễ cao. Ngược lại, các bộ phân loại học máy cổ điển có tốc độ phản hồi cực nhanh nhưng lại đòi hỏi phải đào tạo lại từ đầu mỗi khi xuất hiện một danh mục mới.
Clef giải quyết bài toán này bằng cách đánh giá một đầu vào dựa trên nhiều câu hỏi định sẵn chỉ trong một lần gọi lệnh (single call), sau đó trả về xác suất tin cậy cho từng phương án. Chẳng hạn trong kịch bản chăm sóc khách hàng, Clef có thể đồng thời phân tích một yêu cầu gửi đến, đo lường mức độ khẩn cấp, chỉ định bộ phận phụ trách phù hợp và xuất ra các mức xác suất rõ ràng. Hệ thống phần mềm phía sau có thể căn cứ vào đó để tự động điều phối ticket, gửi cảnh báo hoặc chuyển vụ việc cho nhân viên xử lý nếu độ tin cậy thấp hơn ngưỡng quy định.
Theo Cloudflare, độ tin cậy vượt trội này đồng nghĩa với việc "con người không nhất thiết phải tham gia trực tiếp vào các quyết định của tác tử AI nữa".
Kiến trúc, hiệu năng benchmark và tốc độ mạng biên
Cả hai mô hình trong dòng sản phẩm này đều được xây dựng trên nền tảng trọng số mở Qwen: mô hình Clef chính sử dụng Qwen3.8-27B, trong khi Clef-flash vận hành dựa trên Qwen3.5-9B. Cloudflare giữ nguyên bộ trọng số gốc trong quá trình huấn luyện; thay vào đó, hãng sử dụng dữ liệu tổng hợp (synthetic data) độc quyền để huấn luyện các thành phần phụ trợ chuyên trách, giúp trích xuất trực tiếp các xác suất đã được hiệu chuẩn từ chính các kích hoạt nội bộ (internal activations) của mô hình.
Quá trình đào tạo tích hợp một biến thể riêng của Cloudflare từ phương pháp Học tăng cường cho các quyết định hiệu chuẩn (Reinforcement Learning for Calibrated Decisions - RLCD) – kỹ thuật do TypeSafe AI khởi xướng. Clef cũng hỗ trợ đa phương thức (multimodal), xử lý được cả văn bản lẫn hình ảnh, đồng thời trang bị cửa sổ ngữ cảnh lên tới 64.000 token, gấp đôi dung lượng của Jev.
Lợi thế cạnh tranh lớn nhất của Cloudflare nằm ở tốc độ xử lý trên hạ tầng mạng biên (edge) phân tán:
- Clef-flash đạt độ trễ phản hồi trung vị (median latency) chỉ khoảng 39 mili giây.
- Clef ghi nhận độ trễ trung vị rơi vào khoảng 209 mili giây.
- Để so sánh, Jev của TypeSafe AI mất hơn 524 mili giây.
Trong các thử nghiệm nội bộ của Cloudflare trên 43 bộ benchmark, Clef-flash đạt độ chính xác tương đương Jev nhưng với thời gian phản hồi chỉ bằng một phần nhỏ, trong khi Clef dẫn đầu về chất lượng quyết định tổng thể. Tại bài kiểm tra API Bank, Clef-flash đạt 93,11 điểm và Clef đạt 91,93 điểm, vượt trội so với mức 88,19 của Jev. Với bài test PhishNChips, Clef ghi nhận 79,60 điểm và Clef-flash đạt 75,05 điểm, bỏ xa điểm số 62,55 của Jev. Tuy nhiên ở benchmark When2Call, Jev vẫn giữ lợi thế với 80,97 điểm, so với 72,37 của Clef và 65,58 của Clef-flash.
Trong bài thử nghiệm nội bộ của đội ngũ tình báo mối đe dọa (threat intelligence) thuộc Cloudflare, Clef chỉ mất 2,2 giây để truy xuất dữ liệu, kết xuất (render) và phân loại một trang web — bao gồm việc đánh giá các yếu tố rủi ro như xác suất lừa đảo giả mạo (phishing). Trong khi đó, mô hình LLM đa dụng nhanh nhất của hãng phải mất tới 4,7 giây cho cùng một tác vụ mà số lượng danh mục phân loại trả về lại ít hơn.
Tinh chỉnh cho doanh nghiệp và phát hành mã nguồn mở
Hiện cả Clef và Clef-flash đều đã được đưa lên Hugging Face theo giấy phép mã nguồn mở Apache-2.0, đồng thời sẵn sàng để truy cập thông qua nền tảng serverless Workers AI của Cloudflare.
Song song với việc phát hành mô hình, Cloudflare đang triển khai dịch vụ học tăng cường giúp các tổ chức có thể tinh chỉnh Clef theo các tác vụ đặc thù. Ban đầu, dịch vụ này sẽ được hỗ trợ bởi các kỹ sư triển khai trực tiếp, trước khi mở rộng thành quy trình tự phục vụ (self-service) hoàn chỉnh:
- Lưu lại các yêu cầu từ lưu lượng thực tế (production traffic) thông qua Cloudflare AI Gateway.
- Đánh giá các tương tác đã ghi nhận bên trong các môi trường hộp cát (sandbox) đóng gói bằng container.
- Huấn luyện các trọng số tùy chỉnh và tái triển khai trực tiếp lên Workers AI, tận dụng hạ tầng từ Replicate — công ty đã được Cloudflare mua lại vào cuối năm 2025.
Cloudflare cho biết hãng dự kiến sẽ ứng dụng nội bộ các mô hình Clef để phân loại tin nhắn hỗ trợ khách hàng, đánh giá các báo cáo vi phạm tự động và nhận diện các bot thu thập dữ liệu web độc hại.

