AI RACE— AI Race
New Models

Cloudflare, 엣지 속도로 AI 에이전트 동작 자동화하는 의사결정 모델 'Clef' 공개

Cloudflare가 사전 정의된 선택지에 최저 39밀리초 만에 확률을 할당하는 Qwen 기반 오픈소스 의사결정 모델 'Clef'와 'Clef-flash'를 출시했다.

2026. 10. 03. 01:19
Cloudflare ra mắt dòng mô hình ra quyết định Clef, tự động hóa tác vụ của AI agent với tốc độ mạng biên

Cloudflare가 AI 에이전트의 데이터 평가 및 워크플로 실행 방식을 효율화하도록 설계된 특화 의사결정 모델 'Clef'와 'Clef-flash'를 선보였다. 개방형 텍스트를 생성하는 대신 사전 정의된 객관식 선택지에 확률을 할당하도록 설계된 이 모델들은, 다운스트림 시스템이 작업을 자동으로 트리거할 수 있도록 지원함으로써 에이전트 파이프라인에서 인간 개입으로 인한 병목 현상을 해소하는 것을 목표로 한다.

이번 출시로 Cloudflare는 지난 9월 중순 이 개념을 개척한 TypeSafe AI의 Jev 모델뿐만 아니라 GPT-6 Luna 기반 OpenAI의 Decisions API와도 직접적인 경쟁 구도를 형성하게 됐다. 도입 장벽을 낮추기 위해 Cloudflare는 Clef의 API를 Jev와 완벽히 호환되도록 구성했다.

분류기와 LLM 간의 간극 해소

의사결정 모델은 에이전트 아키텍처의 특정한 구조적 과제를 해결하는 데 초점을 맞춘다. 기존 거대언어모델(LLM)은 추론과 도구 실행에 뛰어나지만, 응답의 변동성과 환각(할루시네이션), 높은 지연 시간이라는 한계를 지닌다. 반면 기존 머신러닝 분류기(classifier)는 빠른 속도로 작동하지만 새로운 범주가 추가될 때마다 별도의 재학습이 필요하다.

Clef는 단 한 번의 호출로 사전 정의된 여러 질문에 걸쳐 입력을 평가하고 각 후보 옵션에 대한 신뢰도 확률을 반환함으로써 이러한 간극을 좁힌다. 예를 들어 고객 서비스 시나리오에서 Clef는 인입된 문의를 평가해 긴급도를 파악하고 담당 팀을 지정한 뒤 명확한 확률을 출력할 수 있다. 이후 다운스트림 코드는 티켓을 자동 라우팅하거나 알림을 트리거할 수 있으며, 신뢰도가 지정된 임계값 아래로 떨어질 경우 해당 건을 담당자에게 전달(에스컬레이션)할 수 있다.

Cloudflare에 따르면 이러한 수준의 신뢰성은 "에이전트의 의사결정 과정에 더 이상 사람이 반드시 개입(human-in-the-loop)할 필요가 없음을 의미한다."

아키텍처, 벤치마크 및 엣지 속도

제품군의 두 모델 모두 가중치가 공개된 Qwen을 기반으로 구축됐다. 메인 모델인 Clef는 Qwen3.8-27B를 사용하며, Clef-flash는 Qwen3.5-9B를 기반으로 한다. Cloudflare는 학습 과정에서 핵심 베이스 가중치는 그대로 유지한 채, 자체 합성 데이터를 활용해 모델의 내부 활성화(activation)에서 직접 보정된 확률을 추출하는 특화 보조 컴포넌트를 학습시켰다.

이번 학습에는 TypeSafe AI가 처음 사용했던 방식인 보정된 결정을 위한 강화학습(RLCD, Reinforcement Learning for Calibrated Decisions)의 Cloudflare 자체 변형 방식이 적용됐다. 아울러 Clef는 텍스트와 이미지를 모두 수용하는 멀티모달 지원을 도입했으며, Jev의 두 배에 달하는 6만 4천(64,000) 토큰 컨텍스트 창을 제공한다.

Cloudflare의 분산 엣지 인프라 전반에서 발휘되는 속도가 핵심 차별점이다.

  • Clef-flash의 중앙값(median) 응답 지연 시간은 약 39밀리초를 기록했다.
  • Clef는 약 209밀리초의 중앙값 응답 지연 시간을 달성했다.
  • 이에 비해 TypeSafe AI의 Jev는 524밀리초를 약간 웃도는 속도를 기록했다.

43개 벤치마크에 걸친 Cloudflare의 내부 평가에서 Clef-flash는 응답 시간을 대폭 단축하면서도 Jev와 대등한 정확도를 달성했으며, Clef는 전반적인 의사결정 품질을 주도했다. API Bank 벤치마크에서 Jev가 88.19점을 기록한 반면, Clef-flash는 93.11점, Clef는 91.93점을 기록했다. PhishNChips에서는 Clef가 79.60점, Clef-flash가 75.05점을 기록하며 Jev의 62.55점을 앞섰다. When2Call 벤치마크에서는 Jev가 80.97점으로 Clef(72.37점)와 Clef-flash(65.58점)를 상회하며 우위를 유지했다.

Cloudflare 위협 인텔리전스 팀의 내부 테스트에서 Clef는 피싱 확률과 같은 위험 요소를 평가하며 웹사이트를 가져오고(fetch), 렌더링하고, 분류하는 작업을 2.2초 만에 완료했다. 이 회사의 가장 빠른 범용 LLM은 동일한 작업에 4.7초가 걸렸으며, 반환한 범주 수도 더 적었다.

엔터프라이즈 미세조정 및 오픈소스 출시

Clef와 Clef-flash는 모두 Apache-2.0 오픈소스 라이선스에 따라 Hugging Face에 공개됐으며, Cloudflare의 서버리스 플랫폼인 Workers AI에서도 이용할 수 있다.

모델 출시와 함께 Cloudflare는 기업들이 Clef를 맞춤형 작업에 최적화할 수 있도록 지원하는 강화학습 서비스를 선보인다. 초기에는 현장 파견 엔지니어(forward-deployed engineers)를 통해 제공되지만, 향후에는 다음과 같은 셀프서비스 파이프라인으로 확장될 예정이다.

  1. 프로덕션 트래픽 요청이 Cloudflare의 AI Gateway를 통해 기록된다.
  1. 로그로 남겨진 상호작용은 컨테이너화된 샌드박스에서 평가된다.
  1. Cloudflare가 2025년 말 인수한 Replicate의 인프라를 활용하여 맞춤형으로 가중치를 학습시키고 Workers AI에 직접 재배포한다.

Cloudflare는 내부적으로 고객 지원 메시지 분류, 자동화된 악용(어뷰징) 신고 평가, 악성 자동화 봇과 정상적인 웹 크롤러의 구별 등에 Clef 모델을 활용할 계획이다.

관련 기사