Cloudflare apresenta modelos de decisão Clef para automatizar ações de agentes de IA na velocidade da edge
A Cloudflare lançou o Clef e o Clef-flash, dois modelos de decisão de código aberto baseados no Qwen que atribuem probabilidades a escolhas predefinidas em até 39 milissegundos.

A Cloudflare apresentou o Clef e o Clef-flash, dois modelos de decisão especializados projetados para otimizar a forma como agentes de IA avaliam dados e executam fluxos de trabalho. Criados para atribuir probabilidades a opções predefinidas de múltipla escolha em vez de gerar texto aberto, os modelos visam eliminar gargalos humanos em pipelines agênticos, permitindo que sistemas downstream disparem ações automaticamente.
O lançamento coloca a Cloudflare em concorrência direta com o modelo Jev, da TypeSafe AI — que foi pioneiro no conceito em meados de setembro —, além da API Decisions da OpenAI, baseada no GPT-6 Luna. Para facilitar a adoção, a Cloudflare tornou a API do Clef totalmente compatível com a do Jev.
Preenchendo a lacuna entre classificadores e LLMs
Os modelos de decisão abordam um desafio estrutural específico nas arquiteturas agênticas. Embora os grandes modelos de linguagem (LLMs) tradicionais se destaquem no raciocínio e na execução de ferramentas, suas respostas estão sujeitas a variações, alucinações e alta latência. Por outro lado, os classificadores tradicionais de machine learning operam com rapidez, mas exigem retreinamento dedicado sempre que uma nova categoria é introduzida.
O Clef preenche essa lacuna avaliando uma entrada em relação a múltiplas perguntas predefinidas em uma única chamada, retornando probabilidades de confiança para cada opção candidata. Em um cenário de atendimento ao cliente, por exemplo, o Clef pode avaliar uma solicitação recebida, estimar sua urgência, determinar a equipe apropriada e gerar probabilidades claras. O código downstream pode, então, rotear o ticket automaticamente, disparar um alerta ou encaminhar o caso para um atendente humano se a confiança ficar abaixo de um limite predeterminado.
De acordo com a Cloudflare, esse nível de confiabilidade significa que "um humano não precisa mais necessariamente estar no circuito para decisões agênticas".
Arquitetura, benchmarks e velocidade no edge
Ambos os modelos da família são baseados nas fundações de pesos abertos do Qwen: o modelo principal Clef utiliza o Qwen3.8-27B, enquanto o Clef-flash recorre ao Qwen3.5-9B. A Cloudflare mantém os pesos base centrais intactos durante o treinamento, utilizando, em vez disso, dados sintéticos proprietários para treinar componentes auxiliares especializados que extraem probabilidades calibradas diretamente das ativações internas do modelo.
O treinamento incorpora uma variante própria da Cloudflare de Aprendizado por Reforço para Decisões Calibradas (RLCD, na sigla em inglês) — o método utilizado originalmente pela TypeSafe AI. O Clef também traz suporte multimodal, aceitando texto e imagens, além de contar com uma janela de contexto de 64.000 tokens, o dobro da capacidade do Jev.
A velocidade na infraestrutura distribuída de edge da Cloudflare atua como o principal diferencial:
- O Clef-flash registra uma latência mediana de resposta de aproximadamente 39 milissegundos.
- O Clef alcança uma latência mediana de resposta de cerca de 209 milissegundos.
- Em comparação, o Jev da TypeSafe AI atinge pouco mais de 524 milissegundos.
Nas avaliações internas da Cloudflare em 43 benchmarks, o Clef-flash obteve precisão comparável à do Jev em uma fração do tempo de resposta, enquanto o Clef liderou na qualidade geral de decisão. No benchmark API Bank, o Clef-flash marcou 93,11 e o Clef alcançou 91,93, contra 88,19 do Jev. No PhishNChips, o Clef registrou 79,60 e o Clef-flash atingiu 75,05, superando os 62,55 do Jev. Já no benchmark When2Call, o Jev manteve a vantagem com 80,97, frente aos 72,37 do Clef e 65,58 do Clef-flash.
Em testes internos conduzidos pela equipe de inteligência de ameaças da Cloudflare, o Clef realizou a coleta, a renderização e a classificação de um site — avaliando fatores de risco como probabilidades de phishing — em 2,2 segundos. O LLM de uso geral mais rápido da empresa levou 4,7 segundos para a mesma tarefa, retornando menos categorias.
Fine-tuning corporativo e disponibilização open source
Tanto o Clef quanto o Clef-flash foram disponibilizados no Hugging Face sob a licença de código aberto Apache-2.0 e estão acessíveis na plataforma serverless Workers AI da Cloudflare.
Além dos modelos, a Cloudflare está lançando um serviço de aprendizado por reforço que permite às empresas adaptar o Clef a tarefas sob medida. Inicialmente oferecido por meio de engenheiros dedicados (forward-deployed), o fluxo de trabalho será expandido futuramente para um pipeline em modelo self-service:
- As requisições de tráfego de produção são gravadas por meio do AI Gateway da Cloudflare.
- As interações registradas são avaliadas em sandboxes conteinerizadas.
- Pesos personalizados são treinados e reimplantados diretamente no Workers AI, utilizando a infraestrutura da Replicate, empresa adquirida pela Cloudflare no final de 2025.
A Cloudflare planeja utilizar os modelos Clef internamente para a triagem de mensagens de suporte ao cliente, avaliação de relatórios automatizados de abuso e diferenciação entre web crawlers legítimos e bots maliciosos automatizados.



