Cloudflare Clef: 27B, 39 ms – 0,24 dollar, egne modeller
Cloudflare slipper 1. oktober 2026 Clef og Clef-flash, de første modellene Workers AI-teamet selv har trent. De skriver ikke svar. De leser en tilstand og et skjema med typed spørsmål, og returnerer sannsynlighet for hvert tillatte svar. Modellene hostes på Workers AI, er Jev-API-kompatible, og vektene åpnes under Apache 2.0.
For CIO er dette et arkitekturvalg på kanten: en billig, strukturert beslutning i hot path før en dyr agentkall, på samme nett som WAF og Workers allerede kjører. For CISO er tre ting viktigere enn Cloudflares egen tabell: Qwen-basen, at laben selv målte indeksene, og at «vi trener ikke på forespørslene deres» faller bort den dagen dere bruker finjusteringsproduktet.
Hva Cloudflare faktisk slipper
Clef er 27 milliarder parametere, posttrent fra Qwen3.8-27B, for presisjon. Clef-flash er 9 milliarder, fra Qwen3.5-9B, for latens. Begge har 65 536 tokens kontekst. Modell-ID-ene på Workers AI er @cf/cloudflare/clef og @cf/cloudflare/clef-flash.
Dokumentasjonen beskriver Clef som multimodal: den leser tilstand som tekst, JSON, bilder eller video og returnerer sannsynlighet for hvert lovlige valg. Bilder er en utvidelse av System One-API-et: inntil fire innebygde PNG, JPEG eller WebP, ikke eksterne URL-er. Maks fire bilder, 4 MiB og 16 megapiksler hver, 8 MiB totalt dekodet, hele kroppen maks 13 MiB. 1 til 64 spørsmål per kall.
Tre spørsmålstyper, samme familie som Jev:
- noul: sannsynlighet for ja
- choice: ett valg blant navngitte alternativer, med sannsynlighet per alternativ
- score: sannsynlighetsvektet nivå på en rubrikk
Eksempelet Cloudflare bruker er en kundesak: er den urgent, hvilket team, hvor alvorlig. Svaret er tall koden kan rute på, eskalere på, eller sende til et menneske.
Prisen på Workers AI er 0,24 dollar per million input-tokens for Clef og 0,09 dollar for Clef-flash. Output prises ikke. Cloudflare sier de ikke leser, lagrer eller trener på forespørsler og svar, med mindre dere bruker finjusteringsproduktet.
Tallene, og hva de ikke er
Cloudflare sier Clef leder Jev Decision Index i deres sammenligning, og at en Clef-modell scorer høyest på 7 av 10 beslutningsbenchmarks. Utvalgte tall fra bloggen:
| Benchmark | Clef | Clef-flash | Jev |
| BFCL case exact | 98,47 | 98,76 | 95,75 |
| BANKING77 macro-F1 | 94,20 | 90,93 | 79,74 |
| When2Call accuracy | 72,37 | 65,58 | 80,97 |
| PhishNChips accuracy | 79,60 | 75,05 | 62,55 |
Jev vinner When2Call. På PhishNChips scorer DiffusionGemma Jev 85,35, over Clef. På Typesafes egen arbeidsflyt slår Clef Jev i 3 av 4: faktura, kundeservice og sikkerhetshendelser. Agent-trace observability går til Jev, 71,6 mot 68,5.
Latens, Cloudflares 43 kjøringer:
| Clef | Clef-flash | Jev |
| Median ms | 209,3 | 38,8 | 524,1 |
| p95 ms | 238,6 | 122,4 | 536,0 |
Clef-flash er om lag 13 ganger raskere enn Jev i denne tabellen. Laya er raskere (5,8 ms median) og taper kvalitet i samme sett.
Internt har Cloudflare testet Clef på trusselintel: et domene med Browser Run klassifiseres på 2,2 sekunder, mot 4,7 sekunder for gpt-oss-120b i samme flyt, med flere kategorier tilbake. Det er labens egen operasjon, ikke en uavhengig SOC-evaluering.
Arkitekturen Cloudflare beskriver er prefill i Qwen, deretter parallell scoring av gyldige skjemavalg. Beslutningstrinnet er ikke autoregressivt. Kalibrering trenes med Brier-tap pluss det de kaller RLCD. Det forklarer farten. Det forklarer ikke at indeksen vil holde på deres merkede saker.
Finjustering og leverandørbinding
Cloudflare debuterer samtidig en RL-tjeneste. Først håndholdt med forward-deployed engineers, senere selvbetjent plattform: datasett fra AI Gateway, rollouts på Workers AI, sandbox i Containers, ny trainer, redeploy som BYO-modell. Interne bruksmål de nevner er Trust & Safety, support-triasje og bot-produkter.
Det er den strategiske biten: et CDN- og sikkerhetsselskap trener egne modeller og vil eie finjusteringen på samme kant der trafikken allerede ligger. Bindingen er ikke lisensen. Apache 2.0 er liberal. Bindingen er dataene dere putter inn i RL-løpet, og at hot path sitter i Workers AI.
Qwen-basen er den samme forsyningskjeden som andre beslutningsmodeller i denne klassen. Pin vekter. Isoler self-host. Ikke les Apache som «uten opphav».
Hva ledere bør gjøre nå
Bruk Clef der svaret må være et tall med terskel, ikke der noen skal resonnere. Ruting, eskalering, «er dette phishing», «hvilket team», «hvor alvorlig». Sett menneske inn når sannsynligheten ligger nær 0,5.
FinOps er åpent, men ikke billigst i klassen. 0,24 dollar per million input er seks ganger Decisions API på 0,04 dollar. Det dere betaler for her er kant, visjon, Jev-kompatibilitet og at Cloudflare hoster. Mål mot egne køer før dere bytter klassifiserer.
CISO: forbud mot eksterne bilde-URL-er er bra. Logg kall, terskel og hvilken modell (clef vs clef-flash). Hvis dere finjusterer, er «vi trener ikke på dataene» ikke lenger sannheten for det sporet. Avtale, databehandler og sletteplikt må skrives om før første FDE-pilot.
Ikke kjøp «leder av Jev Decision Index» som SOC-kvalitet. Test mot egne merkelapper. Der indeksen taper, When2Call og deler av phishing, skal terskelen være strengere, ikke slakere.
Kilder og medier
Primærkilde: Cloudflare, Introducing Clef: our open-source decision models, and new RL fine-tuning platform, 1. oktober 2026: https://blog.cloudflare.com/clef-decision-models/
Modelldokumentasjon: Cloudflare Workers AI, clef, @cf/cloudflare/clef, 0,24 dollar per million input-tokens: https://developers.cloudflare.com/workers-ai/models/clef/
Changelog: Cloudflare, Introducing Clef, 1. oktober 2026: https://developers.cloudflare.com/changelog/post/2026-10-01-clef-workers-ai/
Thumbnail: OpenAI Image 2 / hogby.ai
📬 Likte du denne?
AI-nyheter for ledere. Kuratert av en CIO som bygger det selv. Daglig i innboksen.