keekbe

Cloudflare lanceert Clef: open AI-modellen die kiezen in plaats van praten

Cloudflare heeft op 1 oktober 2026 Clef en Clef-flash uitgebracht, twee beslissingsmodellen met open gewichten. In plaats van tekst te schrijven, kiezen ze tussen vooraf bepaalde opties en geven ze bij elke keuze een waarschijnlijkheid: een bericht klasseren, een aanvraag doorsturen, beslissen of een AI-agent moet escaleren. De modellen draaien op Workers AI, staan onder de Apache 2.0-licentie op Hugging Face en zijn compatibel met Jev, het beslissingsmodel dat Typesafe AI half september lanceerde.

Of: waarom de triageverpleegkundige geen diagnose stelt

De meeste AI die we kennen, praat. Je stelt een vraag en je krijgt een antwoord in volzinnen, soms een heel opstel. Clef praat niet. Vraag aan Clef naar welke afdeling een mail moet, en je krijgt een keuze en een cijfer terug: „facturatie, 0,94”. Dat klinkt als minder. Voor veel werk is het precies genoeg.

Cloudflare Clef: een model dat kiest in plaats van praat

Wat een beslissingsmodel doet

Cloudflare omschrijft het zo: een beslissingsmodel „maakt classificaties die agenten helpen beslissen hoe ze moeten handelen, op basis van waarschijnlijkheden”. Je geeft het model een vraag en een vaste lijst mogelijke antwoorden. Het model kiest, en zegt hoe zeker het is.

Dat kan op drie manieren: ja of nee, een keuze uit meerdere opties, of een rangschikking. Een paar voorbeelden van wat zo’n model kan beslissen:

  • of een binnenkomende mail een factuur, een klacht, een offerteaanvraag of spam is;
  • welk supportticket eerst behandeld moet worden;
  • of een bezoeker van je website een mens of een bot is;
  • of een AI-agent zelf verder mag, of een mens moet inschakelen.

Het verschil met een gewoon taalmodel zit in de manier van werken. Een chatbot schrijft zijn antwoord woord voor woord, en zegt bij dezelfde vraag niet altijd hetzelfde. Clef schrijft geen tekst: het leidt de keuze rechtstreeks af uit wat het model intern over de vraag berekent. Volgens Cloudflare levert dat „strikt getypeerde” antwoorden op, sneller, goedkoper en consequenter dan een taalmodel dat een keuze in tekst moet formuleren.

Triage op de spoed

Het beste beeld is de triage op een spoedafdeling. De triageverpleegkundige stelt geen diagnose en behandelt niemand. Ze beslist twee dingen: hoe dringend het is, en naar wie je moet. Dat moet snel gaan, en het moet elke keer op dezelfde manier gebeuren, ook om drie uur ’s nachts.

Een beslissingsmodel is die verpleegkundige, vóór de dure specialisten: de grote taalmodellen en de mensen. Het stuurt door, het behandelt niet. En de waarschijnlijkheid is het belangrijkste deel. Een verpleegkundige die twijfelt, roept er een arts bij. Een model dat „klacht, 0,51” antwoordt, zegt eigenlijk hetzelfde: hier moet iemand anders naar kijken. Wie die drempel goed instelt, laat het model het makkelijke werk doen en houdt de twijfelgevallen voor een mens.

Clef tegenover Jev

Cloudflare bracht twee versies uit. Clef heeft 27 miljard parameters en mikt op nauwkeurigheid, Clef-flash heeft er 9 miljard en mikt op snelheid. Beide zijn gebouwd op modellen van de Qwen-familie, waarvan de basis onveranderd blijft.1 Ze lezen tot 64.000 tokens tekst en kunnen ook beelden klasseren.

De concurrent heet Jev, het beslissingsmodel dat Typesafe AI half september 2026 lanceerde, als onderdeel van wat het bedrijf System One noemt.2 Jev leest 32.000 tokens en alleen tekst. Clef is volledig compatibel met de API van Jev: wie code voor Jev schreef, kan overstappen zonder veel te herschrijven. Dat is geen toeval. Het is een uitnodiging.

Volgens Cloudflare antwoordt Clef-flash in een mediane 38,8 milliseconden, Clef in 209,3 en Jev in 524,1. Voor de nauwkeurigheid publiceerde het bedrijf onder meer deze cijfers:

TestClefJev
BANKING77 (bankvragen klasseren, macro-F1)94,2079,74
CLINC150 (intenties herkennen, macro-F1)97,4389,27
When2Call (beslissen wanneer een tool aangeroepen wordt)72,3780,97

Op de praktijktests van Typesafe zelf winnen Clef en Clef-flash drie van de vier onderdelen (klantendienst, facturen verwerken, beveiligingsincidenten), telkens met een kleine marge. Jev wint het vierde, het opvolgen van wat een AI-agent gedaan heeft. Het patroon is duidelijk: Clef is beter in snel sorteren, Jev in inschatten wat er in een complexe situatie moet gebeuren. Dat zijn cijfers van Cloudflare, over het eigen product. Ze zijn gedetailleerd genoeg om na te rekenen, maar het blijft de verkoper die de weegschaal vasthoudt.

Zes keer duurder dan bijna niets

Op Workers AI kost Clef volgens Traictory 0,24 dollar per miljoen invoertokens, en de uitvoer wordt niet aangerekend. Jev kost 0,042 dollar. Een commentator op Hacker News rekende uit dat een miljoen beslissingen bij Jev zo’n 12,60 dollar kost en bij Clef zo’n 72 dollar, wat neerkomt op ongeveer 300 tokens per beslissing. Zes keer duurder, zeg maar.

Voor een webshop die elke dag honderdduizenden bestellingen controleert, is dat een echte afweging. Voor een kmo die haar mailbox laat sorteren, minder. Honderd mails per dag, met dezelfde aannames, zijn zo’n 3.000 beslissingen per maand. Bij Clef komt dat neer op ongeveer 22 dollarcent per maand. Zes keer duurder dan bijna niets is nog altijd bijna niets.

Open gewichten

Het grotere verschil zit niet in de prijs, maar in de licentie. Clef en Clef-flash staan onder de Apache 2.0-licentie op Hugging Face. Iedereen mag ze downloaden, aanpassen en zelf draaien, ook commercieel. Clef-flash is met 9 miljard parameters klein genoeg voor één stevige grafische kaart.

Dat is voor een Europese kmo geen detail. Wie Clef via Workers AI gebruikt, stuurt haar mails en tickets naar een Amerikaans bedrijf. Cloudflare belooft dat het de vragen en antwoorden niet leest, niet bewaart en niet gebruikt om te trainen. Maar een Amerikaans bedrijf blijft onder Amerikaanse wetten vallen, zoals we uitlegden in de gids over de CLOUD Act. Wie de gewichten op een eigen server of bij een Europese aanbieder draait, houdt de gegevens in eigen beheer.

Cloudflare kondigde er ook een dienst bij aan om Clef bij te trainen op je eigen verkeer, met versterkend leren. Je verkeer wordt dan via AI Gateway vastgelegd als trainingsmateriaal. Voorlopig gebeurt dat samen met ingenieurs van Cloudflare; later moet het zelfbediening worden. De prijs is nog niet bekend. De belofte „we trainen niet op je gegevens” geldt daar uitdrukkelijk niet: daar is het trainen net de bedoeling.

Kmo-Kristof: We krijgen honderd mails per dag. Ik wil dat een AI ze sorteert.

Security-Sofie: Dan heb je geen schrijver nodig, maar een sorteerder.

Kmo-Kristof: Wat is het verschil?

Security-Sofie: Een chatbot schrijft je een alinea over waarom deze mail waarschijnlijk een factuur is. Een beslissingsmodel zegt: factuur, 94 procent.

Kmo-Kristof: En die andere 6 procent?

Security-Sofie: Daar kijk jij naar. Dat is het hele punt.

Wat kun je ermee?

  1. Kijk waar je een groot model laat kiezen. Laat je een chatbot mails sorteren of tickets labelen, dan doet een beslissingsmodel dat sneller en goedkoper, met een antwoord dat je programma meteen kan gebruiken.
  2. Stel een drempel in. Laat alleen de beslissingen met een hoge waarschijnlijkheid automatisch doorgaan, en stuur de rest naar een mens. Leg vast wie dat is in een AI-beleid voor je team.
  3. Kies bewust waar het model draait. Via een Amerikaanse cloud, of met de open gewichten op je eigen server of bij een Europese aanbieder. Mails en tickets bevatten persoonsgegevens: bij een externe dienst hoort een verwerkersovereenkomst.
  4. Lees de voorwaarden van het bijtrainen. Wie zijn eigen verkeer laat gebruiken om het model te verbeteren, geeft precies die gegevens door. Dat kan nuttig zijn, maar het is een keuze, geen standaardinstelling.

De triageverpleegkundige is niet de slimste persoon in het ziekenhuis, en dat hoeft ook niet. Ze moet snel zijn, overal op dezelfde manier werken en weten wanneer ze een arts moet roepen. Clef is gebouwd voor precies die job. Het interessantste cijfer in de aankondiging is daarom niet de score op BANKING77. Het is de waarschijnlijkheid naast elk antwoord, want die zegt wanneer de machine zelf vindt dat ze iemand moet roepen.


  1. Qwen is de familie van taalmodellen van Alibaba Cloud. Cloudflare bevriest het basismodel en traint er een beslissingslaag bovenop. Voor bedrijven met een beleid over de herkomst van AI-modellen is dat een detail om te kennen, ook al draait het model zelf waar je wil. ↑

  2. De naam verwijst vermoedelijk naar de psycholoog Daniel Kahneman, die in Thinking, Fast and Slow (2011) twee manieren van denken beschreef: systeem 1, snel en intuïtief, en systeem 2, traag en bedachtzaam. Een beslissingsmodel is systeem 1. Ook tussen de twee beslissingsmodellen tonen de benchmarks een bekend patroon: bij snel sorteren wint de snelste, bij taken die meer op afwegen lijken, wint de tragere Jev. ↑

Bronnen