Er komt een nieuw AI-model uit en binnen een paar uur verschijnen de eerste grafieken.
Model A wint op redeneren. Model B op programmeren. Model C is goedkoper. Model D heeft een grotere contextwindow. Niet veel later volgt op LinkedIn de discussie die inmiddels bijna standaard bij iedere nieuwe modelrelease hoort:
Welk AI-model is nu het slimste?
Volgens mij houden we onszelf daarmee behoorlijk voor de gek.
Niet omdat benchmarks nutteloos zijn. Integendeel. Ze kunnen heel waardevol zijn om modellen onder vergelijkbare omstandigheden te testen en om een eerste indruk te krijgen van waar een model sterk of juist minder sterk in is.
Het gaat mis bij de conclusies die we eraan verbinden. En misschien nog wel meer bij wat we vervolgens doen: wachten totdat duidelijk is welk model de winnaar is.
Want die winnaar komt niet.

Een benchmark is geen algemene ranglijst
Gartner waarschuwt daar nadrukkelijk voor. In het onderzoek How to Avoid Being Misled (Fooled) by AI Benchmarks, gepubliceerd op 27 augustus 2026, beschrijft Gartner hoe AI-benchmarks organisaties op het verkeerde been kunnen zetten wanneer onvoldoende duidelijk is wat er precies wordt gemeten en hoe relevant dat is voor de eigen toepassing.
De essentie is eenvoudig. Een benchmark zegt iets over een model op een bepaalde taak, met een bepaalde dataset en onder bepaalde omstandigheden. Maar dat is iets anders dan zeggen:
Dit is het beste AI-model.
Toch behandelen we ranglijsten soms alsof het de Formule 1-stand van AI is. Nummer één staat bovenaan en moet dus automatisch de beste keuze zijn. Zo eenvoudig is het niet. Het cijfer kan volledig correct zijn.
De conclusie die je eraan verbindt misschien niet.
Een goed redeneermodel is nog geen goede klantenservicemedewerker
Neem klantcontact. Stel dat een model uitzonderlijk goed scoort op complexe wiskunde, logisch redeneren en wetenschappelijke vragen. Interessant. Maar wat zegt dat over deze klantvraag?
“Ik heb vorige week al gebeld. Toen werd gezegd dat mijn aanvraag geregeld zou worden, maar ik heb nog steeds niets gehoord.”
Om daarop een goed antwoord te geven, moet een AI-oplossing heel andere dingen kunnen. Wat is er eerder met deze klant besproken? Wat is de status van de aanvraag? Welke toezegging is gedaan? Welk proces hoort daarbij? Welke uitzonderingen zijn er? Wat mag AI zelf afhandelen en wanneer moet een medewerker worden ingeschakeld?
En minstens zo belangrijk: hoe reageer je op een manier die past bij de situatie van deze klant? Een hoge score op een algemene redeneertest geeft daar maar beperkt antwoord op.
De werkelijkheid is veel rommeliger
Benchmarks hebben een belangrijk voordeel: de omstandigheden zijn gecontroleerd. Maar precies daarin zit ook hun beperking. De praktijk binnen organisaties is namelijk allesbehalve gecontroleerd.
Klanten stellen drie vragen tegelijk. Ze schrijven productnamen verkeerd. Ze gebruiken afkortingen. Ze verwijzen naar een telefoongesprek van twee weken geleden. Ze beginnen een gesprek over een factuur en eindigen met een vraag over hun abonnement. En ze houden zich zelden netjes aan het proces dat ooit in een stroomschema is getekend.
Ook de informatie binnen organisaties zelf is niet altijd perfect. Een kennisbank kan verouderde artikelen bevatten. Twee documenten kunnen elkaar tegenspreken. Een uitzondering op een proces zit soms alleen in het hoofd van een ervaren medewerker.
Dat is de werkelijkheid waarin AI uiteindelijk moet functioneren. Niet in een benchmark.
Jouw organisatie heeft zijn eigen taal
Iedere organisatie heeft bovendien zijn eigen taal. Een gemeente gebruikt andere termen dan een verzekeraar. Een installatiebedrijf spreekt anders dan een ziekenhuis. En zelfs twee bedrijven binnen dezelfde sector kunnen verschillende namen gebruiken voor hetzelfde proces.
Een algemeen taalmodel kan enorm veel kennis hebben en toch verkeerd begrijpen wat binnen jouw organisatie met een bepaalde afkorting, productnaam of status wordt bedoeld. Dat is geen pleidooi om voor iedere organisatie een eigen gespecialiseerd taalmodel te bouwen. Het laat vooral zien waarom algemene benchmarkresultaten onvoldoende zijn. Want uiteindelijk moet een AI-oplossing kunnen werken met jouw kennis, jouw terminologie, jouw processen en jouw regels.
Die context kan bijvoorbeeld komen uit een kennisbank, CRM, eerdere klantinteracties, procesinformatie en bedrijfsregels. De interessante vraag is daarom niet:
Welk model weet in algemene zin het meest?
Maar:
Hoe goed werkt AI met wat binnen onze organisatie relevant is?
Vergelijk daarom niet alleen modellen, maar oplossingen
Een LLM op zichzelf lost namelijk weinig op. Het is één onderdeel van een veel grotere keten:
Klantvraag → context → bedrijfsdata → kennis → bedrijfsregels → taalmodel → controles → antwoord
De kwaliteit van het eindresultaat wordt bepaald door die hele keten. Een model dat op een openbare benchmark iets lager scoort, maar op het juiste moment beschikt over relevante klantinformatie, actuele kennis en heldere bedrijfsregels, kan in de praktijk betere resultaten opleveren dan een model dat op papier intelligenter is maar die context mist.
Dat maakt de keuze van het taalmodel niet onbelangrijk. Het betekent dat je die keuze moet beoordelen binnen de oplossing waarin het model uiteindelijk wordt gebruikt.
In klantcontact gaat het bijvoorbeeld om de combinatie van:
- het taalmodel;
- bedrijfsdata en kennis;
- klant- en interactiecontext;
- proceslogica;
- governance en beveiliging;
- integraties met andere systemen;
- en de rol van de medewerker.
Daar zit uiteindelijk de echte waarde.
Wacht niet op het perfecte model
En juist daar zit misschien wel het belangrijkste punt. De ontwikkeling van AI gaat zo snel dat wachten op het perfecte model geen verstandige strategie is. Vandaag staat model A bovenaan een benchmark. Over een paar maanden verschijnt model B. Daarna wordt model C goedkoper, sneller of beter in precies dat onderdeel dat voor jouw organisatie relevant is.
Wie zijn AI-strategie laat afhangen van de vraag welk model uiteindelijk als winnaar uit de bus komt, kan lang wachten. En ondertussen gebeurt er iets belangrijkers niet: ervaring opdoen.
Want pas wanneer je AI toepast op je eigen processen, met je eigen data en je eigen klanten, ontdek je waar de werkelijke kansen en beperkingen zitten.
Welke informatie ontbreekt? Waar ontstaan fouten? Welke processen zijn geschikt om te automatiseren? Waar is menselijke controle nodig? Wat accepteren klanten? En waar levert AI daadwerkelijk tijd, kwaliteit of een betere klantbeleving op?
Dat leer je niet uit een leaderboard. Dat leer je door te beginnen.
Maak daarom je eigen benchmark
De meest relevante benchmark staat waarschijnlijk niet op internet. Die moet je zelf maken.
Neem bijvoorbeeld een representatieve verzameling echte klantvragen, uiteraard op een privacyveilige manier, en test verschillende oplossingen met dezelfde situaties. Een klant wil een afspraak wijzigen. Kan de oplossing de bedoeling herkennen?
Een klant stelt drie vragen tegelijk. Worden ze allemaal correct behandeld?
Een klant schrijft een productnaam verkeerd. Wordt toch begrepen wat hij bedoelt?
De kennisbank bevat het antwoord niet. Geeft AI dat aan of wordt er iets verzonnen?
Een proces kent een belangrijke uitzondering. Wordt die herkend?
Een klant vraagt iets wat alleen een medewerker mag beslissen. Wordt op het juiste moment geëscaleerd?
Dat zijn benchmarks die daadwerkelijk iets zeggen over jouw organisatie.
Kijk vervolgens verder dan alleen juist of fout
Ook dan is één rapportcijfer onvoldoende.
Kijk bijvoorbeeld naar:
Juistheid
Klopt het antwoord inhoudelijk?
Relevantie
Wordt de daadwerkelijke klantvraag beantwoord?
Grounding
Is het antwoord gebaseerd op betrouwbare bedrijfsinformatie?
Procesvolging
Houdt AI zich aan de afgesproken processen en regels?
Escalatie
Wordt herkend wanneer menselijke tussenkomst nodig is?
Tone of voice
Past het antwoord bij de organisatie en de situatie?
Snelheid
Is de oplossing snel genoeg voor het betreffende kanaal?
Kosten
Wat kost een succesvolle interactie uiteindelijk?
Veiligheid en governance
Voldoet de oplossing aan de eisen van de organisatie?
Dat geeft een veel realistischer beeld dan de vraag of model A twee procentpunt hoger scoort dan model B op een algemene test.
Test, leer en test opnieuw
En ook je eigen benchmark is geen eenmalige exercitie. Nieuwe modellen verschijnen. Prijzen veranderen. Modellen worden sneller. Nieuwe technieken komen beschikbaar. Leveranciers voegen mogelijkheden toe. Je hoeft daarom niet vandaag het model voor de komende tien jaar te kiezen.
Je moet zorgen dat je kunt blijven vergelijken. Bouw een eigen testset. Meet kwaliteit, snelheid, kosten en risico’s. Doe ervaring op. Verbeter je kennis en processen.
En verschijnt er een interessant nieuw model? Laat dezelfde tests opnieuw draaien. Dan hoef je niet iedere nieuwe modelrelease vanaf de zijlijn te volgen. Je kunt zelf bepalen of die voor jouw organisatie daadwerkelijk iets verbetert.
Dus: zijn LLM-benchmarks onzin?
Nee. Ze zijn nuttig. Ze maken technische vooruitgang zichtbaar, helpen modellen onder vergelijkbare omstandigheden te beoordelen en kunnen een prima eerste selectie opleveren.
Maar ze zijn het begin van de vergelijking. Niet het einde.
De onzin begint wanneer we een algemene benchmark behandelen als een universele ranglijst en vervolgens wachten totdat duidelijk is welk model heeft gewonnen. Die zekerheid gaat er waarschijnlijk nooit komen. Daarom is de interessantere vraag niet:
Welk AI-model is het slimste?
Maar:
Welke AI-oplossing levert binnen onze organisatie aantoonbaar waarde op?
Met onze data. Onze kennis. Onze processen. Onze beveiligingseisen. Onze vaktaal. Onze klanten. Onze spelregels. En onze medewerkers.
Misschien blijkt dan dat nummer drie op internet voor jouw toepassing nummer één is. En drie maanden later misschien weer een ander model. Dat is geen probleem. Zolang je maar weet waarom.
Stop met vergelijken vanaf de zijlijn
Bij Pegamento geloven we daarom niet dat organisaties moeten wachten tot er één duidelijke winnaar uit de LLM-race komt. Die race blijft doorgaan. Veel interessanter is om nu ervaring op te doen met AI in de processen waar het daadwerkelijk waarde kan toevoegen.
Daarbij kijken we niet naar een taalmodel als losstaand product, maar naar de complete oplossing: model, bedrijfsdata, context, governance, kennis, integraties, processen en menselijke expertise.
Binnen WorkplaceX brengen we die onderdelen bij elkaar en kunnen organisaties AI toepassen in het dagelijkse klantcontact. Niet om vandaag definitief te bepalen welk model voor altijd het beste is. Maar om te ontdekken wat vandaag binnen jouw organisatie werkt, daar meetbare ervaring mee op te doen en morgen eenvoudig opnieuw te kunnen kiezen.
Stop dus met wachten op het perfecte model.
Begin met testen wat voor jouw organisatie waarde oplevert.