De vergelijker
Zet aanbieders aan en uit, schuif de grenzen voor prijs en score, en kies een schaal van een, tien of twintig miljoen tokens heen en terug. Zonder JavaScript staat de hele tabel er ook, op de stand van een miljoen.
15 van 15 modellen
Geen model past binnen deze grenzen. Zet ze wat ruimer of klik op alles terugzetten.
De ring bij elk model is de indexscore op de schaal van deze tabel, van 28 tot 57. Wijs een model aan of ga er met het toetsenbord in, dan schuiven de invoer- en uitvoerprijs open met hun bron. Jouw kosten is onze optelsom van die twee prijzen maal jouw verbruik; geen aanbieder publiceert dit bedrag zo. Een noot bij een prijs is geen kleine letter maar een voorwaarde die de uitkomst verandert.
Wat op de rand betekent
Vijf van de vijftien dragen dat label bij een miljoen tokens heen en terug: GLM-5.3-Flash, GLM-5.3, Grok 4.6, Claude Opus 5, Claude Fable 5.1. Voor die vijf bestaat er in deze lijst geen model dat tegelijk minder kost én hoger scoort. Dat volgt rechtstreeks uit de twee getallen in de rij, en het verschuift als je de verhouding tussen invoer en uitvoer verandert; daarom rekent de tabel het live opnieuw uit.
Het zegt niet dat zo'n model bij jou past. Een model dat vier punten lager scoort maar tien keer minder kost, is voor het werk dat jij doet vaak de betere keuze. Het label vertelt alleen waar je niet betaalt zonder er iets voor terug te krijgen.
Waar de scores vandaan komen
De index komt van de Artificial Analysis Intelligence Index v4.2. Een samengestelde score uit tien evaluaties (AA-Briefcase, GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience en AA-LCR v1.1), geschaald van 0 tot 100. Hoger is beter. Artificial Analysis is een onafhankelijke meetpartij en niet de aanbieder; voor een benchmarkscore is dat juist de bron, want de score bestaat alleen bij de partij die hem meet. Op 5 september 2026 stapte de index van v4.1.1 naar v4.2 over: er kwam een evaluatie bij en de weging veranderde, waardoor elk model op deze pagina negen tot elf punten lager uitkomt dan in augustus. De volgorde van de dertien modellen die er toen stonden, is daarbij niet gewijzigd. Een score van v4.1.1 en een van v4.2 zijn dus niet vergelijkbaar.
De snelheid komt van dezelfde partij: Artificial Analysis Output Speed. Uitvoertokens per seconde, gemeten op de eigen API van de aanbieder. Hoger is beter. Het is een mediaan over herhaalde metingen en geen garantie: wat jij haalt hangt af van je regio, je promptlengte en hoe druk het op dat moment is. Snelheid en intelligentie lopen niet gelijk op, en dat is precies waarom ze hier naast elkaar staan: het snelste model op deze pagina is niet het slimste, en het slimste is niet het goedkoopste.
Wat hier bewust niet in staat is de Coding Agent Index van dezelfde partij. Die rangschikt geen modellen maar agentvarianten: een combinatie van model, instellingen en de manier waarop de agent draait. Twee regels in die lijst kunnen hetzelfde model zijn met een andere configuratie, en dan valt er geen prijs per miljoen tokens naast te leggen. Hij staat hier als link, want voor de vraag welke agent codeert is hij de betere bron; als kolom in deze tabel zou hij appels met peren vergelijken.
Overal elders op deze site geldt dat een waarde van de pagina van de aanbieder zelf moet komen. Voor een benchmarkscore keert die regel om, en dat is dezelfde regel en geen uitzondering: een prijs bestaat bij wie hem vraagt, een score bestaat bij wie hem meet. Onze controle breekt de build als een score naar een aanbieder wijst of een prijs naar de meetpartij.
Wat hier bewust niet staat
Een rij komt er alleen in als béide getallen aan de bron te controleren waren: de prijs op de pagina van de aanbieder en de score op die van de meetpartij. Daarom staan er vijftien modellen en niet alles wat we tegenkwamen.
- Qwen3.8-Max van AlibabaDe prijs is er ($ 2,00 invoer en $ 6,00 uitvoer per miljoen, internationaal tarief op de eigen pagina van Alibaba Cloud), maar de meetpartij noteert zijn scores onder een andere modelnaam. Die koppeling konden we niet aan een bron vaststellen, en gokken doet deze tabel niet.
- Goedkopere broertjes zoals Claude Sonnet 5, DeepSeek V4 Flash en Qwen3.8-FlashDaarvan hebben we de prijs aan de bron, maar de score niet aan de bron gehaald. Een rij met een half vakje gaat er als een oordeel uitzien terwijl het alleen iets over ons zegt.
- Geen oordeel over kwaliteitDe index is één meting van één partij over tien evaluaties. Of een model jouw werk goed doet, weet je pas als je het jouw werk laat doen.
- Geen omgerekende bedragenAlles staat in dollars, zoals de aanbieders het tonen. Omrekenen zou de koers van vandaag in een bedrag zetten dat morgen niet meer klopt.
- Geen abonnementenDeze pagina gaat over losse tokens via een API. Maandabonnementen zoals ChatGPT Plus of Claude Pro staan op de vergelijker voor abonnementen.
Verder lezen
Drie plekken die aansluiten op wat je hier zoekt.