Wat kost een miljoen tokens eigenlijk
Een token is het stukje tekst waarin een AI-model rekent: een woord, een deel van een woord of een leesteken, in het Engels gemiddeld ongeveer vier tekens en in het Nederlands vaak wat minder per token. Aanbieders rekenen per miljoen tokens, en apart voor wat je erin stopt (invoer) en wat eruit komt (uitvoer), waarbij uitvoer meestal een veelvoud van de invoerprijs kost. Op 5 september 2026 vraagt Anthropic voor Claude Fable 5.1 bijvoorbeeld $ 10,00 per miljoen tokens invoer en $ 50,00 per miljoen tokens uitvoer.
Wat dat betekent voor jou hangt af van hoeveel tekst er heen en weer gaat. Dit artikel rekent het om naar een gesprek, een document en een dag bouwen, legt uit waarom lange context duur is, en noemt de prijsvallen die je pas op de rekening ziet. Voor de actuele prijzen van vijftien modellen staat de vergelijker klaar, waar elke waarde een bron en een datum draagt.
12 tokenseen illustratie van hoe een model knipt
Wat is een token?
De eenheid waarin een taalmodel tekst leest en schrijft. Voordat een model iets doet met je tekst, knipt een programma (de tokenizer) hem in stukjes uit een vaste woordenlijst: veelvoorkomende woorden zijn één token, langere of zeldzamere woorden worden in delen geknipt, en leestekens en spaties tellen mee. De aanbieders geven als vuistregel dat een token in het Engels ongeveer vier tekens is, ruwweg driekwart woord. Nederlands heeft langere woorden en minder plek in de woordenlijst, dus een Nederlandse tekst kost per woord meestal meer tokens dan dezelfde tekst in het Engels.
Het model rekent dus niet in woorden, tekens of pagina's, maar in tokens, en de rekening ook. Een pagina tekst van vijfhonderd woorden is grofweg zeven- tot achthonderd tokens; een lang document van vijftig pagina's grofweg veertigduizend. Code telt anders dan proza, omdat symbolen en inspringingen elk tokens kosten. Precies weten kan alleen met de tokenizer van het model zelf; de meeste aanbieders bieden er een teller voor aan.
Elke aanbieder heeft een eigen tokenizer, en dat betekent dat dezelfde tekst bij het ene model meer tokens kost dan bij het andere. Twee modellen met dezelfde prijs per miljoen zijn daardoor niet even duur voor jouw tekst. Dat is de eerste van de prijsvallen verderop.
- Een token is een stukje tekst uit een vaste lijst; ongeveer vier tekens Engels.
- Nederlands kost per woord meestal meer tokens dan Engels; code telt weer anders.
- Elke aanbieder knipt anders, dus dezelfde tekst kost niet overal hetzelfde.
Waarom hebben invoer en uitvoer een andere prijs?
Omdat ze het model ander werk kosten. Invoer (alles wat je het model stuurt: je vraag, de instructies, het document, de voorgaande gesprekstukken) verwerkt het model in één keer, parallel. Uitvoer (wat het model terugschrijft) ontstaat token voor token, en elk volgend token vraagt een nieuwe berekening over alles wat eraan voorafging. Uitvoer is daardoor voor de aanbieder veel duurder om te produceren, en dat zie je in de prijs: bij de meeste modellen kost een miljoen tokens uitvoer een veelvoud van een miljoen tokens invoer.
Bij Claude Fable 5.1 is de verhouding op 5 september 2026 een op vijf: $ 10,00 invoer tegenover $ 50,00 uitvoer per miljoen tokens. Bij Claude Opus 5 van dezelfde aanbieder $ 5,00 tegenover $ 25,00. De verhouding verschilt per aanbieder en per model; de vergelijker zet ze naast elkaar.
Voor jouw kosten betekent dit dat een korte vraag met een lang antwoord duurder is dan een lange vraag met een kort antwoord, ook al gaan er even veel tokens heen en weer. Wie een model veel laat schrijven (een artikel, een lange code-aanpassing) betaalt vooral voor uitvoer; wie een model veel laat lezen (een document samenvatten, een codebasis doorzoeken) betaalt vooral voor invoer.
- Invoer wordt in één keer verwerkt, uitvoer token voor token; dat kost meer.
- Verhouding vaak een op vier of een op vijf; bij Claude Fable 5.1 $ 10,00 tegenover $ 50,00.
- Veel laten schrijven kost uitvoer; veel laten lezen kost invoer.
Wat kost een gesprek, een document, een maand bouwen?
Reken met de prijzen van Claude Fable 5.1 op 5 september 2026 als voorbeeld, en met ronde tokenaantallen als illustratie. Neem een gesprek waarin je in totaal 20.000 tokens instuurt en 4.000 tokens terugkrijgt. Dat instuurbedrag is hoog omdat je bij elke beurt het hele gesprek tot dan toe meestuurt: het model onthoudt niets tussen twee beurten. De invoer kost 20.000 gedeeld door een miljoen maal $ 10,00, dus $ 0,20. De uitvoer kost 4.000 gedeeld door een miljoen maal $ 50,00, ook $ 0,20. Samen $ 0,40.
Een document van vijftig pagina's laten samenvatten: ongeveer 40.000 tokens invoer en zeg 1.000 tokens uitvoer, dus $ 0,40 plus $ 0,05 is $ 0,45. Een agent die per opdracht grote delen van je code leest en herschrijft, verbruikt per dag makkelijk enkele miljoenen tokens. Dan gaat het om tientallen tot honderden dollars per maand, afhankelijk van hoeveel je bouwt en hoe groot je project is. Dat laatste is geen schatting die dit artikel voor je kan maken; het is een getal dat je in het verbruiksoverzicht van je aanbieder afleest.
De les uit de rekensom: losse gesprekken kosten centen, documenten kosten dubbeltjes, en agents die code lezen en schrijven kosten geld. Wie met een agent bouwt, kijkt dus niet naar de prijs van een gesprek maar naar de prijs van een dag.
- Een gesprek van 20.000 in en 4.000 uit: $ 0,40 bij $ 10,00 en $ 50,00 per miljoen.
- Een document van vijftig pagina's samenvatten: ongeveer $ 0,45.
- Een agent die bouwt: miljoenen tokens per dag; lees het verbruik af, schat het niet.
Waarom is lange context duur?
Omdat een model niets onthoudt tussen twee beurten. Elke keer dat je iets vraagt in een lopend gesprek, stuurt de toepassing het hele gesprek tot dan toe opnieuw mee als invoer: je eerste vraag, het eerste antwoord, je tweede vraag, en zo verder. Het tiende bericht in een gesprek kost dus niet de tokens van dat bericht, maar de tokens van alle tien. Een lang gesprek wordt daardoor per beurt duurder, ook als je steeds korte vragen stelt.
Hetzelfde geldt voor documenten en code. Een agent die bij elke opdracht je hele project meestuurt om het te begrijpen, betaalt bij elke opdracht voor dat hele project. Daarom zijn agents zo duur in vergelijking met gesprekken, en daarom helpt het om een groot project op te delen, of om de agent alleen de bestanden te laten lezen die voor de opdracht nodig zijn.
Sommige aanbieders rekenen bovendien een hogere prijs per token zodra de invoer een bepaalde lengte overschrijdt, en de meeste bieden korting op invoer die ze recent al zagen (caching). Beide staan in de prijsvoorwaarden van de aanbieder en niet in de prijs per miljoen, en beide kunnen je rekening flink veranderen. De vergelijker noemt bij een model waar dat speelt een noot.
- Elke beurt stuurt het hele gesprek opnieuw; het tiende bericht kost tien berichten.
- Een agent die het hele project meestuurt, betaalt elke keer voor het hele project.
- Hogere prijs boven een lengte, korting op herhaalde invoer: lees de voorwaarden.
Welke prijsvallen zie je pas op de rekening?
Zes, en ze komen alle zes voor. De tokenizer: dezelfde tekst kost bij het ene model meer tokens dan bij het andere, dus vergelijk niet alleen de prijs per miljoen. De lange context: een gesprek of project dat groeit, groeit in prijs per beurt. Introductieprijzen: een nieuw model is soms tijdelijk goedkoop en wordt later duurder; controleer de datum bij een prijs. Piek- en daltarieven: sommige aanbieders rekenen minder buiten drukke uren of voor werk dat mag wachten.
Redeneerniveaus: veel modellen kunnen langer nadenken voordat ze antwoorden, en die denkstappen zijn uitvoertokens die je betaalt zonder ze te zien; een model op de hoogste stand kan een veelvoud kosten van hetzelfde model op de laagste. En bereikbaarheid: een model dat via een tussenpartij draait, heeft daar soms een andere prijs dan bij de aanbieder zelf.
De remedie is steeds hetzelfde: kijk niet naar de prijs maar naar de rekening. Zet bij je aanbieder een verbruikslimiet en een melding, en lees na de eerste week af wat een dag werken je kostte. Dat getal is de enige prijs die voor jou telt.
- Tokenizer, lange context, introductieprijzen, piek en dal, redeneerniveaus, tussenpartijen.
- Denkstappen zijn uitvoer die je betaalt zonder te zien.
- Verbruikslimiet, melding, en na een week de dagprijs aflezen.
Hoe kies je een model op prijs zonder op kwaliteit te verliezen?
Door prijs en kwaliteit naast elkaar te zetten, en niet één van beide. De vergelijker op deze site doet dat: voor vijftien modellen staat de prijs per miljoen tokens invoer en uitvoer naast de score op de Intelligence Index van Artificial Analysis, een onafhankelijke meetpartij die modellen op dezelfde tien evaluaties test. Op 5 september 2026 staat de index op versie 4.2; een score van een eerdere versie is niet vergelijkbaar, en de vergelijker zegt dat erbij.
Het patroon dat je dan ziet: de duurste modellen scoren het hoogst, maar het verschil in score tussen het duurste en een model dat een fractie kost, is vaak kleiner dan het verschil in prijs. Voor het meeste werk (tekst herschrijven, een vraag beantwoorden, een samenvatting) is een middenmodel ruim goed genoeg. Voor het moeilijkste werk (een ingewikkelde fout in code vinden, een lang document precies verwerken) betaalt het duurste model zich terug in minder herhalingen.
Gebruik dus twee modellen: een goedkoop voor het gewone werk en een duur voor het moeilijke, en wissel bewust. De meeste toepassingen en agents laten dat instellen. Wie alles op het duurste model doet, betaalt voor kwaliteit die hij meestal niet nodig heeft; wie alles op het goedkoopste doet, betaalt in herhalingen.
- Prijs naast kwaliteit, met een onafhankelijke index; de vergelijker doet dat met bron en datum.
- Het verschil in score is vaak kleiner dan het verschil in prijs.
- Twee modellen: goedkoop voor gewoon werk, duur voor moeilijk werk.
Hoe boek je het, en hoe zit het met de btw?
Als zakelijke kosten, zoals elk ander abonnement of verbruik voor je onderneming. De aanbieders rekenen in dollars en zonder btw; de afschrijving op je rekening is in euro's tegen de koers van dat moment, en dat bedrag is wat je boekt. Bewaar de factuur of het verbruiksoverzicht van de aanbieder, want dat is je bewijsstuk; een afschrift van je creditcard alleen is dat niet.
De btw is het punt waar het bij AI-diensten uit het buitenland vaak misgaat. Een aanbieder buiten Nederland rekent aan een Nederlandse ondernemer meestal geen Nederlandse btw: de btw is dan naar jou verlegd. Jij geeft hem aan in je btw-aangifte, in de rubriek voor diensten uit het buitenland, en trekt hem in dezelfde aangifte weer af als voorbelasting als je daar recht op hebt. Netto verandert er dan niets, maar de aangifte moet het wel laten zien. Geef je aan de aanbieder geen btw-identificatienummer op, dan rekent hij soms wel btw, en dan is dat buitenlandse btw die je niet als Nederlandse voorbelasting mag aftrekken.
Zorg dus dat je btw-identificatienummer in je account bij de aanbieder staat, en boek de facturen met de verlegging erbij. Het begrip verlegde btw op deze site legt de rubriek uit, en het artikel over de eerste btw-aangifte noemt dit als een van de fouten die bij makers het vaakst voorkomen.
- Zakelijke kosten, geboekt in euro's, met de factuur van de aanbieder als bewijs.
- Buitenlandse aanbieder: btw verlegd, aangeven en aftrekken in dezelfde aangifte.
- Btw-identificatienummer in je account, anders betaal je buitenlandse btw die je niet terugkrijgt.
Bronnen
Nagelopen op 5 september 2026. De prijzen komen uit de vergelijker op deze site, die per waarde de bron en de controledatum noemt; de tokenaantallen in de rekensommen zijn ronde illustraties. De vuistregel van vier tekens per token is die van de aanbieders zelf en geldt voor Engels.
Verder lezen
Drie plekken die hierop aansluiten.
Van eerste prompt tot aangifte.
Het platform opent later. Vragen of opmerkingen kun je mailen naar info@basestep.io.