
Goedkopere AI is niet automatisch efficiëntere AI
Nieuwe modellen worden snel goedkoper, maar prijs per token vertelt niet hoeveel rekenwerk een taak werkelijk kost. Het verschil tussen kosten- en tokenefficiëntie bepaalt wie de rekening betaalt.
Nieuwe AI-modellen worden in hoog tempo goedkoper aangeboden. Dat klinkt als een simpele efficiëntiewinst, maar de prijs per token vertelt slechts een deel van het verhaal. Een model kan goedkoop zijn in de API en tegelijk veel tokens nodig hebben om een taak af te ronden. Andersom kan een duurder model met minder denkstappen uiteindelijk voordeliger uitvallen.
De recente vergelijking tussen Anthropic's Opus 5.5 en OpenAI's GPT-6-modellen maakt die spanning zichtbaar. Volgens de videoanalyse kost Opus 5.5 nog 40 procent van Fable 5.5, terwijl GPT-6 Sol en Luna ongeveer 50 procent goedkoper zijn geworden. Dat zijn claims uit de analyse, geen onafhankelijk gecontroleerde marktmeting. Belangrijker is de achterliggende vraag: daalt alleen de verkoopprijs, of wordt het model onder de motorkap ook efficiënter?
Drie assen in plaats van één ranglijst
Modelvergelijkingen worden vaak teruggebracht tot twee variabelen: intelligentie en prijs. De beste modellen liggen dan op een zogeheten Paretofront: je kunt daar niet méér kwaliteit krijgen zonder ook méér te betalen.
Voor praktisch gebruik ontbreekt echter een derde as: het aantal tokens dat een model nodig heeft om hetzelfde werk af te ronden. Dat levert drie afzonderlijke begrippen op:
- Intelligentie: hoe goed het model een taak uitvoert volgens de gekozen evaluatie.
- Kostenefficiëntie: hoeveel kwaliteit je krijgt voor het bedrag dat de aanbieder rekent.
- Tokenefficiëntie: hoeveel tekstuele rekenstappen het model nodig heeft om tot dat resultaat te komen.
Die laatste twee vallen niet automatisch samen. De aanbieder bepaalt de prijs per token, maar het modelgedrag bepaalt hoeveel tokens een taak verbruikt. Een prijsverlaging kan dus concurrentiedruk, beschikbare datacentercapaciteit of een strategische subsidie weerspiegelen zonder dat de technische efficiëntie even sterk is verbeterd.
Opus 5.5 en GPT-6 kiezen een andere route
In de getoonde analyse bereikt Opus 5.5 een hoger intelligentieniveau dan GPT-6 Sol en Luna. Tegelijk loopt het tokenverbruik bij de hoogste prestatieniveaus relatief sterk op. GPT-6 Sol en Luna stoppen eerder op de gebruikte intelligentie-index, maar bewegen volgens dezelfde analyse gunstiger door de kosten- en tokenruimte.
GPT-6 Astra laat weer een ander profiel zien: het model zou qua schaalgedrag meer lijken op Anthropic's eerdere Fable 5.1 dan op Opus 5.5. Opus 5.5 verdeelt de winst volgens de maker gelijkmatiger over kosten en tokens, terwijl de GPT-6-lijn sterker op tokenefficiëntie inzet totdat de maximale modelkwaliteit de beperkende factor wordt.
Daaruit volgt geen universele winnaar. De uitkomst hangt af van de taak:
- Voor een probleem waarvoor maximale redeneercapaciteit nodig is, kan het krachtigste model de rationele keuze zijn, ook als het meer tokens gebruikt.
- Voor grote aantallen routinetaken kan een iets minder krachtig maar zuiniger model goedkoper en sneller opschalen.
- Voor agentische systemen telt niet alleen het model, maar ook de harness: prompts, geheugen, toolgebruik, herstelpogingen en contextbeheer beïnvloeden het totale verbruik.
De genoemde indexscores en trajecten zijn afkomstig uit de grafieken van de maker. Zonder de volledige onderliggende dataset en onafhankelijke replicatie moeten ze vooral als illustratie van de trade-off worden gelezen, niet als definitieve ranglijst.
API-gebruikers en abonnees voelen andere pijn
Het onderscheid tussen prijs en tokenverbruik wordt concreet zodra een model in een product terechtkomt. Een API-klant betaalt doorgaans naar verbruik. Als een model voor dezelfde taak meer tokens genereert, verschijnt die inefficiëntie direct op de rekening.
Bij abonnementen werkt dat anders. Daar zit het verbruik vaak achter berichtlimieten, tijdvensters of een wekelijkse capaciteit. De aanbieder kan tijdelijk ruimere limieten geven en daarmee een deel van de inferentiekosten zelf dragen. Voor de gebruiker voelt het model dan goedkoop, totdat een limiet sneller wordt bereikt of de voorwaarden worden aangescherpt.
Dat creëert verschillende belangen:
- API-bouwers willen een lage totale taakprijs en voorspelbaar tokenverbruik.
- Abonnees merken vooral snelheid, kwaliteit en hoe snel gebruikslimieten vollopen.
- Modelaanbieders willen genoeg marge behouden terwijl concurrenten hun prijzen verlagen.
Tokenefficiëntie is daardoor niet alleen een technische statistiek. Ze bepaalt hoeveel ruimte een aanbieder heeft om prijzen te verlagen, abonnementen royaal te houden en piekbelasting op te vangen.
De rekening verdwijnt niet
Wanneer de prijs van intelligentie daalt, lijkt het alsof inefficiëntie minder belangrijk wordt. In werkelijkheid verschuift de rekening. Bij API-gebruik betaalt de klant het extra tokenverbruik. Bij een abonnement kan de aanbieder het tijdelijk subsidiëren. Uiteindelijk blijven rekenkracht, energie, geheugen en datacentercapaciteit nodig om al die tokens te produceren.
Dat verklaart waarom een tokenefficiënt model strategisch waardevol is. Het geeft een leverancier meer speelruimte wanneer concurrenten de marktprijs omlaag drukken. Een model dat dezelfde taak met minder tokens uitvoert, kan tegen een lagere prijs worden aangeboden zonder dat de infrastructuurkosten even snel oplopen.
De video plaatst ook Kimi, GLM, DeepSeek, MiMo, Gemini, MiniMax, xAI en Meta in deze concurrentiestrijd. De precieze posities zijn voorlopig en afhankelijk van de gekozen meetlat, maar de richting is geloofwaardig: labs concurreren niet meer alleen op maximale intelligentie. Prijs, tokengebruik en snelheid worden zelfstandige producteigenschappen.
Wat bedrijven voortaan moeten meten
Voor organisaties die AI inkopen is de prijs per miljoen tokens onvoldoende. Een bruikbare evaluatie meet minimaal:
- Taaksucces: wordt het werk correct en volledig afgerond?
- Totale taakprijs: wat kost een geslaagde uitkomst, inclusief mislukte pogingen?
- Tokenverbruik: hoeveel invoer-, redeneer- en uitvoertokens zijn nodig?
- Doorlooptijd: hoe lang duurt de volledige workflow?
- Operationele stabiliteit: hoe vaak zijn herstelacties of menselijke controles nodig?
Test modellen daarbij op echte bedrijfsprocessen in plaats van alleen op openbare benchmarks. Een model dat op een algemene index lager scoort, kan binnen een afgebakende workflow de betere economische keuze zijn.
Conclusie
De dalende prijs van AI is echt, maar zegt niet automatisch dat modellen technisch evenveel efficiënter worden. Opus 5.5 en de GPT-6-familie illustreren dat intelligentie, kosten en tokenverbruik verschillende richtingen kunnen volgen. Wie alleen naar de API-prijs kijkt, mist welke partij de inefficiëntie uiteindelijk betaalt.
De betere maatstaf is daarom niet de goedkoopste token, maar de goedkoopste betrouwbare uitkomst. Daarvoor moeten bedrijven modelkwaliteit, totaal verbruik, snelheid en de volledige agentische workflow samen beoordelen. Pas dan wordt zichtbaar of een nieuw model werkelijk efficiënter is, of alleen agressiever geprijsd.
Verder lezen
Modellen & Releases
GPT-6 Astra: verzadigde benchmarks, maar de echte doorbraak is tokenefficiëntieModellen & Releases
Kimi K2.6 en Agent Swarms: De Volgende Stap in AI-agentenModellen & Releases
Alibaba's Qwen 3.5: De Revolutie van Kleine AI-Modellen voor Edge Computing
Zelf aan de slag met AI of een nieuwe website?
Code Lieshout bouwt het voor je — vaste prijs vooraf, reactie binnen één werkdag.