Hoofdstuk 1 · van schaars naar bijna gratis
De bodem valt uit de prijs
1.1 OpenAI maakt zijn snelste model 80% goedkoper
Luna −80%: $0,20 / $1,20 per miljoen
Terra −20%: $2 / $12
Sol Fast: 2,5× sneller
Op 30 juli verlaagde OpenAI de prijzen over de hele GPT-5.6-familie. De opvallendste sprong zit bij het lichtste model: tachtig procent eraf.
Luna, het snelste en lichtste model, ging naar twintig dollarcent per miljoen input-tokens — stukjes tekst, ruwweg driekwart woord elk — en één dollar twintig per miljoen output-tokens. Terra ging twintig procent omlaag, naar twee dollar input en twaalf dollar output. De prijs van Sol, het zwaarste model, bleef gelijk, maar er kwam een Fast-modus bij die tot twee-en-een-half keer sneller draait tegen het dubbele tarief, met naar eigen zeggen geen verschil in intelligentie.
De claim die eronder ligt is nog interessanter dan het prijskaartje. OpenAI stelt dat Luna het model Fable 5 van Anthropic verslaat op professioneel werk — gemeten op de benchmark Agents' Last Exam — tegen naar schatting negenennegentig procent lagere kosten per taak. Dat is geen prijsverlaging maar een herdefinitie van wat een taak mag kosten. Neem de claim met een korrel zout: het is een meting van de fabrikant op een benchmark van zijn eigen keuze. Maar zelfs als het half klopt, verschuift de rekensom van wat je nog met de hand laat doen.
Het detail dat het langst blijft hangen zit in de motor. Een deel van de efficiëntiewinst kwam van het model zelf: GPT-5.6 Sol herschreef binnen een door mensen geleid proces de productie-kernels van OpenAI — de laag software die bepaalt hoe efficiënt berekeningen op de GPU's draaien — en ontwierp en draaide honderden experimenten om de tokengeneratie te verbeteren. Resultaat: twintig procent lagere serving-kosten en ruim vijftien procent hogere efficiëntie.
Zet dat naast elkaar: het model verlaagt de kosten van het draaien van het model. Dat is een lus die zichzelf versterkt, en hij verklaart waarom prijsdalingen in deze markt niet netjes lineair verlopen maar in sprongen komen.
BronnenOpenAI — advancing the price-performance frontier
1.2 DeepSeek: frontier-agentwerk voor 28 cent
$0,14 input / $0,28 output per miljoen
13 van 284 miljard parameters actief
82,7 op Terminal-Bench 2.1
Op 31 juli bracht DeepSeek een nieuwe versie van V4-Flash uit. De aanpak is het vermelden waard: ze hebben het model niet groter gemaakt, ze hebben het opnieuw getraind.
De prijzen bleven ongewijzigd — veertien dollarcent per miljoen input-tokens, achtentwintig cent per miljoen output. Gecachede input kost achtentwintig tienduizendste dollarcent, dus praktisch niets. Wat wél veranderde, is wat je ervoor krijgt.
Het model gebruikt een architectuur waarbij per verzoek maar ongeveer dertien miljard van de tweehonderdvierentachtig miljard parameters actief zijn — de instelbare getallen waarmee een neuraal netwerk is afgesteld. Dat is precies waarom het zo goedkoop kan: je betaalt alleen voor het deel dat meedenkt. Op Terminal-Bench 2.1, een test die meet hoe goed een model zelfstandig taken op een computer afrondt, scoort het 82,7. Op DeepSWE 54,4. Het onafhankelijke Artificial Analysis gaf het een 50 op zijn Intelligence Index, tien punten hoger dan de vorige Flash.
In verhouding gezet: dit is een model dat serieus agentwerk doet, tegen een prijs die in je begroting verdwijnt in de ruis.
The Neuron vermoedt dat geruchten hierover de reden waren dat OpenAI een dag eerder met zijn prijsverlaging kwam. Dat is speculatie, maar de timing is opvallend.
De kanttekening hoort er direct bij: "Opus-klasse" is een benchmarkclaim, geen universele waarheid. DeepSeek gebruikte een specifieke testopstelling en maximale effort voor die agent-tests, en echte projecten leggen fouten bloot die benchmarks missen. Maar de prijsdreiging is echt, ook als het model alleen maar goed genoeg is.
BronnenDeepSeek — API-prijzen · Artificial Analysis — V4-Flash scoort 50
1.3 Het grootste open model ooit is nu gratis te downloaden
Kimi K3-gewichten vrijgegeven
6 van de top 10 op OpenRouter is Chinees
DoorDash, Airbnb, Coinbase: tot −50%
Op 28 juli gaf Moonshot AI de volledige gewichten van Kimi K3 vrij op Hugging Face, samen met het technische paper. Voor onderzoek, persoonlijk gebruik én commerciële inzet, met guardrails.
Gewichten zijn de getrainde inhoud van een model: de miljarden getallen die het geleerd heeft. Vrijgeven betekent dat iedereen met genoeg hardware het zelf kan draaien, aanpassen en fine-tunen, zonder toestemming en zonder factuur per token. Daarmee is dit het grootste open-weight model dat ooit is uitgebracht.
Het model verscheen elf dagen eerder en had toen zoveel vraag dat Moonshot nieuwe abonnementen tijdelijk moest opschorten. Kimi K3 heeft een contextvenster van één miljoen tokens — ongeveer een boekenplank aan tekst die het in één keer kan overzien.
Het marktbeeld eromheen is het eigenlijke nieuws. Zes van de tien meestgebruikte modellen op OpenRouter, het platform waar ontwikkelaars tussen modellen kiezen, komen inmiddels uit Chinese labs. En dit is geen hobbyisme: DoorDash, Airbnb en Coinbase verschuiven volgens Fortune stilletjes workloads om hun AI-uitgaven met tot vijftig procent te verlagen. Bij de lancering van K3 verloor Nvidia zeshonderd miljard dollar aan beurswaarde.
De nuance van vorige editie blijft staan: open betekent dat je het mág draaien, niet dat je het kúnt draaien. K3 vraagt een serieuze berg hardware. Maar je hoeft het niet zelf te hosten — je hoeft alleen een aanbieder te vinden die het voor je draait, en die concurreert op prijs met een model waarvoor hij zelf geen licentie hoefde te kopen.
BronnenHugging Face — Kimi K3 · Moonshot AI — Kimi K3 · Fortune — Chinese modellen in Amerikaans developergebruik
1.4 De goedkopere weg loopt via architectuur, niet via afzien
Planners duur, workers goedkoop
METR: de expenditure horizon
Nadella: niet alles op één AI
De praktische vertaalslag van dit hoofdstuk bestaat uit drie bewegingen, en geen ervan gaat over minder AI gebruiken.
Eén: splits plannen en uitvoeren. Cursor experimenteerde met een agent-zwerm die een database in Rust bouwde. Planner-agents op frontier-modellen splitsen het doel op in een boom van taken, worker-agents op véél goedkopere modellen voeren die uit, en samen houden ze een gedeelde "field guide" bij zodat latere workers dezelfde fouten niet opnieuw maken. De conclusie: de dure modellen zijn nodig om te bedenken wát er moet gebeuren, niet om het te doen.
Twee: reken je toezichtkosten mee. Onderzoeksinstituut METR introduceerde een metriek die het de expenditure horizon noemt: het punt waarop een AI-agent duurder wordt dan een mens. Het cruciale zit in de noemer. De vraag is niet "kan het dit?", maar "kan het dit voor minder dan het menselijke alternatief, als je toezicht en herkansingen meetelt?" Dat is de spreadsheet waar elke AI-pilot uiteindelijk voor komt te staan.
Drie: zet niet alles op één leverancier. Satya Nadella zei het deze week botweg: bedrijven die op één AI voor alles vertrouwen, overleven dat mogelijk niet. Zijn punt is niet loyaliteit maar risico — modellen wisselen van prijs, van beschikbaarheid en van beleid, en dat gaat sneller dan je contractcyclus.
De formulering die het beste blijft hangen komt van The Neuron: de bedrijven die winnen zijn misschien niet die met het meest indrukwekkende model, maar die het werk naar het juiste model kunnen routeren, het resultaat kunnen verifiëren, en de economie niet uit de hand laten lopen.
BronnenThe Decoder — Cursors agent-swarm · The Decoder — METR en de expenditure horizon · TechCrunch — Nadella over één AI voor alles