Podcast··42m

Aflevering 15 — China legt de servers plat en het eerste model van Mira Murati

Kimi K3 bood frontier-niveau zó goedkoop dat Moonshot registraties moest stopzetten, terwijl Thinking Machines Inkling lanceerde: een native multimodaal model dat je fine-tunt door ermee te praten.

Luister viaYouTubeSpotify

Shownotes

Meer dan tien nieuwe modellen in twee weken tijd, zóveel vraag naar Kimi K3 dat Moonshot nieuwe registraties volledig moest blokkeren, de lancering van het eerste open-weight model van Mira Murati’s Thinking Machines, en gesprekken tussen OpenAI en Duitsland over een datacenter die stilletjes klapten op energievraagstukken.

Hoofdstukken

  • 03:00 — Tien-plus modelreleases in twee weken en Kimi K3 die tegen zijn eigen capaciteitsgrenzen aanloopt
  • 13:00 — Moonshots sprong van $ 2 miljard naar $ 22 miljard en het testkader van het Witte Huis
  • 22:00 — Mira Murati’s Inkling: native multimodaal, gefinetuned via dialoog
  • 32:00 — Anthropics route naar winstgevendheid, xAI’s burn rate van $ 1 miljard per maand en het Europese energieprobleem

Aflevering 15 — China legt de servers plat en het eerste model van Mira Murati

Beschrijving: Kimi K3 bood frontier-niveau zó goedkoop dat Moonshot registraties moest stopzetten, terwijl Thinking Machines Inkling lanceerde: een native multimodaal model dat je fine-tunt door ermee te praten.

Met z'n drieën, in drie verschillende landen, één online opname. De afgelopen twee weken leverden meer dan tien nieuwe modelreleases op. De rode draad daarin is niet te missen: open-weight labs shippen sneller dan hun eigen infrastructuur aankan, en het kapitaal dat de gesloten labs overeind houdt, begint er per partij wel héél anders uit te zien.

Tien-plus modelreleases in twee weken

Het tempo van releases is niet langer bij te houden als regulier nieuws; het is een dagtaak geworden. Meerdere keren per dag door de modellijst van Hugging Face scrollen is inmiddels bittere noodzaak om bij te blijven — en dat zegt meer over de markt dan welke benchmark dan ook.

  • Fine-tuning komt naar AMD: Unsloth ondersteunt nu AMD-hardware. Dat betekent dat de Strix Halo-chip met 128 GB lokaal modellen kan post-trainen. Niet helemaal opnieuw trainen, maar post-trainen — en daarmee haal je een gefinetunede Qwen naar je eigen bureau in plaats van naar een datacenter.
  • Hardware beweegt de verkeerde kant op: de RTX Pro 6000 kostte twee maanden geleden nog $ 9.999. Inmiddels staat de teller op $ 12.500. Dat is een beter rendement dan de meeste aandelenportefeuilles dit jaar, maar een regelrechte belasting voor iedereen die lokaal capaciteit wil opbouwen.
  • Qwen 3.8 is deels geland: de Max-versie lanceerde deze week met 2,8 biljoen parameters, maar de open weights zijn nog niet vrijgegeven. Alibaba heeft al toegezegd de kleinere varianten — 27B en 35B, in de lijn van Qwen 3.6 — open-source te maken. En dat is precies het deel dat relevant is voor iedereen die lokaal modellen draait.

Kimi K3 legt Moonshots eigen servers plat

Kimi K3 wordt zó massaal gebruikt — door zowel Chinese als Amerikaanse bedrijven — dat Moonshots inferentiecapaciteit volledig opdroogde. Rate limits kelderden naar nul en nieuwe accounts werden resoluut stopgezet.

  • Het prijsverschil vertelt het hele verhaal: Kimi K3 zit qua intelligentie naar verluidt akelig dicht bij Fable 5, maar kost ruwweg $ 3 per miljoen inputtokens en $ 15 per miljoen outputtokens. Fable kost $ 10 in en $ 50 uit. Dezelfde orde van grootte qua capaciteiten, voor een vijfde van de prijs.
  • Restricties houden geen stand: adviseurs in Washington zijn naar verluidt verdeeld over de vraag of Amerikaanse bedrijven beperkt moeten worden tot puur Amerikaanse modellen. Zelfs als er wetgeving komt, vindt men wel een weg eromheen. Bedrijven buiten de top vijf nemen het risico; de allergrootsten willen de boetes niet riskeren.
  • Europa doet niet mee: Duitsland lanceerde een week of twee geleden zijn eerste nationale model. Het kan zich niet meten met Qwen 3.6, laat staan met de absolute top. De eerste stap is gezet, en dat is zo’n beetje het meest positieve wat je erover kunt zeggen.

Moonshot op $ 22 miljard en het waarderingsgat

In mei werd Moonshot nog gewaardeerd op $ 2 miljard. Inmiddels staat de teller op $ 22 miljard — een vertienvoudiging die vrijwel volledig gedreven wordt door de K-serie.

Vergeleken met Amerikaanse labs is dat nog steeds bescheiden. De reden daarvoor is puur geografisch, niet kwalitatief. Een Amerikaans lab dat dezelfde prestaties levert, zou zomaar een factor tien hoger worden gewaardeerd. Daar staat tegenover dat Moonshot meer weg heeft van een modelfabriek: ze leveren puur modellen, terwijl partijen als Anthropic daarnaast een volwassen desktopapplicatie (Claude Code) en flankerend onderzoek neerzetten. Vrijwel elk groot lab heeft inmiddels een eigen CLI en een agent-management-IDE — en de meeste zijn exacte kopieën van elkaar.

Het testkader van het Witte Huis

Het kader tussen de Amerikaanse regering en de toonaangevende frontier-labs ging in zo’n twee weken van idee naar bijna-formeel beleid. Nieuwe topmodellen moeten voortaan een test- en goedkeuringstraject doorlopen vóór ze gelanceerd worden — expliciet bedoeld om herhaling van de situatie rondom Fable en Mephos te voorkomen.

Het bindt overigens alleen Amerikaanse labs. Washington kan bepalen hoe Chinese modellen binnen de VS worden ingezet, maar heeft geen enkele invloed op hoe ze worden gebouwd. Die asymmetrie is precies hetzelfde pijnpunt dat exportrestricties vanaf dag één al zo lastig maakte.

Iedereen ontwikkelt eigen silicium

Google rolde intern een eigen inferentiechip uit: Frozen V2, ontworpen om de inferentiekosten op schaal binnen de eigen datacenters omlaag te drukken. De herkomst is interessant: de overname van Groq (die met een 'q') bracht een architectuur binnen die puur gericht is op pure snelheid. Frozen V2 deelt overduidelijk dat DNA. Een chip heeft minstens een half jaar nodig om na een acquisitie het daglicht te zien, dus de timing klopt naadloos.

OpenAI’s tegenhanger heet Jalapeño. Die ging in minder dan twee maanden van prototype naar implementatie in hun datacenters. Voor chips die modellen met biljoenen parameters moeten draaien, grenst die doorlooptijd aan het onwaarschijnlijke. Voor beide chips zijn overigens nog geen publieke benchmarks vrijgegeven.

Googles ontbrekende model

De volgende Gemini loopt ongeveer een maand achter op schema. Reuters meldde dat de interne targets voor codeerprestaties niet binnen de oorspronkelijke planning werden gehaald, waardoor Google opnieuw aan het trainen en finetunen is geslagen.

Die vertraging is rationeel goed te verdedigen. Fable 5 is momenteel de meetlat, en verschillende nieuwe modellen zitten daar gevaarlijk dicht tegenaan. Een model uitbrengen dat daaronder zakt, leidt geheid tot een nieuwe golf van publieke kritiek — iets waar de vorige modelgeneratie al genoeg onder heeft geleden. Het enige punt waarop Google structureel de leiding behoudt, is het contextvenster: van één miljoen naar inmiddels twee miljoen tokens. De modellen zelf houden dat tempo niet bij, al is de Gemma-serie — gericht op compacte, schaalbare inferentie op het apparaat zelf — zonder meer een slimme zet.

Mira Murati’s Inkling: native multimodaal vanaf de basis

Thinking Machines, opgericht door voormalig OpenAI-CTO Mira Murati en zo’n tien tot twaalf OpenAI-veteranen, haalde in de grootste pre-seedronde ooit $ 2 miljard op tegen een waardering van $ 12 miljard. Op 14 juli lanceerden ze hun eerste open-weight model: Inkling.

  • Native multimodaal, niet aan elkaar geplakt: vrijwel elk ander lab plakt een vision transformer op een getraind tekstmodel, dat beelden vertaalt naar iets wat het model kan verwerken. Inkling is vanaf nul getraind op een dataset van tientallen biljoenen tokens, waarvan een fors aandeel bestond uit audio, video en beeldmateriaal. Er zit geen decoder tussen die het eerst moet interpreteren.
  • Goed, niet de beste — en dat is bewust: het team maakte direct duidelijk dat het verslaan van Fable 5 niet het doel was. Ze wilden simpelweg een goed model bouwen, en in de benchmarks blijft het dan ook net onder de absolute top.
  • De Tinker API is het échte product: je finetunt Inkling door er simpelweg tegen te praten. In de live-demo kreeg het model de instructie om de letters 'e' en 'a' niet meer te gebruiken in antwoorden. De Tinker API draaide een post-training op hun eigen hardware, genereerde nieuwe weights, en pakweg 29 minuten later draaide de chat op de bijgewerkte versie. Finetuning op die schaal vreet rekenkracht en over de prijzen is nog niets bekend, maar een workflow waarin je via een gesprek van 'gedraag je anders' naar gedeployde weights gaat, is een regelrechte doorbraak.

GPT-5.6: Sol, Luna, Terra

OpenAI bracht de 5.6-familie uit, met Sol als vlaggenschip. Prijzen per miljoen tokens: Sol kost $ 5 in en $ 30 uit, Terra $ 2,50 in en $ 15 uit, en Luna $ 1 in en $ 6 uit. Sommigen schatten Sol in op het niveau van Fable.

Het interessantere aspect zit in de tokenefficiëntie. GLM bereikt zijn intelligentie door uitvoerig 'hardop te denken' en door puur volume tot het juiste antwoord te komen. OpenAI kiest de omgekeerde route: het redeneerspoor (thinking trace) op de 5.6-modellen is zó compact dat je het resultaat merkbaar sneller binnenhebt. Prijzen per token vergelijken verliest zijn waarde zodra twee modellen radicaal andere hoeveelheden tokens verbruiken voor exact dezelfde taak. Dat pleit eerder voor een nieuwe kostenstandaard dan voor wéér een nieuwe benchmark.

De cijfers: Anthropics route naar winst, xAI’s burn rate

Anthropic lijkt het enige frontier-lab met een geloofwaardige route naar winstgevendheid puur op inferentie, mogelijk al binnen één tot twee jaar. Die prognose is gebaseerd op berekeningen van Nate Ratner over Q2 — een inschatting dus, geen formeel kwartaalverslag. Bovendien hangt het er volledig vanaf hoe GPU-kosten worden geboekt: reken je ze toe aan Anthropic, dan ontstaat een ander plaatje dan wanneer investeringspartners die lasten dragen. De vraag is niet óf de boekhouding flatteus is, maar in welke mate.

xAI verbrandde in mei 2026, vóór de fusie, zo’n $ 1 miljard per maand. Zelfs in een markt waarin aan elk bedrag een extra nul lijkt te hangen, blijft een miljard per maand een astronomisch bedrag.

Aan de aanbodzijde heeft Apple inmiddels zo'n 40% van de wereldwijde geheugencapaciteit geclaimd tot ver in 2027 en 2028. Dat verklaart meteen waarom een 256 GB DDR5-kit inmiddels $ 12.000 kost, en waarom het bouwen van een lokaal datacenter voor velen financieel onhaalbaar wordt.

Waarom de gesprekken over een Duits datacenter voor OpenAI spaak liepen

OpenAI stelde voor om van Duitsland een Europees vlaggenschip te maken, inclusief financiële steun van de Duitse overheid. Duitsland wees het voorstel af.

  • De locatie was het struikelblok: de beoogde locatie lag pal aan de Franse grens, met het oog op goedkope en constante kernenergie. Een stabiele basislast is exact wat een trainingscluster nodig heeft — en precies wat het Duitse stroomnet niet kan garanderen.
  • Bureaucratie en torenhoge prijzen: vergunningstrajecten duren te lang en stroom is er veel te duur. Bedrijven die eerder Europese bouwprojecten startten en zich weer terugtrokken, gaven al publiekelijk aan nooit meer terug te keren.
  • Waarom Europa überhaupt op de radar stond: de VS loopt tegen de fysieke grenzen van zijn eigen stroomnet aan. Ongeveer de helft van de grote Amerikaanse datacenterprojecten is geannuleerd of uitgesteld omdat aansluiting simpelweg niet mogelijk was. Dat is het fysieke plafond onder de investeringsgolf van $ 2,5 biljoen. Musk kocht persoonlijk een fabrikant van turbines en generatoren — wat minder voelt als strategische diversificatie en meer als het opkopen van de laatst beschikbare capaciteit.
  • Het nucleaire vraagstuk: een standaard kerncentrale kost circa $ 10 miljard en heeft een bouwtijd van vijf tot tien jaar. Afgezet tegen de capex in AI is dat wisselgeld. Duitsland sloot zijn kerncentrales zo’n vijf jaar geleden definitief, en kampt nu met exact het energietekort dat die centrales destijds leverden. Ter vergelijking: China voegde in één enkel jaar net zoveel zonne-energie toe als Duitsland op jaarbasis in totaal opwekt.

Conclusie

Goedkope modellen winnen het op volume sneller dan welke infrastructuur dan ook kan bolwerken. Ondertussen worden de peperdure modellen vooral nog verdedigd met creatieve boekhouding in plaats van pure superioriteit. Thinking Machines is de uitzondering die je in de gaten moet houden — niet omdat Inkling alles van tafel veegt, maar omdat finetunen via dialoog de allerlaatste technische drempel wegneemt tussen een algemeen en een gespecialiseerd model. De bepalende factor voor de komende twee jaar is dan ook geen rekenkracht of intelligentie. Het is elektriciteit. En Europa is nog niet eens begonnen met de oplossing.

Luister via Spotify