Podcast··41m

Aflevering 16 — Astra verslaat Claude en vindt twee zero-days

Astra van OpenAI haalde een score van 100% op de exploit-benchmark en vond vóór de lancering twee zero-days. Binnen 24 uur na Fable 5.1 uitgebracht: voor het eerst lijkt OpenAI Anthropic publiekelijk voorbij te streven.

Luister viaYouTubeSpotify

Shownotes

Onze eerste aflevering na de zomerstop, met een inhaalslag van tien tot vijftien nieuwe modelreleases. Astra lanceerde met een filmisch eerbetoon in plaats van een model card, scoorde 100% op de exploit-benchmark en verscheen binnen 24 uur na Fable 5.1.

Hoofdstukken

  • 02:00 — Astra's lanceervideo, computer use en 100% op de exploit-benchmark
  • 13:00 — Astra versus Fable 5.1: welk model kies je voor welke taak?
  • 21:00 — GLM 5.3 en 5.3 Flash: bijna-frontier intelligentie op Chinese chips
  • 31:00 — Gemini 3.8 Flash, Meta's Muse, DeepSeek V4.1 Flash en de opmars van flash-modellen

Aflevering 16 — Astra verslaat Claude en vindt twee zero-days

Omschrijving: Astra van OpenAI haalde een score van 100% op de exploit-benchmark en vond vóór de lancering twee zero-days. Binnen 24 uur na Fable 5.1 uitgebracht: voor het eerst lijkt OpenAI Anthropic publiekelijk voorbij te streven.

We hebben de zomer vrijgenomen, het format tegen het licht gehouden en kwamen terug bij een backlog van tien tot vijftien modelreleases. Het echte nieuws is niet simpelweg dat OpenAI een goed model heeft uitgebracht. Het is dat voor het eerst in deze cyclus de publieke release van OpenAI overtuigender aanvoelt dan wat Anthropic gelanceerd heeft — en Anthropic had die voorsprong lange tijd stevig in handen.

Astra lanceerde met een filmscène, niet met een model card

Astra is zover wij weten het eerste model waarvan de lancering geen droge blogpost of model card was, maar een korte film. De video reconstrueert een klassieke filmscène: iemand stapt in beeld voor een scherm, gaat zitten en praat tegen de computer. In het origineel tekent die computer langzaam een gele cirkel. Iemand van OpenAI loopt dezelfde setting binnen, vraagt om diezelfde gele cirkel en krijgt hem direct — bouwt hem vervolgens uit tot een raket en schakelt soepel over naar Blender.

  • Emotie boven specificaties: dit is de marketinglogica van de auto-industrie, toegepast op AI-modellen. Je verkoopt niet de onderliggende architectuur; je verkoopt de uren die je terugkrijgt. Anthropic nam om dezelfde reden een experience en community lead aan tegen een salaris van $ 200.000 tot $ 300.000 om feesten en events op te zetten. En bij de lancering van Fable zat destijds ook een animatiefilm.
  • De demo koppelt het model direct aan een specifieke capaciteit: doordat de video volledig draait om computer use, associeert het publiek Astra nu direct met die functionaliteit. Dat is een strategisch marketingresultaat waar de meeste modelaankondigingen niet eens bij in de buurt komen.
  • 100% op de exploit-benchmark: Astra wist als eerste model een perfecte score neer te zetten en ontdekte vóór de release al twee zero-days. Wel belangrijk voor de nuance: die 100%-score werd niet behaald met het publiek vrijgegeven model. Zie het dus vooral niet als een open uitnodiging.
  • Geen hogere laag daarboven: voor het publiek is er geen model boven Astra geplaatst. Wellicht strakkere guardrails, en vermoedelijk later een flash-variant, maar geen verborgen modelreeks zoals Mephos destijds boven Fable stond.

Astra versus Fable 5.1: welk model voor welke klus?

Fable 5.1 en Mephos 5.1 verschenen op 1 september, binnen hetzelfde etmaal als Astra. De nominale prijzen bleven gelijk, maar het uitlezen van de cache is aanzienlijk efficiënter geworden — wat in de praktijk neerkomt op een besparing van zo'n 25%. Een lange sessie die voorheen $ 60 tot $ 70 kostte, kwam nu uit rond de $ 20 tot $ 30.

  • Hertraind voor agentisch werk: versie 5.1 voelt daadwerkelijk geoptimaliseerd voor autonome taken, in plaats van een simpel stickertje met een nieuw versienummer. IJzersterk in backend-taken en planning.
  • Minder overtuigend op het vertrouwde terrein: bij creatieve frontend- en UI-taken haalt het model het niveau van Opus niet. De oorspronkelijke Fable 5, in die pakweg zes dagen zonder strakke restricties, maakte meer indruk dan 5.1 nu doet.
  • De UI van Astra heeft een duidelijke 'huisstijl': verschillende YouTubers die totaal uiteenlopende prompts gebruikten, kregen interfaces terug die er visueel vrijwel identiek uitzagen. Het oogt als een design system dat hard in het model is gebakken, vergelijkbaar met hoe een Claude Code-frontend direct herkenbaar is aan de smalle kaartenstrook aan de zijkant. Of dit nu bewuste branding is of simpelweg één dominante designstijl in de trainingsdata: het patroon is consistent.
  • De taakverdeling die werkt: zet Fable 5.1 in voor de backend-architectuur en als centrale orchestrator die de sub-agents aanstuurt; gebruik Astra om de frontend in elkaar te zetten en de computer daadwerkelijk te bedienen. Zodra het draait om het navigeren en bedienen van software in plaats van puur code schrijven, is Astra simpelweg de betere keuze.

De strategische conclusie: computer use transformeert elke website die voor mensen is ontworpen in een API. Dat was precies de lastige kloof waar we het vóór de zomer over hadden: je moest continu een brug slaan tussen een interface voor een menselijke gebruiker en endpoints die een agent kan aanspreken. Astra lost dit op door de website exact zo te bedienen als een mens dat doet, maar dan vele malen sneller.

Marktaandelen verschuiven geruisloos

Een grafiek van afgelopen jaar toont hoe het enterprise API-marktaandeel van OpenAI nagenoeg halveerde, terwijl Claude terrein won. In 2023 gebruikte ongeveer de helft van alle bedrijven die met AI werkten de modellen van OpenAI. Google staat op het punt om OpenAI op een vergelijkbare manier in te halen, terwijl Meta zwak van start ging en gestaag marktaandeel verliest.

De Cursor-aflevering past naadloos in dit plaatje. Nadat Altman aangaf dat Cursor geen gebruik meer mocht maken van OpenAI-modellen, reageerde een van de medeoprichters van Cursor nuchter: OpenAI was binnen Cursor sowieso nog maar goed voor zo'n 5% van het totale API-verbruik. Zeker voor programmeerwerk is de voorsprong van OpenAI allerminst vanzelfsprekend. Al moet gezegd: Codex als applicatie steekt ijzersterk in elkaar, en Codex gecombineerd met Astra's computer use voelt bijna als een cheat code.

GLM 5.3 en 5.3 Flash: topklasse intelligentie op eigen hardware

GLM 5.3 is vorige week als open-weights model vrijgegeven: de gewichten, alles. Installeer het op je eigen GPU-clusters en je hebt toegang tot capaciteiten die tegen de absolute top aanzitten, volledig binnen je eigen infrastructuur. Dat weegt zwaarder dan welke benchmark dan ook. Bij Fable 5 en Astra heb je immers nog altijd geen controle over welke data er precies op andermans servers terechtkomt — terwijl agents juist waardevoller worden naarmate je ze toegang geeft tot meer bedrijfsdata. Medische dossiers en strikt vertrouwelijke bedrijfsdocumenten zijn immers de laatste gegevens die je op een server in Silicon Valley wilt hebben staan.

  • De cijfers: GLM 5.3 telt 753 miljard parameters, waarvan er 40 miljard actief zijn. Op diverse benchmarks meet het zich moeiteloos met Fable 5, waarmee het de belofte waarmaakt die GLM 5.2 eerder al deed tegen een fractie van de kosten. De grafieken zijn afkomstig van Z.ai, dus een gezonde dosis scepsis blijft op zijn plaats.
  • De verrassing heet Flash: GLM 5.3 Flash telt 320 miljard parameters met slechts 18 miljard actieve parameters. Technisch gezien compact, maar de verhouding tussen intelligentie en het aantal parameters tart elke verwachting.
  • Multimodaal, maar alleen op het kleinere model: Flash accepteert beelden als input; het volledige 5.3-model verwerkt uitsluitend tekst. Tegenintuïtief, en vermoedelijk een bewuste afweging rondom kosten of complexiteit in de redeneerfase.
  • Het eerste model dat volledig op Chinese chips draait: Flash werd in alle stilte gelanceerd onder de naam OX Alpha, gratis beschikbaar gesteld via OpenRouter met een capaciteit van 100 biljoen tokens per dag aan open compute. Het draaide volledig op nieuwe Xiaomi-silicon — de allereerste keer dat een model van dit kaliber end-to-end draait zonder Amerikaanse hardware.
  • Lokaal draaien is haalbaar: gekwantiseerd past GLM 5.3 Flash prima op twee DGX Sparks, wat neerkomt op een investering van zo'n $ 8.000 tot $ 10.000. Geen wisselgeld, maar ook zeker geen datacenter-investering.
  • De intensiteit van het redeneren maakt écht verschil: bij GLM 5.3 is de stap van 'low' naar 'high' aanzienlijk, en ook de stap van 'high' naar 'max' levert nog merkbaar resultaat op. Bij Fable is dat verschil gigantisch. Bij 5.3 Flash daarentegen zijn 'high' en 'max' nauwelijks uit elkaar te houden. Dat maakt Flash de uitgelezen kandidaat voor de executie, terwijl het grote model de overkoepelende planning uitzet.

De ideale workflow in de praktijk: GLM 5.3 maakt het plan, waarna 10 tot 15 Flash-subagents het web scrapen, de codebase analyseren en de code daadwerkelijk implementeren. Van alles wat er tijdens de zomerstop is uitgebracht, heeft juist deze opzet onze dagelijkse output het meest veranderd.

Gemini 3.8 Flash, Meta's Muse en DeepSeek V4.1 Flash

Gemini 3.8 Flash leent zich uitstekend voor sub-agents. Het vertrouwen in modellen van Google voor codeerwerk is nog altijd matig — grotendeels door hardnekkige vooroordelen — maar voor gestructureerde deeltaken presteert het simpelweg erg goed. Google beschikt daarnaast over een Flash Cyber-model dat specifiek gericht is op het opsporen en verhelpen van kwetsbaarheden, al zit dat vooralsnog achter slot en grendel binnen een trusted partner-programma. De échte spanning zit rondom Gemini 4: onderzoekers van Google noemen dit op X herhaaldelijk de grootste post-training run die ze ooit hebben uitgevoerd. Uitgelekte benchmarks laten zien dat het model op vrijwel elk vlak de concurrentie achter zich laat, met uitzondering van Astra. Niet officieel geverifieerd, dus mogelijk overtrokken.

Meta's Muse is gelanceerd als een agentische assistent-app die je rechtstreeks kunt aansturen via WhatsApp, voorlopig alleen uitgerold in de VS. Het positioneert zich nadrukkelijk als een agent voor eindgebruikers die geen zin hebben om zelf complexe instellingen te configureren — een commercieel slimme doelgroep. Muse Spark is technisch gezien interessanter: qua prijs per intelligentieniveau laat het Fable en Astra ver achter zich, waardoor je binnen hetzelfde budget aanzienlijk meer experimenten kunt draaien. De vraag is of die bodemprijzen overeind blijven zodra het marktaandeel eenmaal binnen is. DeepSeek liet overigens al zien hoe dat spel gespeeld wordt door actietarieven simpelweg permanent te maken.

DeepSeek V4.1 Flash verscheen op 12 september met een fundamenteel vernieuwde architectuur, wat verklaart waarom het model zowel slimmer als goedkoper is dan V4. Het is ruwweg twee keer zo groot als GLM Flash en zou logischerwijs duurder moeten uitvallen. V4 Pro tikt intussen bijna de twee biljoen parameters aan, terwijl GLM 5.3 Flash met slechts 18 miljard actieve parameters betere scores neerzet. Die claim is opvallend genoeg om te wachten op onafhankelijke benchmarks.

De opmars van flash-modellen — en wie er ontbreekt

Vrijwel elk vooraanstaand AI-lab heeft inmiddels een flash-model in het portfolio; alleen Anthropic ontbreekt nog in dat rijtje. Als we de marktontwikkelingen mogen geloven, duurt dat niet lang meer.

Je kunt er met een marketingbril naar kijken: plak de naam van je vlaggenschipmodel op een compacter model, en gebruikers projecteren de kwaliteiten van dat topmodel automatisch op een variant met nog geen tiende van de parameters. Maar de achterliggende marktvraag weegt zwaarder. Agentische architecturen vragen om razendsnelle, betaalbare modellen. Bedrijven die lokaal of op eigen servers draaien, hebben simpelweg het VRAM-budget niet voor Fable 5.1 of de volledige GLM 5.3. GLM 5.3 Flash levert grofweg de prestaties waar de topmodellen zes maanden geleden stonden, maar dan in een formaat dat je gekwantiseerd op twee Sparks draait.

Om de schaalgrootte aan de andere kant van het spectrum te illustreren: Siri verwerkt zo'n drie miljard verzoeken per jaar, en de nieuwste versie — waarschijnlijk aangedreven door Gemini 3.8 Flash — wordt voorlopig nog niet in Europa uitgeleverd. Google verwerkt daarentegen dagelijks tussen de 8,5 en 14 miljard zoekopdrachten, met een marktaandeel van circa 90%. Vrijwel iedereen op aarde is dagelijks verantwoordelijk voor minstens één zoekopdracht, bots meegerekend.

Conclusie

De kloof tussen de absolute topklasse en modellen die 'goed genoeg' zijn, is afgelopen zomer razendsnel gedicht — en wel vanuit het goedkopere segment. Astra bewees dat je met een lancering een concrete functionaliteit kunt neerzetten in plaats van een lijst droge specificaties, en toonde aan dat computer use hét middel is om het reguliere internet om te vormen tot bruikbare infrastructuur voor agents. Toch zijn het juist de compacte modellen die onze dagelijkse manier van werken fundamenteel hebben veranderd. Wanneer 18 miljard actieve parameters op Chinese chips het zware uitvoerende werk overnemen terwijl een topmodel de strategie bewaakt, draait het niet meer om de vraag welk lab vooroploopt — maar om de vraag welke architectuur je werk het snelst gedaan krijgt.

Luister via Spotify