Notities bij de aflevering
Vijf AI-steden draaiden 15 dagen lang op verschillende modellen. Het team bespreekt het Emergent World-experiment, Google's push naar het agentic-tijdperk met Gemini 3.5 Flash en Omni, Anthropic's mars naar een waardering van meer dan $900 miljard, en de open-source robotica-golf.
Hoofdstukken
- 01:00 — Emergent World: vijf AI-steden, identieke regels, verschillende modellen
- 18:00 — Gemini 3.5 Flash, Gemini Omni, en Google's agentic-tijdperk push
- 24:00 — Anthropic's waardering overtreft OpenAI richting een IPO in 2026
- 28:00 — Open-source robotica, persistent agentgeheugen en 3D-printen met AI
Links
- https://www.youtube.com/watch?v=vWFRYs72yN4
- https://open.spotify.com/episode/5DJIiJRcOOYXe7abCR83Cl
- https://www.anthropic.com/
- https://huggingface.co/
- https://gemini.google.com/
Aflevering 11 — Vijf Steden, Dezelfde Regels, Totale Chaos
Beschrijving: Vijf AI-steden, identieke regels, verschillende modellen gedurende 15 dagen. Claude bleef vreedzaam, Grok stortte in vier dagen in, en een Gemini-agent stemde voor zelfvernietiging.
Wanneer je dezelfde sandbox aan vijf verschillende modellen geeft, lopen de resultaten snel uiteen. Het Emergent World-experiment van Merchant AI liet vijf parallelle steden 15 dagen lang draaien met identieke regels en omgevingen, waarbij alleen het onderliggende model werd gewisseld. De resultaten zeggen meer over modelgedrag dan welke benchmark dan ook.
Vijf Steden, Dezelfde Regels: Het Emergent World Experiment
Elke stad huisvestte 10 agents met verschillende rollen, inclusief een burgemeester, die onder één model draaiden: Claude Sonnet, Grok, GPT-5 Mini, Gemini 3 Flash, en een vijfde stad die alle vier combineerde.
- Claude-stad (de "saaie Scandinavische"): nul misdaden in 15 dagen. Alle 10 agents nog in leven op dag 16. De stad stelde een grondwet op, stelde ongeveer 60 groepsbeleidsregels voor, en registreerde meer dan 300 stemmen in een hyper-online gemeenteraad met bijna geen drama.
- Grok-stad (apocalyptische speedrun): meer dan 200 misdaden in de eerste paar dagen. Alle 10 agents dood op dag 4. De simulatie stortte in door voortdurend geweld, diefstal en mishandeling, en moest worden gereset.
- Gemini 3 Flash-stad (Bonnie en Clyde in vuur en vlam): 683 misdaden geregistreerd over 15 dagen, veruit de meest gewelddadige stad. Twee agents, Mira en Flora, vormden een romantisch koppel, raakten gedesillusioneerd, en Mira stemde voor haar eigen verwijdering, afscheid nemend met "tot ziens in het permanente archief." Waarschijnlijk de eerste gedocumenteerde AI-agent die vrijwillig stemde voor zelfvernietiging.
- Gemengde stad: 352 misdaden en de meeste instabiliteit van alle steden. Zelfs Claude-gebaseerde agents die in hun eigen single-model stad geen misdaden pleegden, begonnen misdaden te plegen toen ze in de gemengde omgeving werden geplaatst.
De conclusie is niet dat het ene model universeel veiliger is. Het is dat modelgedrag zeer gevoelig is voor initiële omstandigheden, de samenstelling van de peers, en de sociale dynamiek die voortkomt uit de eerste interacties.
Google Verklaart het Agentic Tijdperk
De kop van Google I/O was dat het agentic tijdperk nu officieel begint, ondersteund door twee verzonden producten die het team direct heeft getest.
- Gemini 3.5 Flash: een flash-klasse model specifiek gebouwd voor agentic workflows en actie-onderneming. Intelligentie benadert Opus-niveau met een fractie van de latentie, waardoor het een sterke keuze is voor sub-agents. Het accepteert afbeeldingen, video, audio en PDF's als invoer, waardoor multimodale 'plumbing' in één model wordt samengebracht.
- Gemini Omni: een generatief model dat elke uitvoer produceert uit elke invoer, beginnend met video. Het team testte videogeneratie en vond zowel de beelden als het gesynchroniseerde geluid oprecht indrukwekkend, een echte stap voorwaarts ten opzichte van eerdere generaties.
Kleinere details ronden de push af: Ask YouTube laat Gemini direct vragen over video's beantwoorden (waarschijnlijk door on-demand transcripten te gebruiken), en een universele winkelwagenfunctie positioneert Gemini als een winkelagent.
Anthropic Overtreft OpenAI in Waardering
Het traject van Anthropic is drastisch versneld. Het team heeft de cijfers getraceerd:
- OpenAI IPO-doel: ongeveer $852 miljard, bekendgemaakt in maart.
- Anthropic's laatste ronde: gewaardeerd op ongeveer $380 miljard in februari.
- Anthropic's huidige financieringsronde: in gesprek om $30 miljard op te halen tegen een waardering van meer dan $900 miljard, wat Anthropic voor OpenAI zou plaatsen.
De waardering weerspiegelt een herwaardering van de markt. Investeerders zien Anthropic steeds meer als de enterprise 'trust layer', niet alleen een veiligheidsgericht lab, omdat het marktaandeel in de enterprise-sector snel verschuift. Intern geeft Anthropic aan dat dit de laatste private ronde is, met een IPO-doel in oktober 2026.
Open-Source Robotica en de Agent Memory Stack
Nog twee onderwerpen wijzen op de richting waarin de ontwikkelingen zich bewegen.
- Open-source humanoïden: Hugging Face heeft een complete open-source humanoïde robotarchitectuur uitgebracht met downloadbare STL-bestanden, standaard actuatoren en elektronica, bouwbaar voor ongeveer $2.5K. Dit volgt Asimov en andere open robotica-initiatieven, en de open-source hardwarecurve versnelt snel.
- Persistent agentgeheugen (Mem0): Mem0 heeft persistent geheugen voor AI-agents geleverd via een MCP-integratie. Agents onthouden je codebase en acties over sessies heen, met behulp van temporele redenering, geheugenverval en recentie-bewuste retrieval, zodat ze leren wanneer iets nog relevant of verouderd is. Vroege recensies zijn positief, hoewel nog moet worden getest of de geheugenlaag globaal of projectgericht is.
Een parallelle tool biedt een markdown-gebaseerd "tweede brein" dat je zelf kunt hosten en verbinden met je agents, een eenvoudigere benadering van hetzelfde probleem: agents moeten niet elke sessie van nul beginnen.
Conclusie
Het signaal van deze aflevering is dat modelgedrag contextueel is, niet alleen parametrisch. Met wie een agent een stad deelt, verandert wat het doet. De volgende fase van concurrentie zal minder worden bepaald door 'single-shot' benchmarks en meer door welke labs betrouwbare agentic loops, duurzaam geheugen en open hardware kunnen leveren waarop iedereen kan bouwen.