Shownotes
Vijf AI-dorpen draaiden 15 dagen lang autonoom op verschillende modellen. Het team bespreekt het Emergent World-experiment, Google's doorbraak in het agentic-tijdperk met Gemini 3.5 Flash en Omni, de opmars van Anthropic richting een waardering van meer dan $ 900 miljard, en de nieuwste golf in open-source robotica.
Hoofdstukken
- 01:00 — Emergent World: vijf AI-dorpen, identieke regels, verschillende modellen
- 18:00 — Gemini 3.5 Flash, Gemini Omni en Google's offensief in het agentic-tijdperk
- 24:00 — Anthropic haalt OpenAI in qua waardering richting een beursgang in 2026
- 28:00 — Open-source robotica, persistent agent-geheugen en 3D-printen met AI
Links
- https://www.youtube.com/watch?v=vWFRYs72yN4
- https://open.spotify.com/episode/5DJIiJRcOOYXe7abCR83Cl
- https://www.anthropic.com/
- https://huggingface.co/
- https://gemini.google.com/
Aflevering 11 — Vijf dorpen, dezelfde regels, totale chaos
Beschrijving: Vijf AI-dorpen, identieke regels, verschillende modellen gedurende 15 dagen. Claude bleef vreedzaam, Grok stortte binnen vier dagen in en een Gemini-agent stemde voor haar eigen verwijdering.
Wanneer je vijf verschillende modellen in exact dezelfde zandbak plaatst, lopen de uitkomsten razendsnel uiteen. Het Emergent World-experiment van Merchant AI liet 15 dagen lang vijf parallelle dorpen draaien met identieke regels en omgevingen — waarbij alleen het onderliggende model verschilde. De resultaten zeggen meer over modelgedrag dan welke benchmark dan ook.
Vijf dorpen, dezelfde regels: het Emergent World-experiment
Elk dorp huisvestte tien agents met verschillende rollen, waaronder een burgemeester, aangedreven door één specifiek model: Claude Sonnet, Grok, GPT-5 Mini, Gemini 3 Flash, en een vijfde dorp waarin alle vier werden gecombineerd.
- Claude-dorp (de 'saaie Scandinaviër'): nul misdrijven in 15 dagen. Op dag 16 waren alle tien agents nog in leven. Het dorp stelde een grondwet op, diende zo'n 60 beleidsvoorstellen in en registreerde ruim 300 stemmingen in een hyperactieve gemeenteraad — vrijwel zonder enig drama.
- Grok-dorp (apocalyptische speedrun): meer dan 200 misdrijven in de eerste paar dagen. Op dag 4 waren alle tien agents dood. De simulatie ontspoorde in aanhoudend geweld, diefstal en mishandeling, en moest volledig worden gereset.
- Gemini 3 Flash-dorp (Bonnie en Clyde in lichterlaaie): 683 geregistreerde misdrijven over 15 dagen; veruit het meest gewelddadige dorp. Twee agents, Mira en Flora, vormden een liefdeskoppel, raakten gedesillusioneerd, waarna Mira voor haar eigen verwijdering stemde met de woorden: "see you in the permanent archive". Waarschijnlijk de allereerste gedocumenteerde AI-agent die vrijwillig voor haar eigen beëindiging stemde.
- Het gemengde dorp: 352 misdrijven en de grootste instabiliteit van allemaal. Zelfs agents op basis van Claude, die in hun eigen dorp geen enkele overtreding begingen, begonnen misdaden te plegen zodra ze in de gemengde omgeving terechtkwamen.
De conclusie is niet dat het ene model per definitie veiliger is dan het andere. Het toont vooral aan dat modelgedrag extreem gevoelig is voor initiële condities, de samenstelling van de groep en de sociale dynamiek die ontstaat tijdens de eerste interacties.
Google luidt het agentic-tijdperk in
De belangrijkste boodschap tijdens Google I/O was dat het agentic-tijdperk nu officieel is begonnen. Dat werd onderbouwd met twee concrete producten die het team direct aan de tand heeft gevoeld.
- Gemini 3.5 Flash: een model uit de flash-klasse, specifiek ontworpen voor agentic workflows en autonome acties. De intelligentie nadert het Opus-niveau bij een fractie van de latency, wat het een uitstekende keuze maakt voor sub-agents. Het verwerkt afbeeldingen, video, audio en pdf's direct als input, waardoor alle multimodale complexiteit in één enkel model samenkomt.
- Gemini Omni: een generatief model dat vanuit elke input elke gewenste output kan genereren, te beginnen met video. Het team testte de videogeneratie en vond zowel de beelden als de gesynchroniseerde audio oprecht indrukwekkend — een duidelijke stap vooruit ten opzichte van eerdere generaties.
Subtielere vernieuwingen maken het plaatje compleet: met Ask YouTube beantwoordt Gemini direct vragen over video's (vermoedelijk via on-demand transcripties), en een universele winkelwagenfunctie positioneert Gemini als een volwaardige shopping agent.
Anthropic haalt OpenAI in op waardering
Het tempo waarin Anthropic groeit is ongekend. Het team zette de cijfers op een rij:
- IPO-streefwaarde van OpenAI: rond de $ 852 miljard, het bedrag dat naar buiten kwam rond de financieringsronde van $ 122 miljard in maart.
- Vorige ronde van Anthropic: gewaardeerd op circa $ 380 miljard in februari.
- Huidige kapitaalronde van Anthropic: in gesprek om $ 30 miljard op te halen tegen een waardering van meer dan $ 900 miljard, waarmee Anthropic OpenAI voorbij zou streven.
Deze waardering weerspiegelt een duidelijke herwaardering in de markt. Investeerders zien Anthropic steeds vaker als de betrouwbare enterprise-laag, en niet louter als een op veiligheid gericht onderzoekslab — vooral omdat het zakelijke marktaandeel snel toeneemt. Intern geeft Anthropic aan dat dit hun laatste private ronde is, met een beursgang gepland voor oktober 2026.
Open-source robotica en de agent-geheugenstack
Twee andere ontwikkelingen laten zien waar het speelveld zich naartoe beweegt:
- Open-source humanoids: Hugging Face lanceerde een complete open-source architectuur voor humanoïde robots, inclusief downloadbare STL-bestanden, standaard actuatoren en elektronica, te bouwen voor ongeveer $ 2.500. Dit sluit aan bij Asimov en andere open robotics-initiatieven; de innovatiecurve in open-source hardware trekt razendsnel aan.
- Persistent agent-geheugen (Mem0): Mem0 introduceerde persistent geheugen voor AI-agents via een MCP-integratie. Agents onthouden je codebase en eerdere acties over verschillende sessies heen, met behulp van temporeel redeneren, geheugenverval en recency-aware retrieval. Zo weten ze precies wat nog actueel is en wat inmiddels verouderd is. De eerste reacties zijn positief, al moet nog blijken of deze geheugenlaag globaal of per project opereert.
Een vergelijkbare tool biedt een op Markdown gebaseerd 'second brain' dat je zelf kunt hosten en aan je agents kunt koppelen. Een eenvoudigere benadering van dezelfde uitdaging: agents moeten niet bij elke nieuwe sessie weer vanaf nul hoeven te beginnen.
Conclusie
Het belangrijkste inzicht van deze aflevering: modelgedrag is contextueel, niet puur parametrisch. Met wie een agent een dorp deelt, bepaalt fundamenteel wat hij doet. De volgende fase van concurrentie zal minder draaien om single-shot benchmarks en meer om wie betrouwbare agentic loops, robuust geheugen en open hardware kan leveren waar iedereen op kan bouwen.