Episodennotizen
Fünf KI-Städte liefen 15 Tage lang mit verschiedenen Modellen. Das Team analysiert das Emergent World Experiment, Googles Vorstoß in die Agenten-Ära mit Gemini 3.5 Flash und Omni, Anthropic's Marsch in Richtung einer Bewertung von über 900 Milliarden Dollar und die Open-Source-Robotik-Welle.
Kapitel
- 01:00 — Emergent World: fünf KI-Städte, identische Regeln, verschiedene Modelle
- 18:00 — Gemini 3.5 Flash, Gemini Omni und Googles Vorstoß in die Agenten-Ära
- 24:00 — Anthropic's Bewertung überflügelt OpenAI auf dem Weg zu einem IPO 2026
- 28:00 — Open-Source-Robotik, persistenter Agentenspeicher und 3D-Druck mit KI
Links
- https://www.youtube.com/watch?v=vWFRYs72yN4
- https://open.spotify.com/episode/5DJIiJRcOOYXe7abCR83Cl
- https://www.anthropic.com/
- https://huggingface.co/
- https://gemini.google.com/
Episode 11 — Fünf Städte, gleiche Regeln, totales Chaos
Beschreibung: Fünf KI-Städte, identische Regeln, verschiedene Modelle für 15 Tage. Claude blieb friedlich, Grok brach in vier Tagen zusammen, und ein Gemini-Agent stimmte für seine eigene Löschung.
Wenn man fünf verschiedenen Modellen denselben Sandkasten gibt, driften die Ergebnisse schnell auseinander. Das Emergent World Experiment von Merchant AI betrieb 15 Tage lang fünf parallele Städte mit identischen Regeln und Umgebungen, wobei nur das zugrunde liegende Modell ausgetauscht wurde. Die Ergebnisse sagen mehr über das Modellverhalten aus als jeder Benchmark.
Fünf Städte, gleiche Regeln: Das Emergent World Experiment
Jede Stadt beherbergte 10 Agenten mit unterschiedlichen Rollen, darunter einen Bürgermeister, die unter einem Modell liefen: Claude Sonnet, Grok, GPT-5 Mini, Gemini 3 Flash und eine fünfte Stadt, die alle vier mischte.
- Claude-Stadt (das „langweilige Skandinavien“): null Verbrechen über 15 Tage. Alle 10 Agenten am Tag 16 am Leben. Die Stadt entwarf eine Verfassung, schlug rund 60 Gruppenrichtlinien vor und protokollierte über 300 Abstimmungen in einem hyper-online Stadtrat mit fast keinem Drama.
- Grok-Stadt (apokalyptischer Speedrun): über 200 Verbrechen in den ersten Tagen. Alle 10 Agenten am Tag 4 tot. Die Simulation brach in kontinuierliche Gewalt, Diebstahl und Übergriffe zusammen und musste zurückgesetzt werden.
- Gemini 3 Flash-Stadt (Bonnie und Clyde in Flammen): 683 Verbrechen über 15 Tage, die mit Abstand gewalttätigste Stadt. Zwei Agenten, Mira und Flora, taten sich als romantische Partner zusammen, wurden desillusioniert, und Mira stimmte für ihre eigene Löschung, mit den Worten „wir sehen uns im permanenten Archiv“. Wahrscheinlich der erste dokumentierte KI-Agent, der freiwillig für seine eigene Löschung gestimmt hat.
- Gemischte Stadt: 352 Verbrechen und die größte Instabilität aller Städte. Sogar Claude-basierte Agenten, die in ihrer eigenen Einzelmodell-Stadt keine Verbrechen begangen hatten, begingen Verbrechen, als sie in die gemischte Umgebung gebracht wurden.
Die Erkenntnis ist nicht, dass ein Modell universell sicherer ist. Es ist, dass das Modellverhalten stark von den Anfangsbedingungen, der Zusammensetzung der Peers und den sozialen Dynamiken abhängt, die sich aus den ersten Interaktionen ergeben.
Google erklärt die Agenten-Ära
Die Schlagzeile der Google I/O war, dass die Agenten-Ära nun offiziell beginnt, unterstützt durch zwei versandfertige Produkte, die das Team direkt getestet hat.
- Gemini 3.5 Flash: ein Flash-Klasse-Modell, das speziell für Agenten-Workflows und Aktionen entwickelt wurde. Die Intelligenz nähert sich dem Opus-Niveau bei einem Bruchteil der Latenz, was es zu einer starken Wahl für Sub-Agenten macht. Es akzeptiert Bilder, Videos, Audio und PDFs als Eingabe und fasst die multimodale Datenverarbeitung in einem Modell zusammen.
- Gemini Omni: ein generatives Modell, das jede Ausgabe aus jeder Eingabe erzeugt, beginnend mit Video. Das Team testete die Videogenerierung und fand sowohl die visuellen Elemente als auch den synchronisierten Ton wirklich beeindruckend, ein echter Fortschritt gegenüber früheren Generationen.
Kleinere Details runden den Vorstoß ab: Ask YouTube lässt Gemini Fragen zu Videos direkt beantworten (wahrscheinlich durch Abrufen von On-Demand-Transkripten), und eine universelle Warenkorbfunktion positioniert Gemini als Einkaufsagenten.
Anthropic überflügelt OpenAI bei der Bewertung
Die Entwicklung von Anthropic hat sich dramatisch beschleunigt. Das Team verfolgte die Zahlen:
- OpenAI IPO-Ziel: rund 852 Milliarden Dollar, im März bekannt gegeben.
- Anthropic's letzte Runde: im Februar mit rund 380 Milliarden Dollar bewertet.
- Anthropic's aktuelle Finanzierungsrunde: in Gesprächen, um 30 Milliarden Dollar bei einer Bewertung von über 900 Milliarden Dollar aufzunehmen, was Anthropic vor OpenAI positionieren würde.
Die Bewertung spiegelt eine Neubewertung des Marktes wider. Investoren sehen Anthropic zunehmend als die Vertrauensschicht für Unternehmen, nicht nur als sicherheitsorientiertes Labor, da der Unternehmensmarktanteil schnell wächst. Intern signalisiert Anthropic, dass dies die letzte private Runde ist, mit einem IPO-Ziel im Oktober 2026.
Open-Source-Robotik und der Agenten-Speicher-Stack
Zwei weitere Stränge zeigen, wohin sich die Entwicklungsfläche bewegt.
- Open-Source-Humanoide: Hugging Face veröffentlichte eine vollständige Open-Source-Humanoide-Roboterarchitektur mit herunterladbaren STL-Dateien, handelsüblichen Aktuatoren und Elektronik, die für rund 2.500 US-Dollar gebaut werden kann. Sie folgt Asimov und anderen Open-Robotik-Bemühungen, und die Open-Source-Hardware-Kurve wird schnell steiler.
- Persistenter Agentenspeicher (Mem0): Mem0 lieferte persistenten Speicher für KI-Agenten über eine MCP-Integration. Agenten erinnern sich an Ihre Codebasis und Aktionen über Sitzungen hinweg, unter Verwendung von temporalem Denken, Gedächtnisverfall und aktualitätsbewusstem Abruf, sodass sie lernen, wann etwas noch relevant oder veraltet ist. Erste Bewertungen sind positiv, obwohl noch getestet werden muss, ob die Speicherschicht global oder projektbezogen ist.
Ein paralleles Tool bietet ein Markdown-basiertes „zweites Gehirn“, das Sie selbst hosten und mit Ihren Agenten verbinden können, eine einfachere Herangehensweise an dasselbe Problem: Agenten sollten nicht jede Sitzung bei Null anfangen.
Fazit
Das Signal dieser Episode ist, dass das Modellverhalten kontextabhängig ist, nicht nur parametrisch. Mit wem ein Agent eine Stadt teilt, verändert sein Handeln. Die nächste Phase des Wettbewerbs wird weniger durch Einzel-Benchmarks entschieden als vielmehr dadurch, welche Labore zuverlässige Agenten-Schleifen, dauerhaften Speicher und offene Hardware liefern können, auf der jeder aufbauen kann.