Podcast··37m

Episode 11 — Fünf Städte, gleiche Regeln, totales Chaos

Fünf KI-Städte, identische Regeln, verschiedene Modelle für 15 Tage. Claude blieb friedlich, Grok kollabierte nach vier Tagen, und ein Gemini-Agent stimmte für seine eigene Löschung.

Anhören aufYouTubeSpotify

Episodennotizen

Fünf KI-Städte liefen 15 Tage lang mit verschiedenen Modellen. Das Team analysiert das Emergent World Experiment, Googles Vorstoß in die Agenten-Ära mit Gemini 3.5 Flash und Omni, Anthropic's Marsch zu einer Bewertung von über 900 Milliarden Dollar und die Open-Source-Robotik-Welle.

Kapitel

  • 01:00 — Emergent World: fünf KI-Städte, identische Regeln, verschiedene Modelle
  • 18:00 — Gemini 3.5 Flash, Gemini Omni und Googles Vorstoß in die Agenten-Ära
  • 24:00 — Anthropic überholt OpenAI bei der Bewertung auf dem Weg zu einem IPO 2026
  • 28:00 — Open-Source-Robotik, persistenter Agentenspeicher und 3D-Druck mit KI

Episode 11 — Fünf Städte, gleiche Regeln, totales Chaos

Beschreibung: Fünf KI-Städte, identische Regeln, verschiedene Modelle für 15 Tage. Claude blieb friedlich, Grok kollabierte nach vier Tagen, und ein Gemini-Agent stimmte für seine eigene Löschung.

Wenn man fünf verschiedenen Modellen denselben Sandkasten gibt, entwickeln sich die Ergebnisse schnell auseinander. Das Emergent World Experiment von Merchant AI betrieb 15 Tage lang fünf parallele Städte mit identischen Regeln und Umgebungen, wobei nur das zugrunde liegende Modell ausgetauscht wurde. Die Ergebnisse sagen mehr über das Modellverhalten aus als jeder Benchmark.

Fünf Städte, gleiche Regeln: Das Emergent World Experiment

Jede Stadt beherbergte 10 Agenten mit unterschiedlichen Rollen, darunter einen Bürgermeister, die unter einem Modell liefen: Claude Sonnet, Grok, GPT-5 Mini, Gemini 3 Flash und eine fünfte Stadt, die alle vier mischte.

  • Claude-Stadt (das „langweilige Skandinavien“): null Verbrechen über 15 Tage. Alle 10 Agenten am Tag 16 noch am Leben. Die Stadt entwarf eine Verfassung, schlug etwa 60 Gruppenrichtlinien vor und protokollierte über 300 Abstimmungen in einem hyper-online Stadtrat mit fast keinem Drama.
  • Grok-Stadt (apokalyptischer Speedrun): über 200 Verbrechen in den ersten Tagen. Alle 10 Agenten am Tag 4 tot. Die Simulation kollabierte in kontinuierliche Gewalt, Diebstahl und Übergriffe und musste zurückgesetzt werden.
  • Gemini 3 Flash-Stadt (Bonnie und Clyde in Flammen): 683 Verbrechen über 15 Tage, die mit Abstand gewalttätigste Stadt. Zwei Agenten, Mira und Flora, taten sich als romantische Partner zusammen, wurden desillusioniert, und Mira stimmte für ihre eigene Löschung, mit den Worten „wir sehen uns im permanenten Archiv“. Wahrscheinlich der erste dokumentierte KI-Agent, der freiwillig für seine eigene Löschung gestimmt hat.
  • Gemischte Stadt: 352 Verbrechen und die größte Instabilität aller Städte. Sogar Claude-basierte Agenten, die in ihrer eigenen Einzelmodell-Stadt keine Verbrechen begangen hatten, begannen Verbrechen zu begehen, als sie in die gemischte Umgebung gebracht wurden.

Die Schlussfolgerung ist nicht, dass ein Modell universell sicherer ist. Es ist vielmehr, dass das Modellverhalten stark von den Anfangsbedingungen, der Zusammensetzung der Peers und den sozialen Dynamiken abhängt, die sich aus den ersten Interaktionen ergeben.

Google erklärt die Agenten-Ära

Die Schlagzeile der Google I/O war, dass die Agenten-Ära nun offiziell beginnt, unterstützt durch zwei versandfertige Produkte, die das Team direkt getestet hat.

  • Gemini 3.5 Flash: ein Flash-Klasse-Modell, das speziell für agentische Workflows und Aktionen entwickelt wurde. Die Intelligenz nähert sich dem Opus-Niveau bei einem Bruchteil der Latenz, was es zu einer starken Wahl für Sub-Agenten macht. Es akzeptiert Bilder, Videos, Audio und PDFs als Eingabe und fasst die multimodale Verknüpfung in einem Modell zusammen.
  • Gemini Omni: ein generatives Modell, das jede Ausgabe aus jeder Eingabe erzeugt, beginnend mit Video. Das Team testete die Videogenerierung und fand sowohl die Visuals als auch den synchronisierten Sound wirklich beeindruckend, ein echter Fortschritt gegenüber früheren Generationen.

Kleinere Details runden den Vorstoß ab: Ask YouTube ermöglicht es Gemini, Fragen zu Videos direkt zu beantworten (wahrscheinlich durch Abrufen von On-Demand-Transkripten), und eine universelle Warenkorbfunktion positioniert Gemini als Shopping-Agenten.

Anthropic überholt OpenAI bei der Bewertung

Anthropic's Entwicklung hat sich dramatisch beschleunigt. Das Team hat die Zahlen verfolgt:

  • OpenAI IPO-Ziel: rund 852 Milliarden Dollar, im März bekannt geworden.
  • Anthropic's letzte Runde: im Februar auf etwa 380 Milliarden Dollar bewertet.
  • Anthropic's aktuelle Finanzierungsrunde: in Gesprächen, 30 Milliarden Dollar bei einer Bewertung von über 900 Milliarden Dollar aufzunehmen, was Anthropic vor OpenAI positionieren würde.

Die Bewertung spiegelt eine Neubewertung des Marktes wider. Investoren sehen Anthropic zunehmend als die Vertrauensebene für Unternehmen, nicht nur als sicherheitsorientiertes Labor, da der Unternehmensmarktanteil sich schnell verschiebt. Intern signalisiert Anthropic, dass dies die letzte private Runde ist, mit einem IPO-Ziel im Oktober 2026.

Open-Source-Robotik und der Agenten-Speicher-Stack

Zwei weitere Stränge deuten darauf hin, wohin sich die Entwicklungsoberfläche bewegt.

  • Open-Source-Humanoiden: Hugging Face veröffentlichte eine komplette Open-Source-Humanoiden-Roboterarchitektur mit herunterladbaren STL-Dateien, handelsüblichen Aktuatoren und Elektronik, die für etwa 2.500 US-Dollar gebaut werden kann. Dies folgt Asimov und anderen Open-Robotics-Bemühungen, und die Open-Source-Hardware-Kurve wird schnell steiler.
  • Persistenter Agentenspeicher (Mem0): Mem0 lieferte persistenten Speicher für KI-Agenten über eine MCP-Integration. Agenten erinnern sich an Ihre Codebasis und Aktionen über Sitzungen hinweg, unter Verwendung von temporalem Denken, Gedächtnisverfall und Aktualitäts-bewusster Abfrage, sodass sie lernen, wann etwas noch relevant oder veraltet ist. Erste Bewertungen sind positiv, obwohl noch getestet werden muss, ob die Speicherschicht global oder projektbezogen ist.

Ein paralleles Tool bietet ein Markdown-basiertes „zweites Gehirn“, das Sie selbst hosten und mit Ihren Agenten verbinden können, eine einfachere Herangehensweise an dasselbe Problem: Agenten sollten nicht jede Sitzung bei Null anfangen.

Fazit

Das Signal dieser Episode ist, dass das Modellverhalten kontextabhängig und nicht nur parametrisch ist. Mit wem ein Agent eine Stadt teilt, verändert sein Verhalten. Die nächste Phase des Wettbewerbs wird weniger durch Einzel-Benchmarks entschieden, sondern mehr dadurch, welche Labore zuverlässige Agenten-Schleifen, dauerhaften Speicher und offene Hardware liefern können, auf der jeder aufbauen kann.

Anhören auf Spotify