Shownotes
Erste Folge nach der Sommerpause – und direkt zehn bis fünfzehn Modell-Releases zum Aufholen. Astra startete mit einer Film-Hommage statt einer Model Card, holte 100 % im Exploit-Benchmark und landete im selben 24-Stunden-Fenster wie Fable 5.1.
Kapitel
- 02:00 — Astras Launch-Video, Computer Use und 100 % im Exploit-Benchmark
- 13:00 — Astra versus Fable 5.1: Welches Modell für welchen Job
- 21:00 — GLM 5.3 und 5.3 Flash: Beinahe-Frontier-Intelligenz auf chinesischen Chips
- 31:00 — Gemini 3.8 Flash, Metas Muse, DeepSeek V4.1 Flash und die Flash-Modell-Flut
Links
- https://www.youtube.com/watch?v=b5q0nfrW3Kw
- https://open.spotify.com/episode/0DrG06gQQ0D1wIgdu1Lifr
- https://openai.com/
- https://www.anthropic.com/
- https://z.ai/
- https://www.deepseek.com/
Episode 16 — Astra schlägt Claude und findet zwei Zero-Days
Beschreibung: OpenAIs Astra holt 100 % im Exploit-Benchmark und findet zwei Zero-Days vor dem Launch – erschienen im selben 24-Stunden-Fenster wie Fable 5.1. Zum ersten Mal wirkt OpenAI öffentlich stärker als Anthropic.
Wir haben uns den Sommer über Zeit genommen, das Format überdacht und kamen zurück zu einem Berg von zehn bis fünfzehn Modell-Releases. Die eigentliche Schlagzeile ist dabei nicht, dass OpenAI ein gutes Modell geliefert hat. Sondern: Zum ersten Mal in diesem Zyklus wirkte das, was OpenAI öffentlich gelauncht hat, stärker als das, was Anthropic öffentlich gezeigt hat – und Anthropic hatte diesen Vorsprung verdammt lange inne.
Astra startete mit einer Filmszene statt einer Model Card
Astra ist das erste Modell, an das wir uns erinnern können, dessen Launch ein Kurzfilm statt eines Blogposts samt Model Card war. Das Video baut eine klassische Filmszene nach: Jemand tritt vor einem Bildschirm ins Bild, setzt sich hin und spricht mit seinem Computer. Im Original zeichnet der Rechner langsam einen gelben Kreis. Jemand von OpenAI betritt dasselbe Setting, verlangt denselben gelben Kreis, bekommt ihn sofort, erweitert ihn zu einer Rakete und wechselt dann direkt in Blender.
- Emotion vor Spezifikation: Das ist die Logik von Autowerbung, angewandt auf KI-Modelle. Man verkauft nicht die Architektur, sondern die Stunden, die man den Leuten zurückgibt. Anthropic hat aus genau demselben Grund eine Leitung für Experience und Community mit einem Gehalt von 200.000 bis 300.000 Dollar eingestellt, um Partys und Events zu veranstalten. Und auch Fables eigener Launch war an einen Animationsfilm gekoppelt.
- Die Demo koppelt das Modell an eine konkrete Fähigkeit: Weil es im Video um Computer Use geht, verbinden die Leute Astra nun gezielt mit genau dieser Fähigkeit. Ein Marketing-Erfolg, den die meisten Modell-Launches verfehlen.
- 100 % im Exploit-Benchmark: Astra ist das erste Modell, das dort ein perfektes Ergebnis erzielt hat, und es hat vor dem Release zwei Zero-Days aufgespürt. Wichtig zur Einordnung: Die 100 % stammen nicht vom frei veröffentlichten Modell. Niemand sollte das als Einladung verstehen.
- Keine Stufe darüber: Öffentlich gibt es kein Modell über Astra. Engere Guardrails, wahrscheinlich, und später vermutlich eine Flash-Variante – aber keine versteckte Modellfamilie wie damals, als Mephos über Fable stand.
Astra vs. Fable 5.1: Welches Modell für welchen Job?
Fable 5.1 und Mephos 5.1 kamen am 1. September heraus – innerhalb desselben 24-Stunden-Fensters wie Astra. Die nominalen Preise blieben gleich, aber Cache-Reads wurden effizienter, was in der Praxis etwa 25 % Ersparnis bedeutet. Ein langer Run, der eigentlich 60 bis 70 Dollar hätte kosten müssen, lag am Ende eher bei 20 bis 30 Dollar.
- Neu trainiert für agentisches Arbeiten: 5.1 fühlt sich wirklich für agentische Workflows optimiert an, statt nur umetikettiert worden zu sein. Stark im Backend, stark in der Planung.
- Schwächer dort, wo es früher am stärksten war: Bei kreativer Frontend- und UI-Arbeit kommt es nicht an Opus heran. Das ursprüngliche Fable 5 war in seinen knapp sechs Tagen ohne harte Guardrails beeindruckender als 5.1 heute.
- Astras UI hat einen Hausstil: Verschiedene YouTuber mit völlig unterschiedlichen Prompts erzeugten optisch verblüffend ähnliche Interfaces. Es wirkt wie ein Design-System, das fest im Modell eingebrannt ist – ähnlich wie sich ein Claude-Code-Frontend an der kleinen Kartenleiste an der Seite erkennen lässt. Ob das bewusste Differenzierung ist oder einfach ein einziger gelernter Design-Skill für alles: Es ist durchgängig konsistent.
- Die Aufteilung, die funktioniert: Fable 5.1 für die Backend-Implementierung und als Orchestrator, der die Sub-Agents zusammenhält; Astra, um das Frontend zusammenzubringen und tatsächlich den Rechner zu steuern. Astra ist die bessere Wahl, wenn die Aufgabe darin besteht, Software zu bedienen, statt Code zu schreiben.
Strategisch bedeutet das: Computer Use verwandelt jede für Menschen gebaute Website in eine API. Das war genau die lästige Lücke, über die wir vor der Pause gesprochen haben – man musste irgendwie die Brücke schlagen von einer Seite für Menschen hin zu etwas, das ein Agent ansprechen kann. Astra schließt diese Lücke, indem es die Website wie ein Mensch bedient, nur viel schneller.
Der Marktanteil verschiebt sich rasant
Ein Chart aus dem letzten Jahr zeigt, wie sich OpenAIs Enterprise-API-Marktanteil in etwa halbiert hat, während Claude vorbeizog. 2023 nutzte noch rund die Hälfte aller Unternehmen, die überhaupt Modelle einsetzten, OpenAI. Google steht jetzt kurz vor demselben Überholmanöver, und Meta startete schwach und baute weiter ab.
Die Cursor-Folge passt genau in dieses Muster. Nachdem Altman verkündet hatte, dass Cursor keine OpenAI-Modelle mehr nutzen dürfe, antwortete einer der Cursor-Mitgründer trocken, dass OpenAI ohnehin nur rund 5 % des gesamten API-Verbrauchs bei Cursor ausmache. Speziell beim Coding ist OpenAIs Vorsprung keineswegs offensichtlich – auch wenn Codex als Anwendung exzellent ist und Codex in Kombination mit Astras Computer Use fast schon wie ein Cheat-Code wirkt.
GLM 5.3 und 5.3 Flash: Frontier-Intelligenz zum Selbst-Hosten
GLM 5.3 wurde letzte Woche als Open-Weights-Modell veröffentlicht: Gewichte, alles. Man packt es auf die eigenen GPUs und hat Beinahe-Frontier-Performance in der eigenen Infrastruktur. Das wiegt mehr als jeder Benchmark. Denn bei Fable 5 und Astra hat man nach wie vor keine Kontrolle darüber, welche Daten auf fremden Servern landen – und Agents werden genau dann nützlicher, wenn man ihnen mehr Daten zum Arbeiten gibt. Patientendaten und vertrauliche Geschäftsunterlagen sind genau die Daten, die man am allerwenigsten in irgendeiner Cloud-Region im Silicon Valley sehen will.
- Die Zahlen: GLM 5.3 kommt auf 753 Milliarden Parameter, davon 40 Milliarden aktiv. In manchen Benchmarks liegt es gleichauf mit Fable 5 und untermauert damit den Anspruch, den GLM 5.2 bereits zu einem Bruchteil der Kosten von Fable erhoben hatte. Die Charts stammen von Z.ai, etwas Skepsis ist also angebracht.
- Flash ist die Überraschung: GLM 5.3 Flash hat 320 Milliarden Parameter, davon nur 18 Milliarden aktiv. Technisch gesehen klein – und die Intelligenz pro Parameter sprengt jede bisherige Logik.
- Multimodal nur bei der kleinen Version: Flash verarbeitet Bildeingaben. Das vollständige 5.3 ist rein textbasiert. Kontraintuitiv – und vermutlich eine Entscheidung rund um Kosten oder Komplexität beim Reasoning.
- Erstes Modell, das komplett auf chinesischen Chips läuft: Flash startete still und leise als OX Alpha, kostenlos für alle auf OpenRouter, mit 100 Billionen Tokens Rechenleistung pro Tag. Es lief auf neuem Xiaomi-Silicon – das erste Mal, dass ein Modell dieser Klasse durchgehend ohne US-Hardware bereitgestellt wurde.
- Lauffähig im eigenen Setup: Entsprechend quantisiert passt GLM 5.3 Flash auf zwei DGX Sparks, also rund 8.000 bis 10.000 Dollar. Nicht billig, aber eben auch kein Rechenzentrum.
- Reasoning Effort macht tatsächlich einen Unterschied: Bei GLM 5.3 ist der Sprung von „low“ zu „high“ groß, und von „high“ zu „max“ immer noch spürbar. Bei Fable ist der Unterschied gewaltig. Bei 5.3 Flash hingegen sind „high“ und „max“ kaum zu unterscheiden – was Flash zum idealen Umsetzer macht, während das große Modell die Planung übernimmt.
Das funktionierende Muster: GLM 5.3 plant, und 10 bis 15 Flash-Sub-Agents scrapen das Web, analysieren die Codebasis und implementieren. Von allem, was in der Pause herauskam, hat dieses Setup unseren täglichen Output am stärksten verändert.
Gemini 3.8 Flash, Metas Muse und DeepSeek V4.1 Flash
Gemini 3.8 Flash ist exzellent für Sub-Agents. Das Vertrauen in Google-Modelle beim Coding ist nach wie vor gering – meist ein übernommenes Vorurteil –, aber bei orchestrierten Teilaufgaben liefert es ab. Google hat außerdem ein Flash-Cyber-Modell im Portfolio, das Schwachstellen finden und beheben soll, allerdings hinter einem Trusted-Partner-Programm verschlossen ist. Die eigentliche Spannung liegt auf Gemini 4: Google-Forscher auf X bezeichnen es durchgehend als ihren bisher größten Post-Training-Run, und geleakte Benchmarks zeigen, dass es in mehreren Kategorien fast alles außer Astra hinter sich lässt. Unbestätigt und möglicherweise gefälscht.
Metas Muse kam als agentische persönliche Assistenten-App auf den Markt, die man über WhatsApp anschreiben kann – vorerst nur in den USA ausgerollt. Es wirkt wie ein Agent für Leute, die keinen Agenten konfigurieren wollen, was ein absolut valider Markt ist. Muse Spark ist das spannendere Release: Beim Preis pro Intelligenz liegt es weit vor Fable oder Astra, was schlicht viel mehr Experimente im selben Budget erlaubt. Ob dieser Preis nach der Eroberung von Marktanteilen stabil bleibt, ist die offene Frage – und DeepSeek hat bereits vorgemacht, was als Nächstes passieren kann, indem sie Aktionspreise einfach dauerhaft beibehielten.
DeepSeek V4.1 Flash landete am 12. September mit einer völlig neuen Architektur – deshalb ist es klüger und günstiger als V4. Es ist etwa doppelt so groß wie GLM Flash, sollte also mehr kosten, und V4 Pro liegt bei fast zwei Billionen Parametern, während GLM 5.3 Flash mit 18 Milliarden aktiven Parametern darüber scort. Dieser Vergleich ist verdächtig genug, um unabhängige Zahlen abwarten zu wollen.
Die Flash-Flut – und das eine Labor, das noch fehlt
Jedes Labor hat mittlerweile ein Flash-Modell – bis auf Anthropic. Wenn man dem Muster folgt, sind sie als Nächstes dran.
Man kann das als Marketing-Schachzug interpretieren: Man hängt den Namen eines Frontier-Modells an ein kleines Modell, und die Leute übertragen das Intelligenzversprechen auf etwas mit weniger als einem Zehntel der Parameter. Die plausiblere Erklärung ist jedoch schlichte Nachfrage. Agentische Workloads brauchen günstige, schnelle Modelle – und lokale On-Premise- oder Homelab-Deployments werden nie den VRAM für ein Fable 5.1 oder das volle GLM 5.3 haben. GLM 5.3 Flash steht etwa da, wo Frontier-Modelle vor sechs Monaten standen – aber in einer Größe, die quantisiert auf zwei Sparks passt.
Um die Dimensionen auf der anderen Seite einzuordnen: Siri verarbeitet rund drei Milliarden Anfragen im Jahr, und die neue Version – unter der Haube vermutlich Gemini 3.8 Flash – wird in Europa vorerst nicht starten. Google verarbeitet bei rund 90 % Marktanteil zwischen 8,5 und 14 Milliarden Suchanfragen pro Tag. Rein rechnerisch entfällt auf jeden Menschen auf dem Planeten mindestens eine, Bots eingerechnet.
Fazit
Die Lücke zwischen Frontier-Leistung und „gut genug“ hat sich über den Sommer drastisch geschlossen – und zwar von der günstigen Seite her. Astra hat bewiesen, dass ein Launch ein echtes Feature statt eines Datenblatts verkaufen kann und dass Computer Use die Funktion ist, die das restliche Internet in Infrastruktur verwandelt, die ein Agent bedienen kann. Aber die Modelle, die unsere Arbeitsweise wirklich verändert haben, sind die kleinen. Wenn 18 Milliarden aktive Parameter auf chinesischem Silicon die Umsetzung übernehmen, während ein Frontier-Modell das Denken steuert, lautet die Frage nicht mehr, welches KI-Labor vorne liegt – sondern welche Kombination die Arbeit tatsächlich erledigt.