Episodennotizen
Mehr als zehn neue Modelle in nur zwei Wochen, ein Ansturm auf Kimi K3, der Moonshot dazu zwang, Neuanmeldungen komplett zu stoppen, der erste Open-Weight-Release von Mira Muratis Thinking Machines – und OpenAIs Pläne für ein deutsches Rechenzentrum, die klammheimlich an der Energiefrage scheiterten.
Kapitel
- 03:00 — Über zehn Modell-Releases in zwei Wochen und Kimi K3 am Kapazitätslimit
- 13:00 — Moonshots Sprung von 2 auf 22 Milliarden Dollar und das Test-Framework des Weißen Hauses
- 22:00 — Mira Muratis Inkling: Nativ multimodal, gefinetunt per Chat
- 32:00 — Anthropics Weg zur Profitabilität, xAIs 1-Milliarde-Burnrate und Europas Energieproblem
Links
- https://www.youtube.com/watch?v=AJPAzc-EVu0
- https://open.spotify.com/episode/1e8RiHFWcer7DNzjkNTDYW
- https://www.moonshot.ai/
- https://thinkingmachines.ai/
- https://unsloth.ai/
- https://www.deepseek.com/
Episode 15 — China sprengt die Server und Mira Muratis erstes Modell
Beschreibung: Kimi K3 liefert Frontier-Intelligenz so günstig, dass Moonshot neue Registrierungen stoppte, während Thinking Machines mit Inkling ein nativ multimodales Modell bringt, das man im Gespräch feintunt.
Drei Leute, drei Länder, eine Online-Aufnahme. In den zwei Wochen vor dieser Episode wurden mehr als zehn Modelle veröffentlicht. Das Muster dahinter ist kaum zu übersehen: Die Open-Weight-Labs shippen schneller, als ihre eigene Infrastruktur verkraften kann – und das Geld, das die Closed-Source-Labs am Leben hält, sieht je nach Akteur inzwischen völlig unterschiedlich aus.
Über zehn Modell-Releases in zwei Wochen
Die Release-Frequenz lässt sich längst nicht mehr als klassische News verfolgen – es ist ein Vollzeitjob. Mehrmals täglich durch die Modell-Listen auf Hugging Face zu scrollen, ist inzwischen die einzige Möglichkeit, den Überblick zu behalten. Das sagt mehr über den Markt aus als jeder Benchmark.
- Finetuning auf AMD: Unsloth unterstützt ab sofort AMD-Hardware. Damit kann der Strix-Halo-Chip mit 128 GB Modelle lokal post-trainieren. Kein komplettes Nachtraining, sondern Post-Training – womit ein gefinetuntes Qwen plötzlich auf dem Schreibtisch läuft statt im Rechenzentrum.
- Hardware entwickelt sich in die falsche Richtung: Vor zwei Monaten lag die RTX Pro 6000 noch bei 9.999 Dollar. Inzwischen kostet sie 12.500 Dollar. Eine bessere Rendite als die meisten Aktienportfolios dieses Jahr – und eine saftige Strafsteuer für jeden, der lokale Rechenkapazität aufbauen will.
- Qwen 3.8 ist gelandet – zumindest teilweise: Die Max-Version ging diese Woche mit 2,8 Billionen Parametern an den Start, allerdings noch ohne offene Gewichte. Alibaba hat jedoch zugesagt, die kleineren Varianten (27B und 35B im Stil von Qwen 3.6) als Open Source bereitzustellen. Und genau das ist der Teil, der für alle zählt, die Modelle lokal betreiben wollen.
Kimi K3 sprengt Moonshots eigene Server
Kimi K3 wird von chinesischen und US-amerikanischen Unternehmen derart massiv genutzt, dass Moonshots Inferenzkapazitäten restlos erschöpft waren. Die Rate-Limits fielen praktisch auf null und Neuanmeldungen wurden komplett dichtgemacht.
- Der Preisabstand ist die eigentliche Story: Kimi K3 liegt Berichten zufolge bei der Intelligenz nah an Fable 5 – kostet aber nur rund 3 Dollar pro Million Input-Tokens und 15 Dollar pro Million Output-Tokens. Fable liegt bei 10 Dollar Input und 50 Dollar Output. Ähnliche Leistungsklasse, aber ein Fünftel der Kosten.
- Verbote werden nicht halten: Berater in Washington sind offenbar gespalten bei der Frage, ob US-Unternehmen auf US-Modelle beschränkt werden sollen. Selbst wenn eine solche Regelung kommt: Entwickler und Einzelpersonen werden Wege drumherum finden. Unternehmen außerhalb der Top 5 werden das Risiko eingehen – die Top 5 werden die Strafen meiden wollen.
- Europa spielt keine Rolle: Deutschland hat vor ein, zwei Wochen sein erstes nationales Modell vorgestellt. Im Benchmark hält es nicht einmal mit Qwen 3.6 mit, geschweige denn mit der Frontier. Der erste Schritt ist gemacht – mehr lässt sich dazu aber kaum sagen.
Moonshot bei 22 Milliarden Dollar und die Bewertungslücke
Im Mai wurde Moonshot noch mit 2 Milliarden Dollar bewertet. Heute sind es 22 Milliarden – eine Verelffachung, die fast ausschließlich auf das Konto der K-Serie geht.
Gemessen an US-Labs ist das immer noch wenig – der Grund dafür liegt allerdings in der Geografie, nicht im Output. Ein US-amerikanisches Labor mit vergleichbarer Leistung würde um eine Größenordnung höher bewertet. Das Gegenargument: Moonshot agiert eher wie eine Modell-Foundry. Sie produzieren reine Modelle, während Anthropic parallel eine ausgereifte Desktop-App, Claude Code und tiefgreifende Begleitforschung liefert. Mittlerweile hat jedes große Labor sein eigenes CLI-Tool und eine eigene Agent-Management-IDE – und die meisten davon sind Klone voneinander.
Das Test-Framework des Weißen Hauses
Das Framework zwischen US-Regierung und den Frontier-Labs entwickelte sich in rund zwei Wochen von einer Idee zu einem nahezu bindenden Standard. Neue Frontier-Modelle müssen nun vor der Veröffentlichung einen Test- und Freigabeprozess durchlaufen – explizit, damit sich die Situation um Fable und Mephos nicht wiederholt.
Das Ganze bindet allerdings nur US-Labs. Die US-Regierung kann zwar regulieren, wie chinesische Modelle in den USA genutzt werden, hat aber keinerlei Einfluss darauf, wie sie trainiert werden. Genau diese Asymmetrie hat schon die Exportkontrollen so heikel gemacht.
Jeder baut sein eigenes Silizium
Google hat intern einen eigenen Inferenz-Chip ausgerollt: Frozen V2, entwickelt, um die Inferenzkosten in den eigenen Rechenzentren massiv zu senken. Der Stammbaum ist spannend: Die Übernahme von Groq (mit „q“) brachte eine Architektur ins Haus, die kompromisslos auf Durchsatz getrimmt ist – und Frozen V2 teilt augenscheinlich diese DNA. Bis ein Chip nach einer Übernahme einsatzbereit ist, vergehen mindestens sechs Monate; das Timing passt also exakt.
OpenAIs Pendant heißt Jalapeño – und schaffte es in unter zwei Monaten vom Prototyp in die Rechenzentren. Für Silizium, das Modelle mit Billionen von Parametern betreiben soll, grenzt dieser Zeitplan ans Unmögliche. Benchmarks gibt es bisher für keinen der beiden Chips.
Googles fehlendes Modell
Das nächste Gemini liegt rund einen Monat hinter dem Zeitplan. Laut Reuters wurden die internen Ziele bei der Coding-Performance im ursprünglichen Zeitfenster verfehlt, weshalb Google nun nach- und umtrainiert.
Die Verzögerung ist rational nachvollziehbar: Fable 5 ist aktuell der Maßstab, und mehrere neue Modelle spielen auf Augenhöhe. Ein Modell zu veröffentlichen, das darunter bleibt, würde nur die nächste Welle öffentlicher Kritik auslösen – die die Vorgänger bereits einstecken mussten. Der einzige Bereich, in dem Google konstant dominiert, ist der Kontext: das Ein-Millionen-Token-Fenster, mittlerweile sogar zwei Millionen. Die Modelle selbst konnten da nicht ganz Schritt halten – auch wenn die Gemma-Familie für kleine, skalierbare On-Device-Inferenz eine ausgesprochen smarte Nische besetzt.
Mira Muratis Inkling: Nativ multimodal von Grund auf
Thinking Machines – gegründet von der ehemaligen OpenAI-CTO Mira Murati und etwa zehn bis zwölf OpenAI-Urgesteinen – hat mit 2 Milliarden Dollar die größte Pre-Seed-Runde der Geschichte hingelegt und wird mit 12 Milliarden Dollar bewertet. Am 14. Juli erschien ihr erstes Open-Weight-Modell: Inkling.
- Nativ multimodal, nicht zusammengestöpselt: Fast jedes andere Lab flanscht einen Vision Transformer an ein vortrainiertes Textmodell an, der Bilder in Tokens übersetzt, die das Modell lesen kann. Inkling wurde von Grund auf in einem Trainingslauf mit zig Billionen Tokens trainiert – mit einem massiven Anteil an Audio, Video und Bildmaterial. Es gibt keinen vorgeschalteten Decoder, der die Interpretation übernimmt.
- Absichtlich gut, nicht überragend: Das Team hat klargestellt, dass es gar nicht das Ziel war, Fable 5 zu schlagen. Sie wollten ein solides Modell bauen – und in den Benchmarks liegt es unterhalb der aktuellen Frontier.
- Die Tinker API ist das eigentliche Produkt: Man finetunt Inkling, indem man sich mit ihm unterhält. In der Launch-Demo wurde das Modell angewiesen, in seinen Antworten keine E's und A's mehr zu verwenden. Die Tinker API übernahm das Post-Training auf eigener Hardware, lieferte neue Gewichte zurück – und rund 29 Minuten später lief der Chat auf der aktualisierten Version. Finetuning in dieser Größenordnung frisst massiv Inferenzressourcen und die Preisgestaltung ist noch unklar, aber ein dialogbasierter Weg von „verhalte dich anders“ bis hin zu fertig deployten Gewichten ist ein völlig neuer Ansatz.
GPT-5.6: Sol, Luna, Terra
OpenAI hat die 5.6-Modellfamilie vorgestellt, angeführt vom Topmodell Sol. Die Preise pro Million Tokens: Sol liegt bei 5 Dollar Input und 30 Dollar Output, Terra bei 2,50 Dollar Input und 15 Dollar Output, Luna bei 1 Dollar Input und 6 Dollar Output. Manche stufen Sol auf Augenhöhe mit Fable ein.
Die weitaus interessantere Eigenschaft ist jedoch die Token-Effizienz. GLM erkauft sich seine Intelligenz durch langes lautes Nachdenken („Thinking Out Loud“) und kommt über pure Masse zum richtigen Ergebnis. OpenAI geht den umgekehrten Weg: Der Thinking Trace der 5.6-Modelle ist so kompakt, dass man spürbar schneller am Ziel ist. Token-Preise verlieren ihre Aussagekraft, wenn zwei Modelle für dieselbe Aufgabe völlig unterschiedliche Token-Mengen verbrauchen. Das spricht eher für eine neue Kostenmetrik als für den nächsten Benchmark.
Die Zahlen: Anthropics Weg in die Gewinnzone, xAIs Burnrate
Anthropic scheint das einzige Frontier-Lab zu sein, das einen plausiblen Pfad zur Profitabilität allein über Inferenz vorweisen kann – womöglich schon in ein bis zwei Jahren. Die Hochrechnung basiert auf Zahlen von Nate Ratner für das zweite Quartal, ist also eher Prognose als offizieller Finanzbericht. Zudem hängt alles davon ab, wie GPUs bilanziert werden: Rechnet man sie Anthropic an, sieht das Bild anders aus; bucht man sie auf die Partner, die in Anthropic investieren, dreht es sich erneut. Die Frage ist nicht, ob die Buchhaltung geschönt ist, sondern wie sehr.
xAI verbrannte bis Mai 2026 – also vor dem Merger – rund 1 Milliarde Dollar pro Monat. Selbst in einem Markt, in dem an jede Zahl eine Null mehr gehängt wird, ist eine Milliarde im Monat eine schwindelerregende Hausnummer.
Auf der Beschaffungsseite hat sich Apple bis 2027 und 2028 rund 40 Prozent der weltweiten Speicherkapazitäten gesichert. Genau deshalb kostet ein 256-GB-DDR5-Kit inzwischen 12.000 Dollar – und genau deshalb tut der Aufbau eigener lokaler Rechenkapazitäten finanziell richtig weh.
Warum OpenAIs Verhandlungen über ein deutsches Rechenzentrum platzten
OpenAI hatte vorgeschlagen, Deutschland zu einem europäischen Flaggschiff-Standort zu machen – vorausgesetzt, der deutsche Staat investiert mit. Deutschland lehnte ab.
- Der Standort war der Knackpunkt: Der vorgeschlagene Standort lag direkt an der französischen Grenze – mit Blick auf günstigen, schwankungsfreien Atomstrom. Eine stabile Grundlast ist genau das, was ein Trainingscluster verlangt, und genau das, was das deutsche Stromnetz nicht bieten kann.
- Bürokratie und Kosten: Die Genehmigungsverfahren dauern zu lange und Energie ist zu teuer. Unternehmen, die Projekte in Europa gestartet und wieder abgebrochen haben, sagen ganz offen, dass sie nicht zurückkehren werden.
- Warum Europa überhaupt im Spiel war: Den USA geht schlicht die Netzkapazität aus. Etwa die Hälfte der großen US-Rechenzentrumsprojekte wurde gestrichen oder verschoben, weil kein Netzanschluss verfügbar war. Das ist das physische Limit hinter der 2,5-Billionen-Dollar-Investitionswelle. Musk kaufte kurzerhand einen Hersteller von Turbinen und Generatoren – was weniger nach Diversifikation aussieht als nach dem Aufkauf der letzten verfügbaren Reserven.
- Die Atomfrage: Ein Standard-Reaktor kostet rund 10 Milliarden Dollar und braucht fünf bis zehn Jahre Bauzeit. Gemessen an den Investitionsausgaben der KI-Branche ist das fast günstig. Deutschland hat seine Kraftwerke vor rund fünf Jahren abgeschaltet – und genau diesem Land fehlt heute exakt die Leistung, die diese Meiler geliefert haben. Währenddessen hat China in einem einzigen Jahr so viel Solarkapazität zugebaut, wie Deutschland insgesamt am Netz hat.
Fazit
Die günstigen Modelle gewinnen über das schiere Volumen schneller Marktanteile, als Infrastrukturen skaliert werden können – während die teuren Modelle eher durch geschickte Buchhaltung als durch Leistungsüberlegenheit verteidigt werden. Thinking Machines ist der spannendste Ausreißer: nicht, weil Inkling alles in den Schatten stellt, sondern weil Finetuning per Dialog die letzte technische Hürde zwischen einem generischen und einem hochspezialisierten Modell einreißt. Der Engpass, der die nächsten zwei Jahre entscheiden wird, ist nicht Intelligenz. Es ist Strom – und Europa hat noch nicht einmal angefangen, das Problem zu lösen.