Ein Schwarm aus 10.000 Agenten legt in 88 Stunden einen Beweis für Navier-Stokes vor, und 25 Fields-Medaillisten antworten mit einer Protesterklärung. Parallel holt Mistral 3 Milliarden Euro, Nvidia will bis zu 10 Milliarden in Anthropics Börsengang stecken, und Dario Amodei fordert ausgerechnet jetzt, dass die Branche das Tempo drosselt. Die Woche hat zwei Achsen: mehr Leistung als erwartet und mehr Bremsversuche als je zuvor.
10.000 Agenten, 88 Stunden: der Beweis, der die Mathematik spaltet
Eines der sieben Millennium-Probleme ist gefallen: OpenAI erklärt die Frage nach Existenz und Glattheit dreidimensionaler Navier-Stokes-Lösungen für gelöst, geführt hat den Beweis keine Person, sondern eine Gruppe von Agenten auf einem unveröffentlichten Modell. Das Clay Mathematics Institute nennt das Problem inzwischen „offenbar erledigt”, zahlt die Million aber nicht aus, die Prüfung läuft „bewusst ohne Eile”. Gleichzeitig eskaliert der Streit um die Zuschreibung: Ein Mathematiker wirft OpenAI vor, nach einem Leak seiner Vorarbeit auf die Ziellinie gesprintet zu sein, 25 Fields-Medaillisten unterschreiben eine Erklärung gegen das Tempo der Labore. Die Rekonstruktion im Video: was der Beweis leistet, was unter Verschluss bleibt und warum das Nadelöhr ab jetzt nicht mehr das Entdecken ist, sondern das Prüfen.
Meta-Trends: Mistral holt 3 Milliarden, drei Labs treten auf die Bremse
Drei Jahre nach der Gründung holt Mistral eine Series D über 3 Milliarden Euro. Es ist die größte Eigenkapitalrunde, die ein europäisches Tech-Unternehmen je gestemmt hat.
Angeführt von Samsung, co-geleitet von EQTs Scaleup Europe Fund und PSG Equity
ASML, NVIDIA und BNP Paribas CIB bleiben an Bord
Das Kapital geht in Infrastruktur, Produktreife und Deployment im großen Maßstab
Schwerpunkt sind eigene Frontier-Modelle
Für Entscheider im DACH-Raum verschiebt das eine Rechnung: Wer Datenhoheit und EU-Hosting als harte Anforderung hat, musste sich bisher zwischen Compliance und Modellqualität entscheiden, und diese Lücke wird gerade mit drei Milliarden zugeschüttet.
Mitte der Woche kam die Zahl dazu, die alles andere relativiert: Anthropic peilt bis zu 100 Milliarden Dollar Emissionserlös an, bei einer Bewertung um 2 Billionen Dollar. Das wäre der größte Börsengang der Geschichte, Nvidia soll als Ankerinvestor bis zu 10 Milliarden beisteuern, fix ist davon nichts. Den Mut erklärt die Umsatzkurve: Anthropics annualisierter Umsatz lag Ende Juli bei 65 Milliarden Dollar, Ende 2025 waren es rund 9. Nvidia verkauft die Chips, auf denen die Modelle trainieren, und kauft nun Anteile an dem Kunden, der sie bezahlt. Das Kapital fließt im Kreis, und der Kreis wird enger.
Quelle: The Information
„Dario is right”
Mit diesen drei Worten antwortet Elon Musk zum Wochenende auf Dario Amodeis neuen Essay, in dem der Anthropic-Chef einen Dreistufenplan fordert, um die KI-Industrie zu verlangsamen. Anthropic geht den ersten Schritt einseitig: unabhängige Prüfer bekommen dauerhaften Zugang zu den Systemen, auf dem Niveau eigener Mitarbeiter. Sam Altman stimmt zu und nennt das seit Wochen internes Hauptthema bei OpenAI. Der Essay steht bei 40 Millionen Aufrufen. Bemerkenswert ist die Begründung: Die Technologie sitze auf einer Exponentialkurve, eine Wand sei nicht in Sicht.
KI-Tools: Claude-Budget wird zur Währung, Gemini zieht auf Windows ein
Anthropic nimmt CrowdStrike, Cursor, Factory, Gamma und Vercel neu in seinen Marketplace auf. Der eigentliche Hebel ist kaufmännisch: Unternehmen lösen ihr bestehendes Anthropic-Spend-Commitment für diese Claude-basierten Produkte und Agenten ein, statt jeden Anbieter einzeln durch Einkauf und Budgetfreigabe zu schleusen. So wird das Modell-Budget zur Währung für ein ganzes Werkzeug-Ökosystem. Wer ohnehin Volumen zugesagt hat, bekommt Sicherheitsanalyse, Coding-Agenten und Deployment ohne neue Vertragsrunde dazu. Der Marktplatz läuft aktuell in limitierter Preview.
Quelle: Claude
Cursor beendet mit Projects den Chat pro Aufgabe. Stattdessen arbeitet ein einziger Koordinator-Agent in einem dauerhaften Thread, immer aktiv, und verteilt die Arbeit proaktiv an Subagenten. Damit verschiebt sich die Rolle des Entwicklers weiter: weg vom Prompten einzelner Tasks, hin zum Führen eines kleinen Agenten-Teams, das den Kontext eines ganzen Projekts im Gedächtnis behält. Zusammen mit dem Marketplace-Schritt von Anthropic zeigt die Woche dieselbe Bewegung aus zwei Richtungen, das einzelne Werkzeug verschwindet in einer Plattform.
Google hat die Gemini-App für Windows veröffentlicht. Ein Tastenkürzel, Alt und Leertaste, ruft Gemini direkt auf dem Desktop auf, neben den Programmen, in denen ohnehin gearbeitet wird: Entwürfe polieren, lange Dokumente zusammenfassen, Bilder und Videos erzeugen, ohne den Browser-Tab zu wechseln. Der Assistent wandert damit vom Webfenster ins Betriebssystem. Genau dort entscheidet sich, welche KI im Arbeitsalltag tatsächlich benutzt wird: bei der, die nur einen Griff entfernt ist.
KI-Agenten: Astra hält 16 Stunden durch, Devin knackt RSA-260
METR misst nicht Benchmarks, sondern Zeit: Wie lange darf eine Aufgabe dauern, die ein Modell noch mit 80 Prozent Trefferquote löst? Die Kurve steht jetzt so da.
GPT-4 im Jahr 2023: 53 Sekunden
o1: 7 Minuten, GPT-5: 38 Minuten
Claude Opus 4.6: 1,2 Stunden
GPT-5.6 Sol: 4,6 Stunden
GPT-6 Astra: 16 Stunden, das 3,5-Fache von Sol
Der eigentliche Punkt liegt in der Linie darunter. Die AI-2027-Prognose vom Dezember 2025 hatte genau diesen Wert vorhergesagt, Astra trifft ihn exakt. Fortgeschrieben verlangt dieselbe Kurve bis Dezember rund 160 Stunden, also einen Arbeitsmonat am Stück ohne Aufsicht. Die Skala ist logarithmisch. Wer sein Unternehmen noch auf Prompts von zehn Minuten auslegt, baut für die falsche Größenordnung.
Passend dazu bündelt Microsoft bis Ende September Copilot Chat, GitHub Copilot, Cowork und seine neuen autonomen Agenten in einer App. Der Kern heißt Autopilot: dauerhaft aktive Agenten mit eigener Identität, die im Hintergrund handeln, ohne für jeden Schritt einen Prompt zu brauchen. Darunter läuft Project Opal, das die Aufgabe plant, einen abgesicherten Windows-365-Cloud-PC startet und sie per Reasoning-Modell und Computer Use selbst erledigt. Erste Kunden fahren damit Compliance-Audits: Websites ansteuern, Belege als Screenshots sichern, Doku prüfen. Der Mensch sieht jede Aktion und kann jederzeit übernehmen. Das ist keine Assistenz mehr, das ist delegierte Arbeit.
Quelle: Techcommunity
Was diese Ausdauer in der Praxis wert ist, zeigt Cognition. Devin-Agenten haben den schnellsten öffentlich bekannten GPU-Gittersieber gebaut und damit eine 260-stellige RSA-Zahl zerlegt, 862 Bit: rund 400.000 Dollar, 4.900 GPU-Tage, 16 Tage von der Polynomauswahl bis zum Ergebnis, zehnmal billiger als der Rekord von 2020. Bemerkenswert ist nicht die Zahl, sondern wer gerechnet hat. Messungen, Cluster-Betrieb und Optimierung liefen end-to-end über Agenten, wo sonst Spezialisten Monate gebraucht hätten. RSA-1024 taxieren die Autoren jetzt auf 30 Millionen Dollar. RSA-2048, der Standard hinter dem meisten TLS-Verkehr, bleibt rund eine Milliarde Mal härter und ist nicht betroffen.
Quelle: Cognition
Humanoide Roboter: Roboter bauen Roboter, Bayern produziert in Serie
In Guangzhou läuft die erste automatisierte Fertigungslinie für universelle Humanoide. Roboter bauen dort Roboter, weitgehend autonom, der erste IRON hat die Montage durchlaufen und ist am Ende selbst vom Band gelaufen. Damit verschiebt sich die entscheidende Frage. Sie lautet nicht mehr, ob ein Humanoid laufen und greifen kann, sondern zu welchen Stückkosten er sich reproduzieren lässt. Genau an dieser Stelle ist bisher jede Robotik-Vision gescheitert, an der Manufaktur. Für Industrie und Logistik im DACH-Raum heißt das: Die Verfügbarkeit kommt schneller, als die meisten Planungen dafür vorgesehen haben.
Dass das nicht nur in China passiert, zeigt Agile Robots in Fürstenfeldbruck: komplette Montagelinie mit Subkomponenten, Ganzkörper-Verkabelung und Livetest.
Agile ONE: 174 cm groß, 69 kg schwer, 2,0 m/s schnell, 20 kg Traglast
Die Hand wiegt 1,5 kg und hat 21 Gelenke, jedes mit Drehmoment- und Positionssensor
Weltweit 20.000 Robotersysteme im Feld, 2.000 Entwickler
Firmenchef Zhaopeng Chen erwartet für Physical AI einen Markt zehnmal größer als die Autoindustrie, dämpft aber die Zero-Shot-Fantasie: Automatisierung entsteht nicht durch Magie, sondern indem das Erfahrungswissen langjähriger Bediener ins Modell wandert. Genau dort hat die deutsche Industrie noch ihren Vorteil.
Quelle: Humanoidsdaily
Und die Umsätze folgen. Zehn Monate nach dem ersten kommerziellen Einsatz liegt der hochgerechnete Jahresumsatz von Skild AI bei 100 Millionen Dollar, bei über 60 zahlenden Kunden, Anfang des Jahres waren es acht. Roboter mit Skild-Hirn montieren NVIDIA-Blackwell-Racks und richten Essen an, Fortbewegung macht nur 10 Prozent des Umsatzes aus, der Rest ist Greifarbeit. Mitgründer Deepak Pathak zielt dabei auf die Demo-Kultur der Branche: Ein glatter Clip verrät nicht, ob ein Roboter die letzten 5 Prozent Zuverlässigkeit im Produktionstakt schafft. Genau dort wird das Geld verdient.
KI-Arbeitsmarkt: Lohnquote sinkt in jedem Szenario, Pentest für 115 Dollar
Anthropics Ökonomie-Team hat KI-Fähigkeiten in BIP, Löhne und Beschäftigung übersetzt. Moderat wächst die US-Wirtschaft bis 2030 um 1,6 Prozent, substanziell um 8,3, extrem um 32,4 Prozent auf 44,4 Billionen Dollar. Das mittlere Szenario setzt voraus, dass KI dann die Hälfte aller Wissensarbeit erledigt, und über 10.000 befragte Amerikaner landen im Schnitt genau in dieser Mitte, bei rund 5 Prozent Arbeitslosigkeit. Die entscheidende Zahl steht darunter: Die Lohnquote am BIP sinkt in jedem Szenario, von 59,4 auf bis zu 45,2 Prozent. Wer jetzt keine KI-Kompetenz aufbaut, steht 2030 auf der falschen Seite dieser Verschiebung.
Quelle: Anthropic
Wie diese Verschiebung konkret aussieht, lässt sich an einem einzigen Berufsbild ablesen. Keygraph hat sein Modell Shannon 3.0 gegen denselben Photoview-Build laufen lassen, an dem zuvor die kommerziellen Scanner Aikido und XBOW gemessen wurden. Alle drei getesteten Modell-Konfigurationen fanden die kritische SQL-Injection noch vor der Authentifizierung. Die Rechnung: DeepSeek v4 Flash 6,10 Dollar an Tokens, Grok 4.6 35,07 Dollar, Opus 5 115 Dollar bei sechs von sieben behobenen Lücken. Die kommerziellen Plattformen kosten 4.000 Dollar pro Scan.
Am anderen Ende derselben Bewegung steht ein Rollenwechsel. Der letzte Commit des Meta-Chefs liegt rund 13 Jahre zurück, seit April sitzt er wieder in der Codebase, und zwar mit Muse, dem hauseigenen KI-Agenten, den er kurz vorher selbst vorgestellt hat. Die Pointe steckt in der Reihenfolge: Erst baut man den Agenten, der Nicht-Entwickler zu Entwicklern macht, dann probiert man ihn an sich selbst aus und stellt fest, dass man inzwischen selbst der Nicht-Entwickler war.
Charts der Woche: FrontierMath springt von 5 auf 98 Prozent
Quelle: Epoch AI, FrontierMath
Als die schwerste Stufe des Mathematik-Benchmarks im Juli 2025 startete, löste das beste KI-Modell 5 Prozent der Aufgaben. Heute sind es 98 Prozent. Die Aufgaben stammen von Forschungsmathematikern und waren als Hürde für Jahre gedacht. Wer ein Projekt mit dem Argument zurückstellt, die KI sei dafür zu schwach, prüft diese Einschätzung besser im Quartalstakt als im Jahrestakt.
Quelle: Tracxn India Tech Annual Funding Report 2025
2025 floss Wagniskapital in Tech-Startups vor allem in die USA: 244 Milliarden Dollar und damit das 16-Fache des zweitplatzierten Großbritannien mit 15,2 Milliarden. Deutschland kommt auf 7,0 Milliarden und liegt damit auf Platz fünf, knapp hinter China mit 7,3 und vor Kanada mit 6,3. Der Abstand zur Spitze ist kein Rückstand um Prozente, sondern um den Faktor 35. Mistrals 3 Milliarden Euro aus dieser Woche sind vor diesem Hintergrund kein Einzelfall, sondern die Ausnahme.
Quelle: McKinsey-Analyse
In einer McKinsey-Modellrechnung für den Bankensektor entfallen 70 bis 75 Prozent der variablen Kosten eines Agenten-Laufs auf die menschliche Kontrolle. Die Modell-Tokens selbst kommen auf 20 bis 25 Prozent, Infrastruktur und API-Aufrufe zusammen auf rund 6 Prozent. Gerechnet ist das auf 10.000 Läufe, bei denen 10 bis 20 Prozent der Ergebnisse von Mitarbeitern geprüft werden, je rund fünf Minuten. Wer nur die Token-Preise drückt, spart am kleineren Posten. Für die Wirtschaftlichkeit zählt die Prüfquote.
Tool-Empfehlung: RelationFlow
RelationFlow ist ein KI-Workspace für Teams im Mittelstand: alle großen Modelle und selbst gehostete Endpunkte an einem Ort, das Wissen jeder Abteilung als gemeinsame Quelle eingebunden, Chats, Agenten und Prompts im Team teilbar. Wer in der KI-Bubble nicht nur Modelle vergleicht, sondern sie in einer Organisation verankern muss, findet hier genau diese Schicht, mehr Infos: relationflow.io.













