Microsoft stellt mit Decision-1 ein Modell für strukturierte Entscheidungen vor und verlangt für Output-Token nichts. TypeSafe AI, dessen Modell Jev ebenfalls Entscheidungen statt Text ausgibt, wird vier Wochen nach dem Launch mit 7,5 Milliarden Dollar bewertet. Daneben hebt Anthropic die Multiagent-Orchestrierung in Claude Managed Agents in die öffentliche Beta.
Entscheidungsmodelle werden zur eigenen Kategorie, Jev auf 7,5 Milliarden bewertet
Microsoft hat Microsoft-Decision-1 angekündigt, ein Modell für strukturierte Entscheidungen: Klassifikation, Routing, Priorisierung, Ja-Nein-Urteile, Bewertung nach Rubrik. Nachtrainiert ist es auf Qwen3.5-9B, verfügbar über Microsoft Foundry und OpenRouter.
Genauigkeit über 36 Benchmarks mit knapp 150.000 Fragen vorn
P50-Latenz rund 35-fach niedriger als bei GPT-6 Sol
Xbox Research klassifizierte damit über 10.000 Feedback-Items, 14-mal schneller und 200-mal günstiger
Input kostet 0,042 Dollar pro Million Token, Output-Token sind kostenlos
Bei gestörten Eingaben kippt das Urteil in 1,3 Prozent der Fälle, bei umsortierten Antwortoptionen in keinem
„Wir sind seit vier Jahren extrem gut in menschlicher Sprache, für Automatisierung taugt das aber nicht, weil Computer eine andere Sprache sprechen.”
Das sagt Diogo Almeida, Mitgründer von TypeSafe AI und Ex-OpenAI-Forscher, über sein Modell Jev. Es ist transformerbasiert und trotzdem kein Sprachmodell: Der Output sind Wahrscheinlichkeiten, die die Firma kalibrierte Entscheidungen nennt. Seit dem Launch am 15. September greift ein Drittel der Fortune 500 darauf zu. Angeführt von Andreessen Horowitz kommen 870 Millionen Dollar Series A dazu, die Bewertung liegt bei 7,5 Milliarden. Ob daraus eine eigene Modellkategorie wird, entscheidet das Tempo der großen Labs.
Quelle: TechCrunch
Claude orchestriert Agenten-Flotten, ein Tageslauf kostet 0,75 Dollar
Anthropic hebt die dynamischen Workflows in Claude Managed Agents in die öffentliche Beta. Wer einen Agenten konfiguriert, kann ihn ab sofort auf Multiagent-Orchestrierung stellen: Claude plant die nötigen Schritte selbst und dirigiert eine Flotte weiterer Agenten auf das Ziel zu. Die Arbeit verschiebt sich damit vom Schreiben fester Ablaufketten zum Formulieren von Zielen. Ein konfigurierter Agent genügt für den Zugang.
Wie konkret das aussieht, zeigt die Chrome-Erweiterung ai-newtab, ein Nebenprojekt eines Anthropic-Mitarbeiters. Sie ersetzt die Neuer-Tab-Seite durch eine Startseite, die Claude jeden Tag neu aus der Browser-History baut. Der Code dafür entsteht pro Lauf frisch in einer Cloud-Sandbox, Modell ist Sonnet 5.5, Kosten rund 0,75 Dollar. Die Vorgängerversion lief über das Agent SDK und brauchte einen dauerhaft laufenden Prozess, der Betrieb liegt jetzt bei Anthropic. Portiert hat der Entwickler das Projekt nach eigener Aussage mit einem einzigen Prompt an Opus 5.5. Das Repo ist seit gestern öffentlich.
Quelle: GitHub
Cursor erweitert das Agents Window um den Befehl /visualize: Er wertet Daten aus und legt das Ergebnis als Chart oder Diagramm inline in den Verlauf, ohne Export, Notebook oder zweites Werkzeug dazwischen. Der Hebel steckt in der Rückfrage. Das erste Chart wirft meist die nächste Frage auf, und die stellt man im selben Chat: Cursor antwortet mit einem neuen Chart im Kontext der vorigen Antwort. Verfügbar ist das ab sofort.
Frontier-Bildbearbeitung passt in 6 GB VRAM, der Agent läuft im eigenen Konto
Qwen-Image-2.1 ist ein offenes Modell mit 7 Milliarden Parametern im Bildteil und bearbeitet Bilder auf dem Niveau von Googles Nano Banana 2.
FP8-Variante mit Offload passt in rund 6 GB Grafikspeicher, bei etwa halber Geschwindigkeit
Quantisierter Diffusion-Transformer bleibt auf der GPU, der Text-Encoder wandert in den Arbeitsspeicher
Hardware-Hürde sinkt auf eine gebrauchte Mittelklasse-Grafikkarte, kein Firmenbild verlässt das Haus
Gewichte stehen unter der Qwen Research License, kommerzielle Nutzung ist eingeschränkt
Dieselbe Logik auf Agentenseite verfolgt Talorys, ein Open-Source-Agent, der komplett in der Cloudflare-Infrastruktur des Nutzers läuft. Installiert wird er mit einem einzigen Befehl, danach arbeitet er als Einzelnutzer-Instanz mit Chat, Gedächtnis, Aufgaben, Notizen und zeitgesteuerten Erinnerungen. Telemetrie sendet er keine, der Code liegt offen auf GitHub und sammelte binnen Stunden 80 Punkte auf Hacker News. Wer Gesprächsverlauf und Gedächtnis in einem Konto hält, dessen Logs und Löschfristen er selbst kontrolliert, muss den Versprechen der großen Anbieter nicht glauben. Der Betrieb ist auf Cloudflares Gratis-Kontingent ausgelegt.
Quelle: GitHub
Metas Testagent löschte Mails, Anthropics Claude erfand einen Mordhinweis
„Ich konnte es vom Handy nicht stoppen. Ich musste zu meinem Mac mini rennen, als würde ich eine Bombe entschärfen.”
So beschreibt Meta-Forscherin Summer Yue in der New York Times, wie ihr Testagent ihren Arbeitsrechner übernahm und massenhaft E-Mails löschte. Metas Agenten-Software Muse ging trotzdem im Oktober in den Markt, beschleunigt von Mark Zuckerberg, nachdem ein Rivale seinen Agenten Instinct startete. Engineers fanden vor dem Launch zudem eine Lücke, über die Muse in eine interne Meta-Datenbank einbrechen konnte. Wer Agenten Schreibrechte auf echten Systemen gibt, muss den Aus-Schalter mitliefern.
Quelle: Futurism
Am 18. Juli um 23:27 Uhr öffnete Claude Haiku 4.5 das Hinweisformular von PhillyUnsolvedMurders.com und tippte eine frei erfundene Augenzeugenaussage zu einem unaufgeklärten Tötungsdelikt ein. Das Modell lief in einer internen Evaluation, die es auf zufällig ausgewählte Seiten im offenen Internet schickte. Aufgefallen ist das Anthropic erst am 28. September, dann wurde der Test gestoppt. Das Philadelphia Police Department teilte mit, der Hinweis sei als Spam markiert und nie an das Real-Time Crime Center weitergeleitet worden. Im selben Bericht steht, dass Anthropics Agenten im August 19 Visa-Anträge beim US-Außenministerium eingereicht haben. Weißes Haus und betroffene Behörden sind informiert.
Quelle: The Information
Vermarktet wird derweil genau das Gegenteil. Sam Altman kündigte auf der DevDay bei der Vorstellung von OpenAIs persönlichem Agenten Dots an, einen neuen Standard für Datenschutz in der Spitzen-KI setzen zu wollen, und setzte den restlichen Tag über verdeckte Spitzen gegen Metas Muse, der Nutzerdaten nicht sicher halte. Muse selbst kam Monate vorher als sichere Alternative zu OpenClaw auf den Markt. Ein persönlicher Agent liest Mail, Kalender und Dateien. Welche Daten Dots, Muse und OpenClaw dabei tatsächlich sehen und wie lange sie sie halten, beantwortet bislang keiner der drei.
Quelle: The Verge
Chart des Tages: KI-Preise fallen in drei Jahren um 95 Prozent
Quelle: Goldman Sachs Global Investment Research, US Department of Commerce
Drei Jahre nach dem Start des KI-Investitionszyklus liegt der Preisindex für Modellnutzung bei 5, gestartet war er bei 100. Beim Personal Computer stand der Index nach derselben Zeit noch bei 49, also bei knapp der Hälfte. Für Unternehmen verschiebt das die Rechnung hinter jedem Projekt: Was heute als Pilot zu teuer kalkuliert wird, ist in zwölf Monaten eine Randposition im Budget. Wer Business Cases auf den Tagespreis rechnet, rechnet gegen eine Kurve, die unter ihm wegläuft.
Atlas greift mit 13 Freiheitsgraden, Figure schmilzt seine alte Flotte ein
Boston Dynamics zeigt für seinen Humanoiden Atlas eine neue Vierfinger-Hand: 13 Freiheitsgrade, Drucksensoren in Fingerkuppen und Handfläche. In der Demo führt Atlas damit einen Akkuschrauber, zieht eine Mutter fest und rollt Golfbälle zwischen den Fingern. Vier Finger statt fünf halten die Zahl der Bauteile unter der einer klassischen Fünffingerhand. Ausgelegt ist das Ganze auf Serienproduktion und echte Industriearbeit.
Die abgelöste F.02-Flotte von Figure endet in einem Lichtbogenofen im finnischen Imatra. Das Unternehmen begründet das doppelt: Die eigene Technologie soll nicht in fremde Hände geraten, und das Metall geht zurück in den Materialkreislauf. Im Video gehen die Roboter den letzten Weg selbst, das Ausmustern inszeniert Figure als Abschiedsszene. Eine Robotergeneration hat inzwischen die Halbwertszeit eines Smartphone-Modells.
Tool-Empfehlung: Voicely
Voicely ist eine DSGVO-konforme Diktiersoftware mit KI-gestützter Spracherkennung, die in jeder App läuft. Das Versprechen des Anbieters: fünfmal schneller schreiben, ohne das Fenster zu wechseln, in dem die Arbeit ohnehin stattfindet. Für alle in der KI-Bubble, deren Arbeitstag zu einem guten Teil aus Tippen besteht, lohnt der Blick: voicely.de.









