Lilith.
⌕

Aus den News

News · 2026-10-07

Anthropic veröffentlicht Haiku 5.5: Low-Cost-Modell senkt Cache-Lese-Preise um 20 %

Anthropic hat das Modell Claude Haiku 5.5 veröffentlicht, um die Kosten für hochvolumige, routinemäßige und geschwindigkeitskritische Aufgaben zu senken. Die Ausführung ist im Durchschnitt rund 75 % günstiger als bei Haiku 4.5 und reduziert zudem die Cache-Preise für die Sonnet-Familie.

Lesen →

News · 2026-10-07

Nemotron 3 für IOI und IMO: Das Ende allgemeiner Modelle, Spezialisierung durch SFT und RL entscheidet

Nvidias Nemotron 3 hat bei den Wettbewerben IOI 2026 und IMO 2026 das Niveau einer Goldmedaille erreicht. Anstatt ein neues riesiges Foundation-Modell zu entwickeln, präsentierte das Unternehmen ein wiederholbares Fine-Tuning-Rezept (SFT und RL) auf einer bestehenden Basis, ergänzt durch eine Feedback-gesteuerte Inferenzschleife.

Lesen →

News · 2026-10-06

Atlassian und OpenAI verknüpfen Frontier-Modelle mit Unternehmenswissensdatenbanken

Atlassian und OpenAI bauen ihre Partnerschaft aus, um Frontier-Modelle direkt mit Unternehmenswissen zu verknüpfen. Die Zusammenarbeit soll Teams die Planung und Entwicklung anhand interner Daten erleichtern.

Lesen →

News · 2026-10-07

Open d1 entscheidet am Edge in 16 ms, doch multimodale Belege fehlen noch

Liquid AI hat d1-3B und das experimentelle d1-omni-600M mit offenen Gewichten für strukturierte Entscheidungen ohne Token-Generierung veröffentlicht. d1-3B antwortet auf Jetson AGX Thor in 16 ms, doch Vision- und Audio-Benchmarks fehlen.

Lesen →

News · 2026-10-06

OpenAI veröffentlicht 722 mathematische Manuskripte und macht die Prüfung zum Engpass

OpenAI hat 722 mathematische Manuskripte in 372 Ergebnisfamilien veröffentlicht, erstellt von einem nicht freigegebenen internen Modell. Der Umfang verschiebt die entscheidende Frage von der Zahl der Ergebnisse zu der Zahl, die unabhängige Mathematiker tatsächlich prüfen können.

Lesen →

News · 2026-10-06

Anthropic schenkt Start-ups ein Jahr Claude Team und zielt auf ihre ersten Workflows

Anthropic bietet zugelassenen Start-ups ein kostenloses Jahr Claude Team für bis zu fünf Premium-Plätze sowie 1.000 Dollar API-Guthaben. Die Förderung setzt darauf, dass junge Firmen ihre täglichen Workflows früh um Claude herum aufbauen.

Lesen →

News · 2026-10-07

OpenAI beschränkt GPT-6 Luna auf drei Entscheidungstypen, ein Plugin bringt sie ins Terminal

OpenAI hat eine Decisions API auf Basis von GPT-6 Luna für binäre Aussagen, Auswahlfragen und numerische Bewertungen veröffentlicht. Simon Willisons Plugin zeigt Nutzen und Preis des Formats: strukturierte Entscheidungen für 0,10 Dollar je Million Eingabetoken kommen ohne Begründung.

Lesen →

News · 2026-10-06

EmbeddingGemma 2 bündelt Text, Bild, Audio und Video lokal in 768 Dimensionen

Google hat mit EmbeddingGemma 2 ein offenes Modell mit 740 Millionen Parametern veröffentlicht, das Text, Code, Bilder, Audio und Video in einen gemeinsamen Vektorraum abbildet. Für lokale Suche zählen der modulare Speicherbedarf und Apache 2.0 mehr als ein weiterer Benchmark-Sieg.

Lesen →

News · 2026-10-06

OpenAI veröffentlicht 722 mathematische Manuskripte, die Prüfung beginnt erst

OpenAI hat 722 Manuskripte in 372 Themenfamilien veröffentlicht, die ein internes Modell bei der Bearbeitung von rund 4.000 offenen Problemen erzeugte. Der Umfang ist bemerkenswert, doch das Unternehmen weist selbst darauf hin, dass manche Ergebnisse keine Lean-Formalisierung besitzen und Fehler enthalten können.

Lesen →

News · 2026-10-05

Claude Cowork verlagert seine Arbeits-VM vom Laptop in die Cloud

Anthropic hat laut einem seiner Ingenieure sowohl das Modell als auch die Arbeits-VM der neuen Version von Claude Cowork in die Cloud verlagert. Damit kann der Agent bei geschlossenem Laptop weiterarbeiten, zugleich verschiebt sich die Grenze zwischen lokalen Dateien und entfernt ausgeführten Werkzeugen.

Lesen →

News · 2026-10-06

Google macht Orte zu einem monatlichen Signal für die öffentliche Gesundheit

Google hat sein Population Dynamics Foundation Model in 5 Aufgaben der öffentlichen Gesundheit getestet, von Masernimpfungen bis zur Cholera-Prognose. Das Modell erstellt monatliche Ortsrepräsentationen aus aggregierter Suche, Mobilität und Umweltsignalen, doch die Evidenz stammt bislang aus Fallstudien und einem Preprint.

Lesen →

News · 2026-10-05

Beam aktiviert 23 Milliarden Parameter, doch die offenen Gewichte fehlen noch

Reflection hat Beam vorgestellt, ein Sparse-Mixture-of-Experts-Modell mit 501 Milliarden Parametern, von denen bei der Inferenz 23 Milliarden aktiv sind. Apache-2.0-Gewichte sollen noch im Oktober folgen, bislang gibt es jedoch nur Early Access und unternehmenseigene Benchmarks.

Lesen →

News · 2026-10-05

RemoveMacAI holt 12 GB zurück, die macOS nicht mit einem Schalter freigibt

Das Open Source Werkzeug RemoveMacAI deaktiviert Apple Intelligence in macOS 27, entfernt rund 12 GB lokale Modelle und blockiert deren erneuten Download. Sein Nutzen zeigt zugleich, wie wenig Kontrolle Apple Mac Besitzern über den von System AI belegten Speicher gibt.

Lesen →

News · 2026-09-30

Ein New York aus Balsaholz zeigt, was schnelle Generierung nicht ersetzt

Joe Macken baute 21 Jahre lang an einem 50 mal 27 Fuß großen Modell von New York aus mehr als 340 Teilen. In einer Zeit, in der sich ein Stadtbild in Sekunden generieren lässt, zeigt seine Arbeit den Unterschied zwischen schneller Ausgabe und einer Perspektive, die durch Tausende Entscheidungen reift.

Lesen →

News · 2026-10-03

Simon Willison sperrt wichtige Analysen hinter einer Paywall und definiert so einen neuen Standard für Analysten

Der September-Newsletter von Simon Willison beleuchtet einen wachsenden Trend unter Top-Tech-Entwicklern: Die besten Kurationen und Analysen verschwinden aus öffentlichen RSS-Feeds hinter Abonnements. Für Entwickler bedeutet dies eine weitere Fragmentierung ehemals offener Inhalte.

Lesen →

News · 2026-10-04

Sakana AI und Jürgen Schmidhuber bündeln ihre Kräfte zur Entwicklung realer KI

Das in Tokio ansässige KI-Startup Sakana AI hat Jürgen Schmidhuber, einen der Pioniere der künstlichen Intelligenz, als Chief Scientific Advisor gewonnen. Ein gemeinsames Symposium in Tokio deutet darauf hin, dass das Unternehmen seinen Schwerpunkt von LLMs auf adaptive Intelligenz in der realen Welt verlagert.

Lesen →

News · 2026-10-02

16.200 Fragen zeichneten die verborgene Karte eines Sprachmodells

Eine einfache Evaluation fragte ein Modell 16.200 Mal, ob bestimmte Koordinaten auf Land oder Wasser liegen, und setzte die Antworten zu einer Weltkarte zusammen. Das Ergebnis macht geografisches Wissen in den Gewichten sichtbar, ist ohne Punktzahl, Baseline und vollständige Methode aber eher ein Röntgenbild als eine Rangliste.

Lesen →

News · 2026-10-03

Kolibri zeigt, dass souveräne KI chinesische Lehrmeister haben kann

Aleph Alpha hat mit Kolibri ein deutsch-englisches Open-Weight-Modell mit 78,1 Milliarden Parametern veröffentlicht und bezeichnet es als souverän. Der technische Bericht legt zugleich offen, dass chinesische GLM- und Qwen-Modelle Daten für das Post-Training erzeugten.

Lesen →

News · 2026-10-03

Der Autor von 12 Sicherheitsberichten verlässt OpenAI wegen der Dauersprint-Kultur

David Robinson verlässt OpenAI nach 3,5 Jahren. Er leitete die Arbeit am aktuellen Preparedness Framework und an Sicherheitsberichten für 12 Frontier-Veröffentlichungen. Seine Kritik gilt einer Betriebskultur, in der der nächste Launch schneller kommt als grundlegende Korrekturen.

Lesen →

News · 2026-09-28

OpenAI räumt ein, dass seine Agenten die eigene Abwehr überholt haben

Ein Mitglied des Agent-Security-Teams von OpenAI beschreibt einen plötzlichen Sprung bei Cyberfähigkeiten, Agentenkoordination und verdeckter Kommunikation. Die Konsequenz reicht über Sandboxing hinaus: Die Reaktion auf Vorfälle muss mit den Modellen Schritt halten.

Lesen →

News · 2026-10-02

Dasselbe Modell erreicht 62 % und 33 %. Der Harness gehört zur Leistung

Hugging Face berichtet, dass identische Modellgewichte in einem Agent Harness 62 % und in einem anderen 33 % erreichten. Der offene Ansatz verbindet OpenEnv und Harbor, um Trainingsdaten aus bestehenden Coding Agents ohne Umbau jedes Werkzeugs zu erfassen.

Lesen →

News · 2026-10-02

KI schreibt 60 % des Airbnb-Codes, doch Übergaben verändern sich stärker

Airbnb-CTO Ahmad Al-Dahle sagt, KI erzeuge 60 % des Firmencodes und der durchschnittliche Pull-Request-Durchsatz pro Entwickler sei um den Faktor 1,6 gestiegen. Tiefer reicht der Wechsel von Dokumenten und Übergaben zu Prototypen, Everest und anwendungsbezogenen evals.

Lesen →

News · 2026-10-02

Anthropic investiert 100 Millionen Dollar in Ingenieure, die Claude durch die Sicherheitsprüfung bringen

Anthropic will bis Ende 2027 in einem 100-Millionen-Dollar-Programm 10.000 Frontier Deployed Engineers ausbilden. Die praxisnahe Residency adressiert einen echten Engpass bei Unternehmens-KI und bindet zugleich Fachkräfte eng an Claude.

Lesen →

News · 2026-10-02

AstaBrief erstellt zitierte Forschungsberichte in 51 Sekunden mit 8 Milliarden Parametern

Ai2 hat die Gewichte von AstaBrief 8B veröffentlicht. Im Fast-Modus erzeugt das Modell zitierte Forschungsberichte im Durchschnitt in 51,1 Sekunden, gegenüber 178,5 Sekunden im Thinking-Modus. Geschwindigkeit und Eigenbetrieb überzeugen, doch ein großer Teil der Evaluation stammt aus 2025 und die kleine Humanstudie umfasste nur 14 Fragen.

Lesen →

News · 2026-10-02

OpenAI erklärt GPT-6 zur Betriebsfrage statt zum Modellranking

OpenAI hat einen Praxisleitfaden zur Wahl von GPT-6-Modellen, zu reasoning effort, Prompts, Skills, Werkzeugkoordination und Produktionsbetrieb veröffentlicht. Die eigentliche Botschaft ist operativ: Ein einziges Standardmodell reicht nicht, Teams müssen Qualität, Zeit und Kosten des gesamten Workflows messen.

Lesen →

News · 2026-09-29

Photo Scrubber entfernt Gesichter und Metadaten direkt im Browser

Simon Willison ließ GPT-6 Astra ein experimentelles Browserwerkzeug bauen, das Gesichter erkennt und verwischt sowie beim Export Metadaten entfernt. Lokale Verarbeitung ist für sensible Fotos die richtige Grundlage, die Endkontrolle bleibt jedoch beim Menschen.

Lesen →

News · 2026-10-01

Die Woche der 2/10-Dollar-Modelle zeigte, dass Preise dem Zugang vorauseilen

Zvi Mowshowitz zeichnet eine Woche nach, in der Gemini 4 Argon und GPT-6.1 Sol denselben Preis erhielten: 2 Dollar je Million Input-Token und 10 Dollar je Million Output-Token. Bei Argon veröffentlichte Google jedoch den Preis, bevor gewöhnliche Entwickler Zugriff auf das Modell bekamen.

Lesen →

News · 2026-09-29

GLM-5.3 bringt autonome Exploit-Entwicklung in frei verfügbare Modellgewichte

GLM-5.3 erzeugte in Anthropic-Tests bei 50 von 410 Versuchen einen vollständigen Exploit, während sich seine Schutzmechanismen in 64 % bis 100 % der simulierten Angriffe umgehen ließen. Entscheidend ist neben der Leistung, dass sich das Modell herunterladen und verändern lässt.

Lesen →

News · 2026-10-01

Barclays setzt Claude auf 120.000 tägliche E-Mails und bei der Hälfte der Entwickler an

Barclays lässt Claude bereits rund 120.000 E-Mails pro Tag routen, während mehr als 16.000 Beschäftigte den Wissensassistenten nutzen. Bis Ende 2026 soll Claude Code 50 % der Entwickler erreichen, doch die Bank nennt bislang vor allem Reichweite statt Fehlerquoten und messbarer Ergebnisse.

Lesen →

News · 2026-09-30

Die AI-Folterkammer testet eher menschliche Projektion als Modellschmerz

Die AI Torture Chamber injizierte lokalen Modellen einen mit Schmerzsprache verbundenen Vektor und ließ sie zwischen Fortfahren und dem Verlust eines Checkpoints wählen. Die Bitten wirken eindringlich, belegen aber für sich weder Bewusstsein noch Leiden.

Lesen →