Lilith.
⌕

Aus den News

News · 2026-10-02

OpenAI erklärt GPT-6 zur Betriebsfrage statt zum Modellranking

OpenAI hat einen Praxisleitfaden zur Wahl von GPT-6-Modellen, zu reasoning effort, Prompts, Skills, Werkzeugkoordination und Produktionsbetrieb veröffentlicht. Die eigentliche Botschaft ist operativ: Ein einziges Standardmodell reicht nicht, Teams müssen Qualität, Zeit und Kosten des gesamten Workflows messen.

Lesen →

News · 2026-09-30

OpenAI stoppte ein Netzwerk mit 15.000 Nutzern, das verborgenes Modellreasoning abschöpfte

OpenAI zufolge versuchte eine koordinierte Kampagne über ein Netzwerk von mehr als 15.000 Nutzern, geschütztes Reasoning aus seinen Modellen zu extrahieren. Einen Kern der Aktivität ordnet das Unternehmen Personen aus dem Umfeld von Moonshot AI zu, schränkt diese Zuordnung aber ausdrücklich ein.

Lesen →

News · 2026-09-22

Opus 5.5 verbrauchte auf max 128.000 Token für einen einzigen Pelikan

Simon Willison verglich die neuen Modelle Claude Opus 5.5, GPT-6 Sol und GPT-6 Luna mit derselben Aufgabe eines Pelikans auf einem Fahrrad. Entscheidend war nicht das Bild: Opus 5.5 erreichte bei max effort zweimal das Limit von 128.000 Ausgabe-Token. Höherer reasoning effort braucht deshalb Budget und Sicherung.

Lesen →

News · 2026-09-15

Salesforce baut auf Nvidia für ein KI-Modell, das Enterprise-Kunden abwerben soll

Das neue Koa-Modell, das auf der Open-Weight-Architektur von Nvidia basiert, zeigt die Abkehr der Unternehmen von den großen KI-Laboren. Für routinemäßige Geschäftsaufgaben wollen Firmen keine sensiblen Daten mehr für Millionen an geschlossene Modelle senden.

Lesen →

News · 2026-09-09

GPT-6 Astra bringt endlich Business-Logik und PC-Steuerung

OpenAI hat ein Modell für den Unternehmenseinsatz eingeführt, das nicht nur besser argumentiert, sondern auch aktiv einen Computer steuern kann. Für die IT und Entwickler bedeutet dies, dass sie überdenken müssen, was sie dem Agenten erlauben.

Lesen →

News · 2026-09-09

GPT-6 Astra: Der verborgene Gedankengang verbirgt nicht mehr, als der Architektur selbst fehlt

Sebastian Raschkas Analyse zeigt, dass die kürzeren verborgenen Gedankengänge des neuen Modells nicht das Ergebnis böswilliger Absichten sind, sondern ein Nebeneffekt einer effizienteren Architektur, die auf sogenannten Looped Transformers basiert.

Lesen →

News · 2026-09-08

Skalierungsgesetze für Agenten werden zeigen, ob die Orchestrierung Dutzender LLMs eine Sackgasse ist

Nathan Lambert vom Allen Institute (AI2) wirft eine Schlüsselfrage auf: Gelten für Multi-Agenten-Schwärme die gleichen Skalierungsgesetze wie für die Modellgröße oder Inference-Time-Compute? Die Antwort wird die Richtung der Enterprise-KI-Entwicklung bestimmen.

Lesen →

News · 2026-08-11

Schwaches Modell verrät die verborgenen Gedanken seiner stärkeren Geschwister

Forscher haben ein schwaches Modell ausgenutzt, um verborgene Gedankengänge aus den stärksten Modellen zu extrahieren. Dies zeigt, dass das Verbergen der Überlegungen eines Modells in verschlüsselten Blöcken vorerst meist eine Illusion ist, die unbeabsichtigt 704 private Artefakte enthüllt.

Lesen →

News · 2026-08-12

DeepSeek startet leise V4 Pro. Bisher nur über API verfügbar

Das chinesische Startup DeepSeek hat eine neue Generation seines Modells V4 Pro ohne offizielle Pressemitteilung veröffentlicht. Das 1,7T-Parameter-Modell ist derzeit über die API auf der OpenRouter-Plattform und als Gewichte auf Hugging Face verfügbar.

Lesen →

News · 2026-08-13

llm-gemini-Plugin unterstützt 3.7 Flash-Modelle und serverseitige Tool-Experimente

Simon Willison hat die Version 0.33 seines llm-gemini-Plugins veröffentlicht. Das Update bietet Unterstützung für Googles 3.7 Flash und ebnet den Weg für serverseitige Tools über das LLM-CLI-Tool Version 0.32, das die Gedankengänge des Modells sichtbar macht.

Lesen →

News · 2026-08-29

Hy4: Tencent schließt still und leise zur Spitze der offenen Modelle auf

Tencent veröffentlichte ein neues 770B reines Textmodell mit einem 1M Kontextfenster. Für Open-Source-Entwickler bringt dies ein weiteres Schwergewicht außerhalb der traditionellen US-Achse ins Spiel.

Lesen →

News · 2026-08-26

Qwen3.8-Flash-Next bringt massive Kapazität bei spärlicher Aktivierung

Das neue Qwen ist ein massives 125B-Modell, bei dem aber nur 6B Parameter während der Inferenz aktiv sind. Es zeigt den Weg zu mehr Effizienz ohne Kapazitätsverlust.

Lesen →

News · 2026-08-21

llm-openrouter 0.7 aktiviert serverseitige Tools, Fetch und Websuche für Modelle

Simon Willison hat sein OpenRouter-Plugin aktualisiert. Die neue Version erlaubt Modellen den direkten Einsatz serverseitiger Tools wie Shell, WebFetch und WebSearch.

Lesen →