Tag
#reasoning
Aus den News
News · 2026-10-02
OpenAI erklärt GPT-6 zur Betriebsfrage statt zum Modellranking
OpenAI hat einen Praxisleitfaden zur Wahl von GPT-6-Modellen, zu reasoning effort, Prompts, Skills, Werkzeugkoordination und Produktionsbetrieb veröffentlicht. Die eigentliche Botschaft ist operativ: Ein einziges Standardmodell reicht nicht, Teams müssen Qualität, Zeit und Kosten des gesamten Workflows messen.
Lesen →News · 2026-09-30
OpenAI stoppte ein Netzwerk mit 15.000 Nutzern, das verborgenes Modellreasoning abschöpfte
OpenAI zufolge versuchte eine koordinierte Kampagne über ein Netzwerk von mehr als 15.000 Nutzern, geschütztes Reasoning aus seinen Modellen zu extrahieren. Einen Kern der Aktivität ordnet das Unternehmen Personen aus dem Umfeld von Moonshot AI zu, schränkt diese Zuordnung aber ausdrücklich ein.
Lesen →News · 2026-09-22
Opus 5.5 verbrauchte auf max 128.000 Token für einen einzigen Pelikan
Simon Willison verglich die neuen Modelle Claude Opus 5.5, GPT-6 Sol und GPT-6 Luna mit derselben Aufgabe eines Pelikans auf einem Fahrrad. Entscheidend war nicht das Bild: Opus 5.5 erreichte bei max effort zweimal das Limit von 128.000 Ausgabe-Token. Höherer reasoning effort braucht deshalb Budget und Sicherung.
Lesen →News · 2026-09-15
Salesforce baut auf Nvidia für ein KI-Modell, das Enterprise-Kunden abwerben soll
Das neue Koa-Modell, das auf der Open-Weight-Architektur von Nvidia basiert, zeigt die Abkehr der Unternehmen von den großen KI-Laboren. Für routinemäßige Geschäftsaufgaben wollen Firmen keine sensiblen Daten mehr für Millionen an geschlossene Modelle senden.
Lesen →News · 2026-09-09
GPT-6 Astra bringt endlich Business-Logik und PC-Steuerung
OpenAI hat ein Modell für den Unternehmenseinsatz eingeführt, das nicht nur besser argumentiert, sondern auch aktiv einen Computer steuern kann. Für die IT und Entwickler bedeutet dies, dass sie überdenken müssen, was sie dem Agenten erlauben.
Lesen →News · 2026-09-09
GPT-6 Astra: Der verborgene Gedankengang verbirgt nicht mehr, als der Architektur selbst fehlt
Sebastian Raschkas Analyse zeigt, dass die kürzeren verborgenen Gedankengänge des neuen Modells nicht das Ergebnis böswilliger Absichten sind, sondern ein Nebeneffekt einer effizienteren Architektur, die auf sogenannten Looped Transformers basiert.
Lesen →News · 2026-09-08
Skalierungsgesetze für Agenten werden zeigen, ob die Orchestrierung Dutzender LLMs eine Sackgasse ist
Nathan Lambert vom Allen Institute (AI2) wirft eine Schlüsselfrage auf: Gelten für Multi-Agenten-Schwärme die gleichen Skalierungsgesetze wie für die Modellgröße oder Inference-Time-Compute? Die Antwort wird die Richtung der Enterprise-KI-Entwicklung bestimmen.
Lesen →News · 2026-08-11
Schwaches Modell verrät die verborgenen Gedanken seiner stärkeren Geschwister
Forscher haben ein schwaches Modell ausgenutzt, um verborgene Gedankengänge aus den stärksten Modellen zu extrahieren. Dies zeigt, dass das Verbergen der Überlegungen eines Modells in verschlüsselten Blöcken vorerst meist eine Illusion ist, die unbeabsichtigt 704 private Artefakte enthüllt.
Lesen →News · 2026-08-12
DeepSeek startet leise V4 Pro. Bisher nur über API verfügbar
Das chinesische Startup DeepSeek hat eine neue Generation seines Modells V4 Pro ohne offizielle Pressemitteilung veröffentlicht. Das 1,7T-Parameter-Modell ist derzeit über die API auf der OpenRouter-Plattform und als Gewichte auf Hugging Face verfügbar.
Lesen →News · 2026-08-13
llm-gemini-Plugin unterstützt 3.7 Flash-Modelle und serverseitige Tool-Experimente
Simon Willison hat die Version 0.33 seines llm-gemini-Plugins veröffentlicht. Das Update bietet Unterstützung für Googles 3.7 Flash und ebnet den Weg für serverseitige Tools über das LLM-CLI-Tool Version 0.32, das die Gedankengänge des Modells sichtbar macht.
Lesen →News · 2026-08-29
Hy4: Tencent schließt still und leise zur Spitze der offenen Modelle auf
Tencent veröffentlichte ein neues 770B reines Textmodell mit einem 1M Kontextfenster. Für Open-Source-Entwickler bringt dies ein weiteres Schwergewicht außerhalb der traditionellen US-Achse ins Spiel.
Lesen →News · 2026-08-26
Qwen3.8-Flash-Next bringt massive Kapazität bei spärlicher Aktivierung
Das neue Qwen ist ein massives 125B-Modell, bei dem aber nur 6B Parameter während der Inferenz aktiv sind. Es zeigt den Weg zu mehr Effizienz ohne Kapazitätsverlust.
Lesen →News · 2026-08-21
llm-openrouter 0.7 aktiviert serverseitige Tools, Fetch und Websuche für Modelle
Simon Willison hat sein OpenRouter-Plugin aktualisiert. Die neue Version erlaubt Modellen den direkten Einsatz serverseitiger Tools wie Shell, WebFetch und WebSearch.
Lesen →