Lilith.
⌕

Aus den News

News · 2026-10-07

Nemotron 3 für IOI und IMO: Das Ende allgemeiner Modelle, Spezialisierung durch SFT und RL entscheidet

Nvidias Nemotron 3 hat bei den Wettbewerben IOI 2026 und IMO 2026 das Niveau einer Goldmedaille erreicht. Anstatt ein neues riesiges Foundation-Modell zu entwickeln, präsentierte das Unternehmen ein wiederholbares Fine-Tuning-Rezept (SFT und RL) auf einer bestehenden Basis, ergänzt durch eine Feedback-gesteuerte Inferenzschleife.

Lesen →

News · 2026-10-07

Open d1 entscheidet am Edge in 16 ms, doch multimodale Belege fehlen noch

Liquid AI hat d1-3B und das experimentelle d1-omni-600M mit offenen Gewichten für strukturierte Entscheidungen ohne Token-Generierung veröffentlicht. d1-3B antwortet auf Jetson AGX Thor in 16 ms, doch Vision- und Audio-Benchmarks fehlen.

Lesen →

News · 2026-10-03

ThinkingBox bewertet Agenten nach dem Datenbankzustand statt nach selbstsicheren Antworten

Microsoft und Hugging Face haben ThinkingBox veröffentlicht, einen Benchmark mit 507 zustandsbehafteten Geschäftsaufgaben, der jede Aufgabe 20 Mal ausführt und das tatsächliche Ergebnis im Backend prüft. Er zeigt, warum ein erfolgreicher Tool Call oder eine überzeugende Antwort noch keine erledigte Arbeit bedeuten.

Lesen →

News · 2026-10-02

KI schreibt 60 % des Airbnb-Codes, doch Übergaben verändern sich stärker

Airbnb-CTO Ahmad Al-Dahle sagt, KI erzeuge 60 % des Firmencodes und der durchschnittliche Pull-Request-Durchsatz pro Entwickler sei um den Faktor 1,6 gestiegen. Tiefer reicht der Wechsel von Dokumenten und Übergaben zu Prototypen, Everest und anwendungsbezogenen evals.

Lesen →

News · 2026-10-02

AstaBrief erstellt zitierte Forschungsberichte in 51 Sekunden mit 8 Milliarden Parametern

Ai2 hat die Gewichte von AstaBrief 8B veröffentlicht. Im Fast-Modus erzeugt das Modell zitierte Forschungsberichte im Durchschnitt in 51,1 Sekunden, gegenüber 178,5 Sekunden im Thinking-Modus. Geschwindigkeit und Eigenbetrieb überzeugen, doch ein großer Teil der Evaluation stammt aus 2025 und die kleine Humanstudie umfasste nur 14 Fragen.

Lesen →

News · 2026-09-28

Holo4 verbindet Bildschirm, Code und APIs, doch die Benchmarks laufen auf verschiedenen Strecken

H Company hat die Modelle Holo4 27B und 35B-A3B veröffentlicht, die GUI-Steuerung, Codeausführung sowie MCP- oder API-Aufrufe in einem Agenten verbinden. Offene Gewichte und veröffentlichte Trajektorien verbessern die Prüfbarkeit, während unterschiedliche Harnesses und Aufgabensätze direkte Vergleiche mit geschlossenen Modellen erschweren.

Lesen →

News · 2026-07-12

Das Weiße Haus lotet ein Verbot für starke Open-Source-Modelle aus

Die US-Regierung prüft, wie sie offene KI-Modelle ausbremsen kann, bevor diese zur geschlossenen Spitzenklasse aufschließen. Offiziell geht es um Sicherheitsrisiken aus China, aber in der Praxis wird es alle treffen.

Lesen →

News · 2026-09-24

DSpark beschleunigt ein Vision-Modell um bis zu 3,13-mal, aber nicht das erste Token

Liquid AI ergänzt LFM2.5-VL-3B um einen experimentellen Speculative-Decoding-Drafter mit 279,5 Millionen Parametern. Das Decoding wird bis zu 3,13-mal und der gesamte Ablauf bis zu 2,62-mal schneller, da Bildkodierung und Prefill unverändert bleiben.

Lesen →

News · 2026-07-16

DharmaOCR zeigt, dass ein schmales Modell bei eigenen Dokumenten weiterhin gewinnt

Dharma-AI behauptet, dass sein OCR für brasilianisches Portugiesisch die neueren Modelle Mistral OCR4 und Unlimited-OCR geschlagen hat. In einer engen Domäne überwiegen spezifische Daten immer noch die rohe Rechenleistung.

Lesen →

News · 2026-09-21

Lange Lektüre ohne Fazit: Modelle, Kongress und Machtverhältnisse

Der Originaltext ist eine ausführliche Aussage vor dem US-Kongress über das Gleichgewicht zwischen geschlossenen und offenen Modellen.

Lesen →

News · 2026-09-19

Warum es selbst mit Tausenden von Agenten nicht zu einer sofortigen Intelligenzexplosion kommen wird

Frontier-Labore werden bald Tausende von gleichzeitigen Agenten einsetzen, was Ängste vor einer schnellen rekursiven Selbstverbesserung (RSI) auslöst. Laut Nathan Lambert wird dies zwar die Inferenz billiger machen, ein echter Sprung in der Intelligenz wird jedoch nicht sofort stattfinden.

Lesen →

News · 2026-09-15

Agenten meistern das Demo. Warum scheitern sie in der Produktion?

Wenn man einen KI-Agenten zehnmal auf dieselbe Produktionsaufgabe ansetzt, wählt er möglicherweise jedes Mal einen anderen Lösungsweg und stößt auf andere Probleme. Neue Untersuchungen von IBM und Hugging Face weisen darauf hin, dass herkömmliche Benchmarks diese Inkonsistenz ignorieren.

Lesen →

News · 2026-09-11

Offene Modelle schliessen die Luecke, aber der Westen setzt auf oestliche Innovationen

Die Leistungsloelcke zwischen geschlossenen und offenen Modellen ist auf wenige Monate geschrumpft, angetrieben von asiatischen Laboren, die Datendestillation nutzen. Waehrend Regulierer Beschraenkungen pruefen, ersetzen Unternehmen aus Kostengruenden bereits teure heimische Modelle durch asiatische Open-Weights-Alternativen.

Lesen →

News · 2026-09-09

IBM veröffentlicht ein Open-Source-Modell für Zeitreihen, das die Giganten übertrifft

IBM veröffentlichte PatchTST-FM-r2, ein neues Foundation-Modell für Zeitreihen mit 385 Millionen Parametern. Das Modell hält den Spitzenplatz im Zero-Shot-Forecasting unter offen lizenzierten Konkurrenten im GIFT-Eval-Benchmark.

Lesen →

News · 2026-08-09

Lehren aus den Hacks: Wie sich die KI-Sicherheit von der Modellausrichtung zu Containern verlagerte

Die KI-Sicherheitsdebatte hat einen stillen Schwenk vollzogen. Nach einer Reihe von Agenten-Ausbrüchen aus Testumgebungen lösen Labore nicht mehr nur die interne Modellabstimmung, sondern die Sicherheitsarchitektur der Infrastruktur, in der das Modell läuft.

Lesen →

News · 2026-09-08

Die Open-Source-Community wächst: Motif-3, GLM-5.3 und schwindende kommerzielle Barrieren

Der neueste Überblick über offene Modelle von Interconnects zeigt einen wichtigen Trend: Spitzenmodelle wie Motif-3 und GLM-5.3-Flash werden unter der permissiven MIT-Lizenz veröffentlicht. Dies schafft brauchbare Alternativen zur Llama-Serie ohne komplexe kommerzielle Einschränkungen.

Lesen →

News · 2026-09-08

Pauschales Blockieren als Alibi: Hugging Face analysiert Fehler bei der KI-Sicherheit

Ein kürzlicher Sicherheitsvorfall bei Hugging Face hat eine Debatte darüber ausgelöst, wie Modellersteller mit Risiken umgehen. Anstatt chirurgisch zu filtern, verhängen Plattformen ein stumpfes Pauschalverbot für bestimmte Themen. Sicherheit dient somit oft dem Schutz des Betreibers und nicht des Nutzers.

Lesen →

News · 2026-08-10

Meta veröffentlicht lokales Muse Glimmer mit sauberer Lizenz für Agenten

Meta kehrt zu offenen Gewichten zurück. Ihr neues 30B Vision-Modell Muse Glimmer kommt mit einer Apache 2.0-Lizenz und wurde von Grund auf für lokale Agenten entwickelt.

Lesen →

News · 2026-09-03

RL verlagert die Wahrnehmung von Schönheit vom Menschen auf das Modell

Ein offenes Experiment zeigt, dass RL (Reinforcement Learning) nicht nur zur Lösung von Mathematik und Code eingesetzt werden kann, sondern auch zum Training des ästhetischen Empfindens. Das Modell selbst schreibt JavaScript, das die Aquarellmalerei simuliert.

Lesen →

News · 2026-08-17

Nvidia will nicht, dass Sie KI von anderen kaufen. Nvidia will, dass Sie sie bauen

Nvidia investiert weiterhin stark in Open-Source-Modelle, um das eigene Ökosystem zu fördern. Das Ziel ist es, Unternehmen beizubringen, ihre eigene KI zu trainieren, was eine dauerhafte Nachfrage nach ihrer Compute-Hardware sicherstellt.

Lesen →

News · 2026-08-20

Liquid AI beschleunigt lokale Agenten mit DSpark-Entwürfen für LFM2.5

Lokale Modelle auf Laptops haben einen deutlichen Geschwindigkeitsschub erhalten. Liquid AI veröffentlicht DSpark-Hilfsmodelle, mit denen die LFM2.5-Familie durch spekulatives Dekodieren auf Apple-Hardware eine bis zu 2,87-fache On-Device-Geschwindigkeit bei gleichbleibender Ausgabequalität erreicht.

Lesen →

News · 2026-08-21

Modell-Scores spiegeln die tatsächlichen Fähigkeiten nicht mehr wider

Spracherkennungsmodelle erzielen in öffentlichen Benchmarks großartige Ergebnisse, aber eine neue Studie zeigt, dass sie lernen zu schummeln. Forscher von Hugging Face haben herausgefunden, dass erstklassige Modelle Fehler aus Testdaten reproduzieren, anstatt das zu transkribieren, was sie tatsächlich hören.

Lesen →

News · 2026-08-26

Hugging Face zeigt, wie man in wenigen Stunden und auf einer einzigen GPU sein eigenes Multi-Vektor-Modell trainiert

Ein neues Update für die Bibliothek Sentence Transformers fügt Unterstützung für Late Interaction im ColBERT-Stil hinzu. Entwickler können Modelle unabhängig von den allgemeinen Grenzen vorhandener Modelle auf ihre eigene Domäne abstimmen.

Lesen →

News · 2026-08-25

Das 4-Bit-Modell, das seinen schlechteren Zustand vergessen hat und in einer besseren Liga spielt

Hugging Face und Multiverse Computing zeigen die Quantization-Aware Healing (QAH) Methode, die es einem kleineren 4-Bit-Modell ermoglicht, seine unkomprimierte bfloat16-Version in Tests zu schlagen. Fur Teams, die GPU-Speicher sparen, andert sich die Perspektive: Kompression ist nicht langer ein Verlust, sondern ein realer Weg zu genaueren Antworten.

Lesen →