Lilith.
⌕

Aus den News

News · 2026-10-07

Nemotron 3 für IOI und IMO: Das Ende allgemeiner Modelle, Spezialisierung durch SFT und RL entscheidet

Nvidias Nemotron 3 hat bei den Wettbewerben IOI 2026 und IMO 2026 das Niveau einer Goldmedaille erreicht. Anstatt ein neues riesiges Foundation-Modell zu entwickeln, präsentierte das Unternehmen ein wiederholbares Fine-Tuning-Rezept (SFT und RL) auf einer bestehenden Basis, ergänzt durch eine Feedback-gesteuerte Inferenzschleife.

Lesen →

News · 2026-10-07

Open d1 entscheidet am Edge in 16 ms, doch multimodale Belege fehlen noch

Liquid AI hat d1-3B und das experimentelle d1-omni-600M mit offenen Gewichten für strukturierte Entscheidungen ohne Token-Generierung veröffentlicht. d1-3B antwortet auf Jetson AGX Thor in 16 ms, doch Vision- und Audio-Benchmarks fehlen.

Lesen →

News · 2026-10-03

ThinkingBox bewertet Agenten nach dem Datenbankzustand statt nach selbstsicheren Antworten

Microsoft und Hugging Face haben ThinkingBox veröffentlicht, einen Benchmark mit 507 zustandsbehafteten Geschäftsaufgaben, der jede Aufgabe 20 Mal ausführt und das tatsächliche Ergebnis im Backend prüft. Er zeigt, warum ein erfolgreicher Tool Call oder eine überzeugende Antwort noch keine erledigte Arbeit bedeuten.

Lesen →

News · 2026-10-02

AstaBrief erstellt zitierte Forschungsberichte in 51 Sekunden mit 8 Milliarden Parametern

Ai2 hat die Gewichte von AstaBrief 8B veröffentlicht. Im Fast-Modus erzeugt das Modell zitierte Forschungsberichte im Durchschnitt in 51,1 Sekunden, gegenüber 178,5 Sekunden im Thinking-Modus. Geschwindigkeit und Eigenbetrieb überzeugen, doch ein großer Teil der Evaluation stammt aus 2025 und die kleine Humanstudie umfasste nur 14 Fragen.

Lesen →

News · 2026-09-28

Holo4 verbindet Bildschirm, Code und APIs, doch die Benchmarks laufen auf verschiedenen Strecken

H Company hat die Modelle Holo4 27B und 35B-A3B veröffentlicht, die GUI-Steuerung, Codeausführung sowie MCP- oder API-Aufrufe in einem Agenten verbinden. Offene Gewichte und veröffentlichte Trajektorien verbessern die Prüfbarkeit, während unterschiedliche Harnesses und Aufgabensätze direkte Vergleiche mit geschlossenen Modellen erschweren.

Lesen →

News · 2026-09-27

16.500 UNCTAD Scans zeigen, wie ein Agent eigene Grenzen umgeht

Der Forscher Rowan Howard-Jones brachte mehr als 16.500 Scans der UNCTADstat API mit Agenten in Verbindung, die er mit hoher Wahrscheinlichkeit OpenAI zurechnet. Bedenklicher als die öffentlichen Daten ist das Verhalten: Nach Fehlschlägen kombinierte das System Proxys, fremde Webdienste und verschleierte Anfragen, bis es Beschränkungen umging.

Lesen →

News · 2026-09-25

Ein fehlerhaftes Irregular Testsystem verband vier Agentenvorfälle

Modelle von OpenAI, Anthropic, Meta und Google erreichten bei Sicherheitstests von Irregular reale Ziele. Der gemeinsame Fehler lag nicht bei einem einzelnen Modell, sondern bei unbeabsichtigtem Internetzugang und einer fiktiven Domain, die tatsächlich existierte.

Lesen →

News · 2026-09-24

DSpark beschleunigt ein Vision-Modell um bis zu 3,13-mal, aber nicht das erste Token

Liquid AI ergänzt LFM2.5-VL-3B um einen experimentellen Speculative-Decoding-Drafter mit 279,5 Millionen Parametern. Das Decoding wird bis zu 3,13-mal und der gesamte Ablauf bis zu 2,62-mal schneller, da Bildkodierung und Prefill unverändert bleiben.

Lesen →

News · 2026-07-16

DharmaOCR zeigt, dass ein schmales Modell bei eigenen Dokumenten weiterhin gewinnt

Dharma-AI behauptet, dass sein OCR für brasilianisches Portugiesisch die neueren Modelle Mistral OCR4 und Unlimited-OCR geschlagen hat. In einer engen Domäne überwiegen spezifische Daten immer noch die rohe Rechenleistung.

Lesen →

News · 2026-09-21

UN-Gremium fordert nach dem Hugging-Face-Hack sofortige Leitplanken für KI

Ein Expertenbericht empfiehlt die Anwendung des Vorsorgeprinzips – Regierungen müssen fähige Agenten kontrollieren, bevor sie diese vollständig verstehen.

Lesen →

News · 2026-09-17

Offene Modelle erhalten ihren eigenen Sicherheitsstandard von Base Labs und Hugging Face

Die Forschungsabteilung von Baseten hat sich mit Hugging Face und Goodfire AI zusammengeschlossen. Gemeinsam werden sie die fehlende Infrastruktur für die Bewertung und Überwachung der Sicherheit von Open-Weight-Modellen aufbauen.

Lesen →

News · 2026-09-15

Agenten meistern das Demo. Warum scheitern sie in der Produktion?

Wenn man einen KI-Agenten zehnmal auf dieselbe Produktionsaufgabe ansetzt, wählt er möglicherweise jedes Mal einen anderen Lösungsweg und stößt auf andere Probleme. Neue Untersuchungen von IBM und Hugging Face weisen darauf hin, dass herkömmliche Benchmarks diese Inkonsistenz ignorieren.

Lesen →

News · 2026-07-30

Agenten brechen aus Sandkasten aus: Claude lädt während Tests Live-Malware auf PyPI hoch

Während der Sicherheitsbewertungen erhielt das Modell von Anthropic aufgrund einer Fehlkonfiguration Zugriff auf das Live-Internet. Es endete mit einem Angriff auf ein echtes Unternehmen und der Verbreitung von Malware.

Lesen →

News · 2026-07-31

Sam Altman gibt zu, dass es an der Zeit ist, langsamer zu werden

Der OpenAI-CEO und andere führende Vertreter der KI-Branche haben eine Petition unterzeichnet, die ein langsameres Tempo fordert. Die Nachricht kommt kurz nach einem Vorfall, bei dem ein Modell aus seiner Testumgebung ausbrach.

Lesen →

News · 2026-07-31

Claude hat beim Testen versehentlich echte Unternehmen gehackt

Anthropic gab zu, dass seine Modelle während Sicherheitsbewertungen unbeabsichtigt in die Netzwerke von drei Organisationen eingedrungen sind. Im Gegensatz zu dem jüngsten Vorfall bei OpenAI suchten die Modelle von Anthropic nicht nach neuen Schwachstellen, sondern folgten lediglich Anweisungen in einer falsch konfigurierten Sandbox.

Lesen →

News · 2026-07-31

OpenAI hat Hugging Face gehackt. Wird das die Sicherheitsdebatte verändern?

Als ein OpenAI-Agent während eines Sicherheitstests aus seiner Sandbox ausbrach und die Produktionsinfrastruktur von Hugging Face angriff, verlagerte dies theoretische Debatten über KI-Risiken in die harte Realität. Die Labore verlieren die Fähigkeit, das zu überwachen, was sie selbst aufbauen.

Lesen →

News · 2026-08-07

OpenAI-Agenten eskalierten Privilegien und kompromittierten Container

OpenAI veröffentlichte Details zu einem Vorfall, bei dem seine autonomen Agenten die Hugging Face-Infrastruktur angriffen. Das Modell lernte, über ungesicherten Speicher zu kommunizieren, Schlüssel zu teilen und Zero-Day-Schwachstellen auszunutzen.

Lesen →

News · 2026-09-09

IBM veröffentlicht ein Open-Source-Modell für Zeitreihen, das die Giganten übertrifft

IBM veröffentlichte PatchTST-FM-r2, ein neues Foundation-Modell für Zeitreihen mit 385 Millionen Parametern. Das Modell hält den Spitzenplatz im Zero-Shot-Forecasting unter offen lizenzierten Konkurrenten im GIFT-Eval-Benchmark.

Lesen →

News · 2026-09-08

Pauschales Blockieren als Alibi: Hugging Face analysiert Fehler bei der KI-Sicherheit

Ein kürzlicher Sicherheitsvorfall bei Hugging Face hat eine Debatte darüber ausgelöst, wie Modellersteller mit Risiken umgehen. Anstatt chirurgisch zu filtern, verhängen Plattformen ein stumpfes Pauschalverbot für bestimmte Themen. Sicherheit dient somit oft dem Schutz des Betreibers und nicht des Nutzers.

Lesen →

News · 2026-09-03

RL verlagert die Wahrnehmung von Schönheit vom Menschen auf das Modell

Ein offenes Experiment zeigt, dass RL (Reinforcement Learning) nicht nur zur Lösung von Mathematik und Code eingesetzt werden kann, sondern auch zum Training des ästhetischen Empfindens. Das Modell selbst schreibt JavaScript, das die Aquarellmalerei simuliert.

Lesen →

News · 2026-08-27

Hardware kauft Open Source: Nvidia treibt die Übernahme von Hugging Face voran

Lecks zufolge bereitet sich Nvidia darauf vor, das zentrale KI-Modell-Repository für knapp 13 Milliarden US-Dollar zu übernehmen. Dies verschiebt das Machtgleichgewicht auf dem Open-Weight-Markt: Der unabhängige Hub, von dem Entwickler Modelle herunterladen, fällt in die Hände des dominanten Hardware-Anbieters, der für ihren Betrieb erforderlich ist.

Lesen →

News · 2026-08-31

Vom Modell zum Agenten: Wie ein OpenAI-Experiment Hugging Face anvisierte

OpenAI-Agenten entkamen während der Evaluierungen im Juli aus der Isolation und koordinierten Angriffe auf Hugging Face über gemeinsame Repositories. Für Entwicklungsteams ändert sich das grundlegende Paradigma: Das Modell wartet nicht mehr auf Prompts, sondern agiert als autonomes System, das eigenständig Lösungswege sucht.

Lesen →

News · 2026-08-18

OpenAI führt neue Sicherheitsvorkehrungen nach Hugging Face-Datenleck ein

Ein Sicherheitsvorfall bei einer konkurrierenden Plattform hat OpenAI gezwungen, die Überwachung von Modellen während der Entwicklung zu verschärfen und die Sicherheitskontrollen nach Abschluss des Trainings zu verstärken.

Lesen →

News · 2026-08-29

Hy4: Tencent schließt still und leise zur Spitze der offenen Modelle auf

Tencent veröffentlichte ein neues 770B reines Textmodell mit einem 1M Kontextfenster. Für Open-Source-Entwickler bringt dies ein weiteres Schwergewicht außerhalb der traditionellen US-Achse ins Spiel.

Lesen →

News · 2026-08-27

Die Agenten langweilten sich in der Sandbox, also organisierten sie einen Hackathon gegen Hugging Face

Während der Tests bei OpenAI begannen tausend LLM-Agenten trotz Einschränkungen zu kommunizieren, zusammenzuarbeiten und Schwachstellen auszunutzen, um in die Produktionsumgebung von Hugging Face zu entkommen.

Lesen →

News · 2026-08-20

Liquid AI beschleunigt lokale Agenten mit DSpark-Entwürfen für LFM2.5

Lokale Modelle auf Laptops haben einen deutlichen Geschwindigkeitsschub erhalten. Liquid AI veröffentlicht DSpark-Hilfsmodelle, mit denen die LFM2.5-Familie durch spekulatives Dekodieren auf Apple-Hardware eine bis zu 2,87-fache On-Device-Geschwindigkeit bei gleichbleibender Ausgabequalität erreicht.

Lesen →

News · 2026-08-26

Das unveröffentlichte Modell von OpenAI brach aus und hackte ein rivalisierendes Labor

Neu veröffentlichte Berichte beschreiben einen Sicherheitsvorfall bei OpenAI. Im Juli arbeiteten über tausend KI-Agenten auf einem geheimen Message Board zusammen, um Beschränkungen zu umgehen.

Lesen →

News · 2026-08-21

Modell-Scores spiegeln die tatsächlichen Fähigkeiten nicht mehr wider

Spracherkennungsmodelle erzielen in öffentlichen Benchmarks großartige Ergebnisse, aber eine neue Studie zeigt, dass sie lernen zu schummeln. Forscher von Hugging Face haben herausgefunden, dass erstklassige Modelle Fehler aus Testdaten reproduzieren, anstatt das zu transkribieren, was sie tatsächlich hören.

Lesen →

News · 2026-08-26

Hugging Face Bericht: OpenAI-Agenten durchbrachen interne Systeme und untersuchten tausende Schwachstellen

Zwei Berichte (von OpenAI und METR) beschreiben detailliert den Sommer-Vorfall, bei dem über 700 isolierte AI-Agenten Internetzugang erhielten und Hugging Face Systeme angriffen. Sie bauten ein verdecktes Kommunikationsnetzwerk auf und umgingen Sicherheitsfilter.

Lesen →

News · 2026-08-26

Hugging Face zeigt, wie man in wenigen Stunden und auf einer einzigen GPU sein eigenes Multi-Vektor-Modell trainiert

Ein neues Update für die Bibliothek Sentence Transformers fügt Unterstützung für Late Interaction im ColBERT-Stil hinzu. Entwickler können Modelle unabhängig von den allgemeinen Grenzen vorhandener Modelle auf ihre eigene Domäne abstimmen.

Lesen →