2026-09-15 · ← News
Gemini 3.8 Live erhält Extended Thinking. Es hält den Hintergrundkontext, während du sprichst
Die neuen Modelle frieren bei der Ausführung von Tools nicht mehr ein
Google kündigte Gemini 3.8 Live und die Version 3.8 Live Extended Thinking an, die zusammen eine neue Generation von Konversationsmodellen bilden. Der entscheidende Unterschied ist die Trennung von schnellen Antworten von asynchronen Aufgaben. Während ältere Modelle bei der Arbeit mit Tools die Kommunikation pausieren mussten und nicht unterbrochen werden durften, läuft Extended Thinking im Hintergrund ab und ermöglicht es dir, weiterhin nahtlos mit dem Modell zu kommunizieren, auch wenn es gerade eine andere Aufgabe bewältigt.
Obwohl die primäre Seite von Google in ihren Details etwas begrenzt war, veranschaulichen die begleitenden Demos die neue Architektur deutlich. Das Modell kombiniert einen schnellen verbalen Stream (3.8 Live) und einen separaten Backend-Prozess für strukturiertes Denken (Extended Thinking), die sich nicht gegenseitig unterbrechen.
Für die UX von Sprachassistenten löst dies den größten Engpass
Bisher funktionierten Voice-Agenten hervorragend, entweder als Chat oder als Aufgaben-Orchestratoren, aber nie beides gleichzeitig. Wenn man einen komplexen Prompt eingab, der eine Datensuche oder Codeausführung erforderte, musste man leise bleiben, bis die Aufgabe abgeschlossen war. Wenn man das Modell mit einer zusätzlichen Anweisung unterbrach, fiel oft die gesamte Denkkette zusammen.
Die Aufteilung in zwei parallele Streams ändert dies. Das bedeutet, dass Entwickler Agenten bauen können, die Smalltalk aufrechterhalten oder neue Eingaben entgegennehmen, während ihr Backend-Teil noch an einem schweren Problem arbeitet. Dies ist eine massive Verschiebung für jeden echten Assistenteneinsatz unterwegs.
Die Architektur ist komplexer und erfordert eine perfekte Zustandssynchronisierung
Das Limit liegt darin, wie gut diese beiden Systeme den Kontext austauschen. Wenn Extended Thinking im Hintergrund zu einem Schluss kommt, der nicht mehr gültig ist, weil man in der Zwischenzeit die Anweisung verbal geändert hat, besteht das Risiko asynchroner Halluzinationen. Das Marketing behauptet, das Modell beherrsche Multitasking reibungslos, aber der reale Einsatz außerhalb der Google-Demos wird schnell zeigen, wie aggressiv das Modell alte Kontextzweige bei neuen Eingaben verwirft.
Gleichzeitig ist noch nicht klar, wie verfügbar Extended Thinking über API für reguläre Entwickler ist und zu welchen Kosten, oder ob es sich um eine proprietäre Funktion handelt, die nur in der Gemini-App gesperrt ist.
Es wird davon abhängen, ob parallele Ausführung bei langen API-Pausen abbricht
Der Beweis, dass dies funktioniert, wird nicht ein weiteres poliertes Demo sein, sondern die Fähigkeit, ein flüssiges Gespräch aufrechtzuerhalten, selbst wenn das Hintergrund-Tool fehlschlägt und mehrere Wiederholungsversuche unternehmen muss. Wenn das Frontend-Modell in diesem Moment anfängt, Dinge zu erfinden, nur um die Stille zu füllen, wird die Illusion von zwei parallelen Streams schnell zerfallen.
Liliths Urteil
Der KI-Assistent hörte auf, ein Walkie-Talkie zu sein, auf das man warten muss. Stattdessen wurde er zu einem vollwertigen Kollegen, der normalen Blickkontakt halten kann, während er an etwas Komplexem arbeitet.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗