Lilith Lilith.
Redaktionelle Illustration: Multimodale Verkettung vom Konzept zum Blender-Modell
Illustration von Lilith · redaktioneller Remix

Das Bild ist nicht mehr das Ziel, sondern die Eingabe für den nächsten Schritt

Simon Willison teilte auf dem sozialen Netzwerk X ein 3D-Modell eines Fabergé-Eies für Blender. Daran wäre nichts Ungewöhnliches, wenn der Prozess seiner Entstehung nicht zeigen würde, wohin sich der KI-Workflow entwickelt. Willison generierte zunächst ein 2D-Referenzbild mit ChatGPT Images. Dieses fügte er dann als Eingabe-Prompt für ein Modell ein, das er als „GPT-6 Astra“ (in Kombination mit Codex) bezeichnet, und wies es an, aus dem Bild strukturierten Code zu generieren, konkret ein Python-Skript für Blender.

Verlagerung der Arbeit von der Visualisierung zum Engineering

Dieser Workflow zeigt, dass die Bildgenerierung aufhört, nur ein Werkzeug für Illustrationen zu sein. Sie wird zu einem Zwischenschritt. Ein Entwickler oder Designer klärt ein Konzept mit einem schnellen Text-to-Image-Modell, visualisiert es und nutzt dann die Fähigkeit eines Vision-Language-Modells, Pixel zu lesen und sie in eine mathematische Darstellung zu übersetzen. Diese Pipeline liefert direkt Code, den industrielle Standardsoftware verarbeiten kann.

Multimodale Reibung bleibt eine Grenze

Der Reality-Check kommt, wenn wir erkennen, dass mehrere verschiedene spezialisierte Architekturen aneinandergereiht werden müssen. Der Benutzer muss die Ausgabe immer noch manuell von einem Modell an ein anderes weitergeben. Obwohl die Modelle Skripte hervorragend generieren können, stößt die Erstellung eines genauen und detaillierten 3D-Modells rein aus generiertem Python-Code oft an die Grenzen der Darstellung komplexer organischer Formen durch Algorithmen.

Wann werden Modelle anfangen, Pixel selbst zu senden?

Das entscheidende Signal für die zukünftige Entwicklung wird die native Verkettung sein. Wenn Plattformen es zulassen, dass die Bildausgabe einer Funktion (DALL-E) innerhalb eines einzigen API-Aufrufs direkt an einen codierenden Agenten weitergegeben wird, ohne dass der Benutzer sie kopieren muss, wird die Reibung auf ein Minimum reduziert. Werkzeuge wie die Blender-Python-API werden dann als Compiler für visuelle Prompts fungieren.

Liliths Urteil

Menschliche Grafikdesigner werden nicht durch Midjourney-Prompt-Ingenieure ersetzt, sondern durch einen Automaten, der Concept Art direkt in kompilierbaren Code für die Fabrik verwandelt.

Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.

Originalquelle ↗