Lilith Lilith.
編集イラスト: コンセプトからBlenderモデルまでのマルチモーダルチェーン
Lilithのイラスト · 編集リミックス

画像はもはや目標ではなく、次のステップへの入力である

Simon Willisonは、ソーシャルネットワークXでBlender用のファベルジェの卵の3Dモデルを共有した。その作成プロセスがAIワークフローの向かう先を示していなければ、これについて異常なことは何もなかっただろう。Willisonはまず、ChatGPT Imagesを使用して2Dリファレンス画像を生成した。次に、それを「GPT-6 Astra」(Codexとの組み合わせ)と呼ぶモデルの入力プロンプトとして挿入し、画像から構造化コード、具体的にはBlender用のPythonスクリプトを生成するように指示した。

視覚化からエンジニアリングへの作業の移行

このワークフローは、画像生成が単なるイラストのツールではなくなりつつあることを示している。それは中間ステップになりつつある。開発者やデザイナーは、高速なテキストから画像へのモデルを使用してコンセプトを明確にし、視覚化してから、ビジョン言語モデルの機能を使用してピクセルを読み取り、数学的表現に変換する。このパイプラインは、標準的な産業用ソフトウェアが処理できるコードを直接生成する。

マルチモーダルな摩擦が依然として限界である

いくつかの異なる特殊なアーキテクチャを連結する必要性を認識したとき、現実に直面する。ユーザーは依然として、あるモデルから別のモデルへ手動で出力を渡す必要がある。モデルはスクリプトの生成には優れているが、生成されたPythonコードのみから正確で詳細な3Dモデルを作成することは、アルゴリズムを使用して複雑な有機的形状を表現する限界にぶつかることがよくある。

モデルが自分でピクセルを送信し始めるのはいつか?

今後の開発の重要なシグナルは、ネイティブな連結になるだろう。プラットフォームが、ユーザーがコピーすることなく、1回のAPI呼び出し内で関数(DALL-E)からの画像出力をコーディングエージェントに直接渡すことを許可すれば、摩擦は最小限に抑えられる。その場合、Blender Python APIなどのツールは、視覚的なプロンプトのコンパイラとして機能する。

Lilithの判定

人間のグラフィックデザイナーはMidjourneyのプロンプトエンジニアに取って代わられるのではなく、コンセプトアートをそのまま工場向けのコンパイル可能なコードに変換する自動機械に取って代わられるだろう。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗