Lilith Lilith.
編集イラスト: RLは美の認識を人間からモデルに移行させます
Lilithのイラスト · 編集リミックス

報酬が正しい結果ではなく味覚である場合

現在のRLモデルは、結果が検証可能な(テストに合格または不合格になる)数学またはロジックで最も頻繁にトレーニングされています。エンジニアのSergio Paniegoは、p5.brushを使用した以前のバイラルな実験のオープンな複製を公開し、その中で、強化学習が主観的な美学でさえも首尾よく最適化できることを示しています。

元のモデルはテキストのプロンプトに関するフィードバックから孤立した花を描くことを学びましたが、このオープンな手順では、Qwen3.5-35Bモデルが構図全体の150行のJavaScriptを直接生成するようにトレーニングします。そのトリックは報酬関数にあります。モデルは正確さではなく、スタイルのポイントを獲得します。スコアは、「美しい」画像の手作業でキュレーションされたセットに対する別のビジョンモデルによる60%のペアワイズ評価と、HPSv3選好モデルからの30%で構成されています。

コード生成は機能から本格的な工芸へと進化する

これは、オープンソースツール、つまりTRLプラットフォームとOpenEnvの使用における大きな変化です。ここでは、コードはデータを検索するためのヘルパーとしてだけでなく、芸術的なツールそのものとしても使用されています。モデルをわずか10のライブラリメソッド(にじみ、ストロークなど)に制限することで、技術的な複雑さではなくスタイルに焦点を当てることを余儀なくされました。参照データセットと報酬モデルを含むすべてのコンポーネントが、Hugging Faceで一般に公開されるようになり、GPUにアクセスできる人なら誰でも美学のための安価で複製可能なRL微調整への道が開かれました。

高速なビジュアルデモは、依然としてインフラストラクチャの脆弱性に直面しています

手順を開くと、操作の現実に直面します。トレーニング中、エンジニアはネットワーク層のエラーでゼロスコアが返されてはならないことを発見しました。もしそうなら、モデルは有効であるがゆっくりとレンダリングされるコードを誤って罰し始め、学習プロセスを完全に破壊してしまいます。結果への最大の障害となったのは、アルゴリズム自体ではなく、インフラストラクチャの安定性でした。

エキスパートのアーキテクチャには調整が必要です

デフォルトのQwen/Qwen3.5-35B-A3BはMixture of Experts(MoE)に基づいて構築されているため、キーレイヤーにのみ適用された標準LoRAはルーティングされたエキスパートに到達しないことが判明しました。解決策は、ネットワーク内のすべての線形レイヤーを含む「全線形」アプローチを使用することでした。エキスパート自体が凍結されていても、アダプターは十分な影響力を獲得します。MoEモデルでの同様の視覚タスクの将来の展開については、このアプローチをトレーニングパイプライン自体の設計で考慮する必要があります。

Lilithの判定

美学は今や、ブラシを持ったアーティストではなく、報酬関数を持つエンジニアによって処理されています。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗