Diffusion ControllerはGoogleの画像生成を制御する新理論、小さな部品でLoRA超え

3行でわかる
- Google ResearchのDiffusion Controllerは、画像生成の過程を一つの制御問題として扱い、ばらばらだった調整手法をまとめる
- 本体モデルを固定し、途中の出力を見て軌道を補正する小さな追加部品で、2つの学習方式で人の好みの指標がLoRAを上回った
- 実験は旧世代のStable Diffusion v1.4で、コードや製品への搭載は発表されていない。広告制作で使えるのはまだ先
Google Researchは現地時間9月29日、画像生成AIを狙いどおりに動かすための調整手法を一つの数理の枠組みにまとめる「Diffusion Controller」を公式ブログで解説しました。本体のモデルを固定したまま約1,200万パラメータの小さな追加部品を足し、人の好みの指標で一般的な追加学習手法のLoRAを上回る場面があったとしています。論文は3月にarXivで公開されたもので、ブログはその研究の紹介です。
何が発表されたか
画像生成AIの多くは、ノイズだらけの画像から少しずつノイズを取り除いて絵を仕上げる「拡散モデル」です。狙いどおりの絵を出させる工夫は数多くあります。生成のたびに指示の効き具合を変えるもの、LoRA(本体の一部に小さな学習用の層を足す手法)で追加学習するもの、強化学習で鍛え直すものなどが別々に発展し、共通の理論はありませんでした。
Diffusion Controllerは、ノイズを取り除く一連の過程を確率的な「制御問題」として書き直し、こうした手法を同じ式の上で説明する枠組みです。論文の定式化では、制御とは、元のモデルが次の一歩をどう進むかの確率に重みを付け直すことを指します。その重みは、目標(画風やプロンプトへの忠実さ)に近づく得と、元のモデルから離れる損をてんびんにかけて決まります。
Instead of treating image generation as a rigid sequence of isolated steps, Diffusion Controller reframes the entire denoising process as a smooth, continuous control problem.
画像生成を、互いに切り離された固定の手順の連なりとして扱うのではなく、Diffusion Controllerはノイズ除去の過程全体を、滑らかで連続した制御問題として捉え直します。
原文を読む(research.google)この枠組みから導かれる学習方法は2つです。1つはPPO型の強化学習で、1回の更新で動ける幅に上限を設けて学習を安定させます。もう1つは、評価スコアの高い生成ほど学習での重みを大きくする方式で、論文は、元のモデルとの差をKLダイバージェンスで測る場合に最適解が保たれることを示しています。
さらに、理論上の最適な形は「固定した元のモデル+小さな補正」に分けられることを示しました。ブログはこの補正部品を、バイクに後付けする「ステアリングダンパー」にたとえています。補正部品は生成途中の出力を見ながら進路を直すので、本体の中身に手を入れなくて済みます。論文はこれを、本体は非公開でも途中の出力だけは受け取れる「グレーボックス」の状況で使える形だと位置づけています。
実験の結果
実験は画像生成モデルのStable Diffusion v1.4で行い、人の好みを予測するスコアHPS-v2で、元のモデルに勝つ割合(勝率)を比べました。
| 手法 | 学習するパラメータ数 | 教師あり学習 | 評価重み付け学習 | PPO |
|---|---|---|---|---|
| Diffusion Controller(本体は固定) | 約1,200万 | 66.7% | 68.2% | 69.6% |
| LoRA(本体の中に追加) | 約1,700万 | 57.7% | 61.1% | 90.5% |
| Diffusion Controller(本体も同時に学習) | 約1,600万 | 69.6% | 65.6% | 93.5% |
本体を固定した版は、少ないパラメータで、2つの学習方式でLoRAを上回りました。PPOではLoRAが強く、本体も学習する版が93.5%で最も高い勝率でした。ブログが「90%の勝率」と書いているのはこの本体も学習する版のことです。50人を超える評価者による人手の評価も行っています。
生成時には、補正の強さを1つの数値で上げ下げできます。プロンプトへの忠実さを、画像を崩さずに細かく調整できるとしています。
反応と論点
ブログは、この仕組みで閉じた商用モデルも制御できると強調しています。
This allows engineers to perfectly control and customize even tightly locked, closed-source models without ever touching the underlying code.
これにより、エンジニアは厳重に閉じたクローズドソースのモデルでも、元のコードに一切触れずに制御・カスタマイズできます。
原文を読む(research.google)ただし論文の前提は、各ステップの途中出力(ノイズの予測値など)を外から受け取れることです。完成画像だけを返す通常の画像生成APIで、そのまま使えるわけではありません。実験もPPOではLoRAに負けており、すべての場面で上回るわけではない点も押さえておく必要があります。今後の課題として、個人に合わせた調整、有害な画像を防ぐ安全策、動画モデルへの応用が挙がっています。
日本のビジネスへの影響
現時点では研究段階です。ブログと論文には、コードの公開やGoogleの製品への搭載の予定は書かれていません。日本の企業が明日から使える技術ではありません。
関係が深いのは、画像生成サービスを作る開発者と、広告クリエイティブの制作会社です。実用化されれば、ブランドの好みに寄せる調整を、本体を作り直さずに小さな部品で後付けできるようになります。案件ごとに部品を差し替え、「ブランドらしさ」と「指示への忠実さ」を1つの数値で調整する使い方が想定できます。
今すぐやれることは、Stable Diffusion系のモデルをLoRAで追加学習している開発チームが、論文の評価重み付け学習を自社の評価データで試すくらいです。それ以外は様子見でかまいません。注意点は、実験が旧世代のモデルと、好みを予測する1つのスコア中心の評価だということです。今の画像生成AIの選び方は画像生成AIのおすすめにまとめています。
一次情報
- 公式発表Google Research BlogHow Diffusion Controller unifies and simplifies AI image generation
- 論文arXiv(Tong Yang ほか)Diffusion Controller: Framework, Algorithms and Parameterization
- 論文arXivDiffusion Controller(HTML版・実験結果の表)
AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。