ホームチュートリアル・ブログ › AI画像生成で顔が歪む・崩れる問題の解決方法、3

AI画像生成で顔が歪む・崩れる問題の解決方法、3つの検証可能な原因

解像度・構図における占有率・モデルの限界という3つの角度からAIの顔崩れの原因を分解し、実行可能な修正の順序を提示。部分再描画と拡大再描画の具体的な操作アドバイス付き。

まず問題を明確に定義しておきます。顔崩れは単一の現象ではなく、少なくとも3つのケースに分けて議論する必要があります。なぜならそれぞれ対応する原因と解決法がまったく異なるからです。1つ目は顔立ちの位置がおかしくなるケース(目が左右非対称、口の位置がずれている)、2つ目はディテールが一塊に潰れてしまうケース(まつ毛や歯が出るべき場所が色の塊になっている)、3つ目は複数人のシーンで顔同士が融合してしまうケースです。以下ではこの3つを順に説明していきます。まとめて一括りにはしません。

1つ目:解像度不足によるディテールの欠落

これは最もよくある、しかし最も見落とされやすい原因です。モデルは生成段階で設定された出力サイズに応じてピクセルを割り振ります。画面内の人物が全身または遠景の構図の場合、顔が実際に占めるピクセル数はわずか数十×数十程度になることがあり、顔立ちのディテールを描くための十分なスペースがそもそもありません。モデルは「推測」するしかなく、推測が外れれば崩れになります。これはオカルトではなく、純粋な計算リソース配分の問題です。

検証可能な解決経路:まず基本の生成解像度を上げることを優先します。VRAMや使用枠の上限に制限される場合は、2段階のフローに切り替えます——まず構図の下絵を出してポーズとシーンに問題がないか確認し、次に顔の領域だけを別途拡大して再描画します。この操作には専門的な呼び名があり、業界では一般に「顔修復パス」と呼ばれています。本質的には、顔を画像全体から切り出して、より高い解像度で個別にもう一度実行し、それを元の画像に貼り戻して縁を馴染ませる処理をすることです。

2つ目:構図における占有率の問題は、想像以上によくある

たとえ解像度が十分であっても、顔が画面に占める割合が小さすぎる場合(例えば全身写真で顔が画面の15分の1程度しかない場合)、モデルのこの領域への「注目度」も相応に下がります。この点はバッチで画像を出力するときに特に顕著です——同じパラメータのセットでも、クローズアップの崩れ率は全身や複数人の集合写真より明らかに低くなります。

推奨される処理の順序は次の通りです。ディテールを保持する必要があるシーンでは、構図の段階で顔の占有率をあらかじめ適度に引き上げるか、いっそのこと2回に分けて出力します。1回目でシーンと体型を出し、2回目で顔のクローズアップだけを個別に出力して合成に使うのです。この考え方はポートレート写真のような顔の精度が求められるシーンでは基本的に標準フローであり、オプションではありません。

3つ目:複数人の顔があるシーンと複雑なアングルにおけるモデルの限界

横顔、うつむいた姿勢、複数人物が近距離に立っているケースなど、現在の生成モデルは総じてこれらの処理があまり安定していません。原因は学習データの中でこの種のアングルや遮蔽関係のサンプル数自体が比較的少なく、モデルが正しい空間関係を再現するための十分な確信を持てないためです。そのため2人の顔の特徴が混ざってしまったり、横顔の顔立ちの位置がずれてしまったりしやすくなります。

この点には近道がなく、分割処理に頼るしかありません。複数人の集合写真では顔をそれぞれ個別に生成してから合成する、あるいはいっそ正面・単独・均一な光の構図に切り替えてこの限界を回避する、という方法です。もし元の構図とポーズをどうしても保持する必要がある場合、人力で後から部分的に再描画するのが現時点で最も確実な方法です。時間はかかりますが、結果をコントロールできます。

実践アドバイス:そのまま実行できる手順

ついでに言っておくと、顔を修正した後にさらに背景や服装のディテールを処理する必要がある場合、この種の精緻化作業は写真編集・レタッチのツールチェーンで行う方がスムーズです。顔と背景を分けて処理すれば互いに干渉せず、問題が起きても具体的にどの段階かを特定しやすくなります。

以上の3点は、私自身が長期にわたって顔崩れの問題を確認する際に使ってきた調査の順序であり、あくまで個人的な経験のまとめです。モデルによって具体的な挙動には違いがあります。新しいケースに遭遇した場合は、同じロジックに沿ってもう一度分解し直すことをおすすめします。他人のパラメータをそのまま流用するのではなく。

TOP