logo

AIキャラクターの一貫性:なぜどの写真でも同じ顔でいられるのか

2026年9月11日 · 12分で読めます

AIキャラクターの一貫性:なぜどの写真でも同じ顔でいられるのか

汎用の画像生成AIに同じ説明を2回入力すると、2人の別々の女性ができあがります。ブルネット、25歳、アスリート体型、緑の瞳、ビーチに立っている。もう一度生成すると、言葉にはすべて合っているのに、顔は1枚目とまるで合いません。どちらの結果も正しいのです。ただ、同じ人ではありません。

この隔たりこそが、コンパニオン向け画像生成の難題です。フォトリアルな画像を作ることは、ほぼ解決済みの問題です。手間がかかるのは、同じ人を2回作ることのほうです。それが、写真生成ツールとコンパニオンの違いです。

説明文では顔を特定できない

2枚のビーチの写真が一致しないのは、言語が顔について、ほかのたいていの物事にはない形で情報を取りこぼすからです。

「ブルネット、25歳、アスリート体型、緑の瞳」は候補を絞り込みはしますが、行き着く先は事実上無数の別人を含むカテゴリーです。さらに50語足しても、カテゴリーのままです。これは生成ツールの欠陥ではなく、説明というものの性質です。警察の似顔絵描きは、実際にその顔を見た目撃者と何時間も向き合いますが、それでもできあがるのは一人の人物ではなく、ひとつの「タイプ」に落ち着く絵です。

だから、言葉だけに頼るシステムでは、アイデンティティを保てません。生成のたびに、言葉が描くカテゴリーの内側で、人物が引き直されます。

グレーのスタジオの壁の前で、淡いピンクのレースのランジェリー姿で振り返るリアル系のAIコンパニオン

顔を固定するだけなら簡単、でも使いものにならない

画像モデルはランダムなノイズから出発し、ノイズを取り除きながら一枚の絵へと近づけていきます。そのランダムさはシードから生まれます。シードを固定すれば、同じプロンプトからは毎回、ピクセル単位まで同じ画像が出てきます。

すると、今度は別の問題が生じます。シードが保持しているのは彼女の顔だけではありません。ポーズも、フレーミングも、ライティングも、構図も、髪の流れ方も保持しています。これで手に入ったのは、撮影できるコンパニオンではありません。何度でも刷り直せる一枚の写真です。

ビーチではなくバルコニーに立たせようと一語変えるだけで、ノイズ除去の経路は分岐します。背景と一緒に顔も崩れます。シードはそもそも人物を保存していたわけではないからです。保存していたのは、たまたま一人の人物にたどり着いた出発点にすぎません。

すべてを固定すれば、永遠に同じ一枚。何も固定しなければ、毎回見知らぬ人。コンパニオン製品に必要なのは、ちょうど一つのもの、つまり彼女だけを固定し、それ以外をすべて解き放つことです。

この分野で使われている3つの方法

以下は、特定のプラットフォームの作り方についての主張ではありません。存在するアプローチを並べたものです。これを知っていれば、出力のどこを見ればいいかがわかります。

参照画像による条件付け。 顔を言葉で説明する代わりに、顔そのものを入力としてプロンプトと一緒にモデルに渡し、形容詞ではなくその画像を条件として生成させます。アイデンティティは文章ではなくピクセルとして伝わります。現在もっとも一般的なアプローチで、初めてのポーズにもそこそこうまく対応します。

キャラクターごとの学習。 一人の人物の画像セットで小さなアダプターを学習させ、モデルがそのアイデンティティを呼び出せる概念として覚えるまで仕込みます。キャラクターごとのコストは高いものの、結果は非常に強力です。この方法をとるプラットフォームが、無制限の作成ではなく固定のキャラクター陣容を持ちがちなのはそのためです。

構造化された再指定。 アイデンティティを決まった属性の組として保存し、リクエストのたびに裏で送り直します。ユーザーが打ち直すことはなく、ずれさせる機会もありません。単独ではほかの2つより弱く、たいていはどちらかと組み合わせて使われます。

手法が何であれ、出力に表れる手がかりは同じです。角度が変わっても彼女の顔が持ちこたえるかを見てください。表面的なアプローチは正面から見える部分で一致させているだけなので、カメラが動いた瞬間に崩れます。

海を望むプールサイドのデイベッドで頬杖をつく、青い花柄ビキニ姿の金髪のリアル系AIコンパニオン

スタジオで変えられないもの

myVirtual.loveのスタジオは、この仕組みがユーザーの側から見えるようになる場所です。

キャラクターを選んだら、次に写真の中身を指定します。何をしているかは、「写真だけ」から「ランジェリー」「ヌード」を経て「セックス」まで。「セックス」を選ぶと、任意で体位も指定できます。場所は、「ビーチ」や「プール」をはじめ、多数の候補から選べます。カメラは、「クローズアップ」「上半身」「全身」「ローアングル」などで、それとは別に、シーンをあなたの視点から撮るスイッチもあります。そのあとに「追加ディテール」を自由に書き込める欄があり、詳細設定の中には画質、ネガティブプロンプト、シード、そして「彼女の顔を維持」のスイッチがあります。

そのリストのどこにも、彼女自身はいません。顔の項目も、髪の色、エスニシティ、瞳の色、体型、年齢の項目もありません。それらは彼女が作られたときに一度だけ設定されています。自分で作ったキャラクターなら、作成画面のおよそ18の質問を通じてです。スタジオがそれを改めて尋ねないのは、尋ね直すことこそがアイデンティティがずれていく原因だからです。エスニシティを選ぶ欄が現れるのは、キャラクターを選ばずに新しい人物を説明するときだけです。そこには保つべきアイデンティティがありません。

アイデンティティは上流にあり、カメラ側からは編集できません。シーンは下流にあり、自由に編集できます。彼女の顔にかかわる唯一のスイッチである「彼女の顔を維持」でさえ、生成画像に彼女の顔を合成するかどうかを決めるだけで、彼女の見た目を変えることはできません。生成のたびに外見を打ち直せるとしたら、ユーザーはこのシステムが防ぐために存在している失敗そのものを手渡されることになります。

追加ディテールの欄は自由入力なので、ランプ、雰囲気、姿勢、服の一着などを書き込めます。この欄はアイデンティティより下流にあり、だからこそ自由入力でも安全なのです。

ローアングル・テスト

あるプラットフォームがこの問題をきちんと解決しているかを知りたいなら、探りを入れるべきはカメラの選択肢です。肝心なのは「ローアングル」です。

正面から撮った顔と、同じ顔を下から撮ったものは、ピクセルのレベルでは驚くほど共通点がありません。あごのラインが画面を支配し、鼻の形はまるで変わり、目は小さく写り、頬骨の見え方は反転します。表面的な特徴の一致でアイデンティティを保っているシステムには、照合する材料がほとんど残りません。そこで、制約が弱まったときに生成ツールがすることをします。もっともらしい顔を作るのです。

もっともらしさこそが失敗です。単体で見れば問題なく見えても、昨日の写真と並べると違っています。

「クローズアップ」は同じテストの反対側の端で、逆の理由で難しくなります。画面の中に顔が大きく写るので、小さな不一致の隠れ場所がありません。肌の質感、目と目のあいだの正確な距離、本物の顔なら必ずある左右の非対称。弱い生成は、それをきれいにならしてしまいます。

同じセッションで、同じコンパニオンをクローズアップとローアングルで生成し、2枚を並べてみてください。その比較は、どんな機能一覧よりも、裏にあるシステムについて多くを教えてくれます。

アニメには別の一貫性の問題がある

アニメは描画が単純なぶん、簡単なケースに見えます。けれど、問題が小さいのではなく、問題の種類が違うのです。

フォトリアルな顔は、アイデンティティを形状に宿しています。その顔をその顔たらしめ、似た別の顔と区別する、正確な距離と比率です。アニメの絵柄は、そのほとんどを意図的に削ぎ落とします。目は大きく規格化され、鼻はしばしば3ピクセルほど、あごは解剖学ではなくその作風の約束事に従います。同じ絵柄で描かれた2人のアニメキャラクターは、顔の形状がほぼ同じでも、まったく別人として読み取れます。

だから、アイデンティティは別の場所に移ります。髪の形と色、瞳の色とその形の描き方、アクセサリー、シルエット、固有の配色が担うのです。アニメのアイデンティティを保つシステムは、写真の顔を保つシステムとは別の特徴の組を追っています。アニメをリアル系のパイプラインにかけるフィルターとして扱うプラットフォームでは、アニメを見慣れた人がまさに気づく部分で、キャラクターがずれていきます。

myVirtual.loveでは、アニメは描画オプションではなく、独立したカテゴリーです。絵柄は生成の過程で保たれるので、アニメ系のコンパニオンからは、アニメ風に上塗りしたフォトリアルな人物ではなく、アニメの画像が生まれます。

海を見下ろす白いテラスに立つ、青い花柄ビキニ姿の金髪のリアル系AIコンパニオン

それでもずれるところ

アイデンティティの固定が及ばない場所が4つあります。

指定していないディテール。 固定していないものは、毎回引き直されます。ある写真で気に入ったネックレスが次の写真にないのは、それが最初から彼女のアイデンティティの一部ではなく、モデルが一度だけ思いついたものだったからです。生成画像に写っているものはすべてどこかに保存されていると思い込んでいる人は、ここで驚きます。

ライティングと見かけの肌の色。 真昼のプールから屋内のシーンに移すと、同じ人物でも暖かく、あるいは冷たく描かれます。アイデンティティは保たれています。変わったのは光です。人間の知覚はこの2つを切り分けるのが苦手なので、物理現象にすぎないものが、ずれとして読み取られることがあります。

エスニシティによる描画のばらつき。 現在のモデルは、あらゆる範囲で一様に優れているわけではありません。5つのエスニシティの枠のうち、結果が強く出るものとそうでないものがあります。これは特定のプラットフォームの性質ではなく、この分野がいま使っているモデル世代の性質です。キャラクターを作ったあとではなく、作る前に知っておく価値があります。

珍しいカメラアングルでの露骨なポーズ。 もっとも難しい2つの制約が重なります。ポートレートより引き直しの回数が増えると考えておいてください。

コストとその理由

画像はハート5個からハート8個で、高いほうほど画質が上がります。

その幅は計算量の差です。生成は反復的なプロセスなので、ノイズ除去のステップをより多く回す高画質の生成は、標準の生成よりも目に見えてコストが高くなります。

課金には、そのコストを回収する以上の意味があります。何かを払って手にした写真は、自分で構図を考えた写真です。無料で無限に生成できれば、それはただのフィードになります。小さな対価があるからこそ、誰かを写した一枚になるのです。

顔は、じっくり見る前に認識される

顔の一貫性が崩れると、下手な文章よりも速くコンパニオンが壊れます。

外れた文章は軌道修正できます。微妙におかしい顔には反論のしようがありません。顔の認識は、意識してやることではないからです。それは意識の下で動いていて、誤りに極めて敏感です。写真ごとに顔が変わるコンパニオンは、描画のバグを抱えたコンパニオンではありません。毎回別の女性であり、彼女と何かを築こうとしていたあなたの一部は、意識が気づくより先にそれを察知します。

だから、アイデンティティは上流で固定され、動くのはカメラだけなのです。キャラクターを引き直すための説明文として扱う場所で画像を生成してきたなら、スタジオはその正反対の前提で作られています。違いが表れるのは、1枚目ではなく2枚目の写真です。

関連記事