前提
対象モデル:Alibaba Cloud Model Studio API
wan3.0-video
基準日:2026年8月25日
対象モード:Reference-based Video Generation
1. 最終結論
参照画像の役割をプロンプトで明確にしても、背景の視覚情報が完全に無効化される保証はありません。
一方、すべての人物画像を切り抜いて単色化する必要もありません。切り抜きによって髪、耳、肩、指、衣服の輪郭が壊れると、背景よりも人物の一貫性に悪影響を与える可能性があります。
推奨する基本方針は次のとおりです。
- 顔画像は人物が大きく見えるようタイトにトリミングする。
- 背景が単純なら、元背景を残す。
- 背景に別人、文字、強い模様、強い色、目立つ家具などがある画像だけ切り抜く。
- 切り抜く場合は、不透明な無彩色背景へ統合する。
- プロンプトでは、各画像の役割を短く肯定形で指定する。
- 10枚すべてを無理に使わず、矛盾の強い画像は除外する。
したがって、今回のベストな初期設定は、タイトなトリミングを基本とした選択的な背景処理です。
2. 背景処理の判断
| 画像の状態 | 推奨処理 |
|---|---|
| 背景が無地・単純 | 元背景を維持し、タイトにトリミング |
| 背景が少し繁雑だが切り抜きが難しい | 元背景を維持。必要なら自然にぼかす |
| 背景に別人・文字・看板・強い模様がある | 高品質に切り抜いて単色化 |
| 画像ごとの背景差が極端に大きい | 切り抜きまたは強めのトリミング |
| 切り抜きで髪・耳・指・肩が欠ける | 切り抜きを中止し、元背景を使用 |
| グリーンバックの色かぶりが残る | 緑を除去して無彩色背景へ置換 |
| 透明PNGでの入力 | 使用しない。不透明背景へ統合 |
単色背景を使用する場合、固定の正解色はありません。
髪、肌、衣装と十分な明度差があるライトグレーからミドルグレーを使用します。実務上の例としては、#BEBEBE〜#D0D0D0程度が考えられますが、これは公式推奨値ではありません。
黒髪なら明るめのグレー、白い衣装なら少し暗めのグレーに調整します。
3. 推奨する参照画像の構成
| 番号 | 担当 | 推奨内容 |
|---|---|---|
| Image 1 | 顔・髪型・メイクの最優先基準 | 最終映像で採用したい髪型とメイク。顔が明瞭な正面または自然な3/4角度 |
| Image 2 | 顔の補助 | 左右どちらかの3/4角度 |
| Image 3 | 顔の補助 | Image 2と反対側の3/4角度 |
| Image 4 | 顔の補助 | 横顔または輪郭が分かる角度 |
| Image 5 | 顔の補助 | 表情差、または不足している角度 |
| Image 6 | 身体の補助 | 全身正面。頭から足先まで入り、過度なパースがない |
| Image 7 | 身体の補助 | 全身斜めまたは側面。肩幅、体型、手足の比率を補足 |
| Image 8 | 衣装 | 服だけ、平置き、マネキンが理想。別人の顔を含めない |
| Image 9 | ロケーション | 可能な限り人物なし。目的の空間、素材、照明が分かる |
| Image 10 | 冒頭構図・ポーズ | 同一人物、Image 8の衣装、Image 9の場所を反映した完成キーフレームが理想 |
Image 10の扱い
Image 10をreference_imageとして送る場合、厳密なファーストフレームにはなりません。
プロンプトで、Image 10に近い構図と姿勢から開始するよう誘導します。
Image 10は、次の条件を満たす場合にのみ使用します。
- Images 1〜7と同じ人物である
- Image 1の顔、髪型、メイクと整合している
- Image 8の衣装と整合している
- Image 9の場所と整合している
- 実際に開始したい構図と姿勢である
Image 10に別人の顔や異なる髪型・衣装が大きく写っている場合は、使用しない方が安全です。
4. 使わない方がよい人物画像
次の画像は、10枠を埋めるためだけに使用しません。
- 強い魚眼や超広角で顔が歪んでいる
- 極端な俯瞰やうつ伏せで顔が変形している
- 顔が小さすぎる
- 強い加工で骨格が変わっている
- Image 1と年齢感や顔立ちが大きく違って見える
- 既存画像とほぼ同じ情報しかない
- 別人が大きく写っている
- 強い影で目、鼻、顎の形が判断できない
参照画像は最大10枚ですが、10枚は上限であり推奨枚数ではありません。
本人性を補強しない画像や、Image 1と競合する画像は、除外した方がよい場合があります。
5. 画像ごとの前処理
Image 1〜5:顔の参照
- 頭頂部、髪の外形、耳、顎を残す
- 頭部から胸上程度にトリミングする
- 目、鼻、口、顎が白飛び・黒つぶれしないようにする
- 極端な色かぶりだけ軽く補正する
- Image 2〜5を加工してImage 1のメイクへ無理に揃えない
- 背景が単純なら切り抜かない
Image 6〜7:身体の参照
- 頭から足先まで残す
- 手足が切れていない画像を優先する
- 自然な立位を優先する
- 強い広角歪みを避ける
- 衣服を消したり塗り替えたりして身体輪郭を壊さない
- 背景が繁雑な場合のみ高品質に切り抜く
Image 8:衣装の参照
衣装素材の優先順位は次のとおりです。
- 服だけの平置き
- 顔のないマネキン
- 首から下だけの着用写真
- 別人の全身着用写真
衣装の前後、素材、装飾、靴、アクセサリーが重要であり、一枚で情報が不足する場合は、人物参照を一枚減らして衣装補助を追加する方法も検討します。
Image 9:ロケーションの参照
- 人物のいない画像を優先する
- 看板や目立つ文字を避ける
- 採用したい照明と時間帯に近い画像を選ぶ
- Image 10と空間構造が矛盾しないようにする
6. 最終推奨プロンプト
Wan 3.0 APIへは、公式に対応が案内されている英語版を送るのが安全です。
プロンプト雛形 英語版
Images 1–7 show the same person. Use Images 1–7 only to define one consistent character's identity and physique.
Image 1 is the primary reference for facial identity, hairstyle, and makeup. Images 2–5 clarify the same person's facial geometry and alternate views. Images 6–7 clarify the same person's body shape and proportions.
Apply the outfit from Image 8 and the environment from Image 9 to this character.
Maintain the same facial identity, hairstyle, makeup, and body proportions consistently throughout the video.
Use Image 10 only as the opening composition and pose reference. Begin with a shot that closely matches Image 10 while preserving the character identity defined by Images 1–7.
Action: First, [action 1]. Then, [action 2]. Finally, [action 3].
Camera: [shot size, angle, lens feeling, and camera movement].
Performance: [gaze, facial expression, posture, motion speed, and motion intensity].
Generate a single continuous shot.
日本語での意味
Image 1〜7は同一人物です。1人の一貫した人物の本人性と身体的特徴を定義するために使用します。
Image 1を顔の本人性・髪型・メイクの最優先基準とします。Image 2〜5は同一人物の顔の立体構造と別角度を補足し、Image 6〜7は同一人物の体型と身体比率を補足します。
この人物にImage 8の衣装を適用し、Image 9の環境に登場させます。
動画全体を通して、同じ顔の本人性、髪型、メイク、身体比率を一貫して維持します。
Image 10は冒頭の構図とポーズの参照としてのみ使用します。Image 1〜7で定義された本人性を維持したまま、Image 10に近いショットから開始します。
動作:最初に[動作1]。次に[動作2]。最後に[動作3]。
カメラ:[画角、アングル、レンズ感、カメラワーク]。
演技:[視線、表情、姿勢、動作速度、動作強度]。
単一の連続ショットとして生成します。
Image 10を使わない場合
次の部分を削除します。
Use Image 10 only as the opening composition and pose reference. Begin with a shot that closely matches Image 10 while preserving the character identity defined by Images 1–7.
7. 動作プロンプト
人物の一貫性を優先する場合、15秒前後の1クリップにつき、主要な動作は2〜3ビートを基本とします。
推奨例
Action:
First, she walks forward slowly for several steps.
Then, she stops and turns her upper body slightly toward the camera.
Finally, she makes eye contact with the camera and gives a subtle smile.
避けたい例
She runs, falls, stands up, removes her bag, opens it, searches inside, takes out a key, turns around, and starts running again.
転倒、起き上がり、物体操作、小物の取り出しが連続する場合は、15秒ずつ複数クリップに分割します。
タイムスタンプは厳密なフレーム制御ではなく、大まかな演出ガイドとして使用します。
0–5s: [action 1]
5–10s: [action 2]
10–15s: [action 3]
まずはFirst / Then / Finallyを使用し、順序が崩れる場合だけ時間帯を追加します。
8. 参照動画
別人が写った参照動画によって、その人物の外見が混ざる現象が発生している場合、今回の運用では参照動画を使用しない判断が合理的です。
優先順位は次のとおりです。
- Images 1〜7による本人性
- Image 8による衣装
- Image 9によるロケーション
- Image 10による冒頭構図
- プロンプトによる動作・カメラ・演技
動作はテキストで制御し、必要に応じて生成を分割します。
9. API仕様として確認できること
wan3.0-videoの現行公式API資料では、次の事項が確認できます。
reference_imageは最大10枚Image 1などの番号は、media配列内のreference_imageの順番に対応- プロンプトは中国語と英語に対応
- プロンプト上限は20,000文字
- Referenceモードと
first_frame/last_frameは同一リクエストで併用不可 - PNGは入力可能だが透明チャンネルは非対応
- 画像は1辺240〜8,000ピクセル
- 画像ファイルは20MB以下
- 動画入力がない場合、生成尺は2〜30秒
seedパラメータを使用可能
10. 背景処理のA/Bテスト
背景を残す方法と切り抜く方法は、同じ条件で比較します。
A案
- 顔画像は胸上までトリミング
- 全身画像は人物を大きく配置
- 元背景を残す
B案
- 髪や輪郭を損なわずに切り抜く
- 同じ不透明なグレー背景へ統一
- 白縁、発光、影を加えない
次の項目を比較します。
- Image 1の顔への類似度
- 顔のフレーム間変形
- Image 1の髪型とメイクの維持
- Images 1〜7の元衣装の混入
- 元背景や元ロケーションの混入
- 切り抜き輪郭のアーティファクト
- Image 8の衣装の再現
- Image 9の場所の再現
同じプロンプト、同じパラメータ、同じseedで比較し、2〜3種類のseedで確認します。
11. 最終チェックリスト
- Image 1は採用したい顔・髪型・メイクに最も近い
- Image 2〜5はImage 1を補足し、強く矛盾していない
- Image 6〜7は自然な身体形状と比率を示している
- 極端な俯瞰、うつ伏せ、魚眼画像を無理に使っていない
- 顔画像をタイトにトリミングしている
- 必要な画像だけ高品質に切り抜いている
- 透明PNGではなく不透明背景へ統合している
- Image 8に別人の顔が含まれていない
- Image 9に人物が含まれていない
- Image 10が本人・衣装・場所と整合している
- Image 10を厳密な
first_frameとして扱っていない - 主要動作を1クリップ2〜3ビートに抑えている
- API投入用プロンプトを英語または中国語にしている
- 低品質な画像で10枠を無理に埋めていない
- 同一条件・同一seedで背景処理を比較している
12. 決定事項
現時点で採用する初期設定は次のとおりです。
画像側
- Image 1〜5:タイトな顔トリミング
- Image 6〜7:自然な全身画像
- 背景が単純な画像:元背景を維持
- 背景が強く競合する画像:高品質に切り抜き、無彩色背景へ統一
- Image 8:衣装専用
- Image 9:ロケーション専用
- Image 10:整合性の高い冒頭キーフレーム。作れない場合は使用しない
プロンプト側
- Images 1〜7を本人性と身体情報に限定
- Image 1を顔・髪型・メイクの最優先基準にする
- Image 8を衣装、Image 9を環境として指定
- Image 10を冒頭構図・ポーズ参照として指定
- 動作は15秒につき2〜3ビート
- 否定事項を長く列挙せず、各画像の担当を明確にする
これは、現行の公式API仕様に反しない範囲で、本人性、衣装、ロケーション、冒頭構図の競合を抑えるための推奨運用です。
背景前処理について公式の決定的な正解は示されていないため、実際の素材に対する最終判断はA/Bテストで行います。
