Wan完全ガイド2026:2.2系まで対応、Apache 2.0のAI動画生成を家庭用GPUで動かす

Alibaba が公開する Wan 系のAI動画生成を解説。2.2 系までの世代とバリアント、Apache 2.0 のライセンス、セットアップから動画生成のコツ、テキストtoビデオ・画像toビデオの使い方、NSFWコンテンツへの活用まで丁寧に解説します。

Wan完全ガイド2026:2.2系まで対応、Apache 2.0のAI動画生成を家庭用GPUで動かす のサムネイル

この記事の要点

  • WANは動画生成に特化したモデル。image-to-videoで1枚の絵を動かせる
  • 動画の品質は入力する静止画の品質でほぼ決まる
  • 動きは小さく短くから始める。大きなモーションは破綻の温床
  • 同じ入力でも結果がぶれるため、複数出して選抜する前提で運用する

はじめに:AI動画生成の民主化

Runway Gen-3 や Kling AI といった商用サービスがAI動画生成をリードしてきた一方で、2025年以降はオープンソースの動画生成モデルが急速に追いついてきました。その中で継続して評価を集めているのが Wan 系 です。

Wan 系はオープンソースの動画生成モデルとして高い評価を受けており、ComfyUIとの組み合わせでローカル環境でも十分実用的な動画が生成できるようになっています。

関連記事:AnimateDiff入門


Wanとは

Wan は、Alibaba(阿里巴巴) が開発しオープンウェイトで公開しているAI動画生成モデルです。2.1 から始まり、現在は 2.2 系が配布されています。「Wan」は中国語で「万(よろず)」に由来し、汎用性の高さを表しています。

特徴

  • テキストtoビデオ(T2V):テキストプロンプトから動画を生成
  • 画像toビデオ(I2V):静止画を動かして動画にする
  • オープンウェイトで商用利用可能なライセンス
  • 中国語・英語両対応のプロンプト
  • AnimateDiffと比べてより自然な動きを生成

Wanのバリアント

Wanは世代とバリアントの組み合わせで配布されています。まず世代、次に用途、の順で選びます。

2026年8月時点で入手できるオープンウェイトは 2.2 系までです。 それ以降の世代も存在しますが、重みの公開は確認できていません(後述)。

2.2 系(現行)

モデル規模用途
Wan2.2-TI2V-5B5Bテキスト・画像の両方に対応した統合版。最も広く使われている
Wan2.2-I2V-A14B14B級画像→動画
Wan2.2-T2V-A14B14B級テキスト→動画
Wan2.2-Animate-14B14B級動きの再現に寄せた版
Wan2.2-S2V-14B14B級音声を伴う生成

最初の1つを選ぶなら TI2V-5B です。 規模が小さく、テキストからも画像からも生成できる統合版なので、用途ごとにモデルを入れ替える必要がありません。配布実績もこの系統で最も多くなっています。

2.1 系(旧世代)

モデル規模用途
Wan2.1-T2V-1.3B1.3B(13億)テキスト→動画(軽量)
Wan2.1-T2V-14B14B(140億)テキスト→動画
Wan2.1-I2V-14B-480P / 720P14B(140億)画像→動画

いま新規に始めるなら 2.2 系からで構いません。 2.1 の軽量版(1.3B)はいまも使われていますが、2.2 の 5B が同じ「軽い側」の枠を埋めています。

それ以降の世代について

2.2 より新しい世代も存在しますが、重みの公開は確認できていません。 名前を見かけても、手元で動かせるとは限りません。

この記事が扱うのはオープンウェイトで入手できるものです。クラウド側のサービスとして提供されている世代は、料金と規約が別の話になります。商用サービス側の比較は AI動画ツール比較2026 を参照してください。

ライセンス

Wan 系はいずれも Apache 2.0 で配布されています。 動画生成のオープンウェイトとしては条件が緩い部類で、商用利用の判断が単純になります。この点は選定理由として大きいです。

ライセンス全般の読み方は AIエロ絵の商用ライセンス完全整理2026 を参照してください。


動作要件

動画生成は静止画より大幅に重い、というのが出発点です。静止画が数秒で出る環境でも、動画は分単位になります。

VRAM現実的な選択
8GB小規模モデルの量子化版から。まず動くことを優先する
12GB小規模モデルが扱いやすい帯
16GB中規模まで候補に入る。解像度と長さで調整
24GB以上大きいモデルも選べる

所要時間は環境差が大きすぎて一般化できません。 GPU・解像度・フレーム数・サンプリング設定のどれもが効くので、まず短く小さく試して、自分の環境での実測を取るのが確実です。

量子化版の選び方は 量子化モデル完全ガイド2026 にまとめています。動画モデルも画像モデルと同じ形式が使えます。

ComfyUIでのセットアップ手順

前提条件

  • ComfyUI がインストール済み
  • ComfyUI-Manager がインストール済み

ステップ1:必要なカスタムノードのインストール

ComfyUI-Managerから以下をインストールします。

ComfyUI-WanVideoWrapper  または
ComfyUI_VideoHelperSuite

または手動でインストール:

cd ComfyUI/custom_nodes
git clone https://github.com/kijai/ComfyUI-WanVideoWrapper.git

ステップ2:モデルのダウンロード

Hugging Face からモデルをダウンロードします。

ComfyUI/models/
├── wan/
│   ├── Wan2_1-T2V-1.3B/        ← T2V 1.3B モデルファイル
│   └── Wan2_1-T2V-14B/         ← T2V 14B モデルファイル
└── clip/
    └── umt5-xxl-enc-bf16.safetensors  ← テキストエンコーダー

ステップ3:ワークフローの読み込み

ComfyUIのGitHubリポジトリや ComfyUI Examples から使う世代に対応したワークフローJSONをダウンロードし、ComfyUIにドラッグ&ドロップで読み込みます。


Wan2.1のT2Vイメージn*参考イメージ:T2Vで生成されるシーン例*n

テキストtoビデオ(T2V)の使い方

プロンプトの書き方

Wan は英語の自然文中国語の両方に対応しています。英語での記述が最も安定しています。

Stable Diffusionのようなタグ形式より、動きや状況を描写する文章形式が効果的です。

A young woman in a white dress walks slowly through a sunlit forest, her hair flowing in the breeze, dappled light filtering through the trees

動きを明示するコツ

静止した描写より、動作・変化を含む文章の方が動画らしい出力になります。

(静止寄り)A girl standing by the window
(動き寄り)A girl slowly turns to face the camera by a sunlit window, her hair gently swaying

動画特有のキーワード

smooth camera movement, slow pan, gentle zoom, cinematic motion, natural movement, realistic motion

Wan2.1のI2Vワークフローイメージn*参考イメージ:I2Vの流れをイメージしたビジュアル*n

画像toビデオ(I2V)の使い方

I2Vは静止画を動かすモードです。Stable Diffusionで生成した画像をベースに、その画像が動いている動画を作れます。

I2Vの使いどころ

  • お気に入りの静止画をアニメーション化
  • キャラクターに表情変化や呼吸などの微細な動きをつける
  • 背景を動かして映像的な雰囲気を出す

I2V プロンプトの書き方

ベース画像がある分、細かいキャラクター描写は不要です。どんな動きをするかを中心に記述します。

The character slowly looks up at the camera with a gentle smile, hair moving softly in the breeze

NSFW動画生成のためのコツ

モデルの選択

Wan のベースモデルはSFWですが、ComfyUIのワークフローでネガティブプロンプトなどを調整することで対応可能です。また、コミュニティが Wan 系をNSFW向けにファインチューンしたモデルも公開されています。世代が上がると対応モデルも入れ替わるので、使う世代に合ったものを探してください。

プロンプト設計

NSFWシーンの動画は、静止画の描写 + 動きの描写を組み合わせます。

A woman in lingerie slowly removes her clothing, revealing skin, natural soft lighting, bedroom setting, cinematic

品質向上のポイント

  • 短い動画(5秒以内)から始める——長い動画はアナトミー崩れが発生しやすい
  • 大きな動きより微細な動き(呼吸、目線移動、髪のなびき)の方が品質が安定する
  • I2Vを使って高品質な静止画から動かす方が、T2Vより安定することが多い

動画品質を上げるパラメータ調整

パラメータ推奨値説明
Steps20〜30多いほど品質向上(時間も増加)
CFG5〜7高すぎるとアーティファクト発生
フレーム数49〜81フレーム約2〜3秒分(24fps換算)
解像度480×832 または 832×480VRAMに応じて調整
Motion Strength(I2V)0.5〜0.8動きの強さ。高いほど大きく動く

AnimateDiffとWanの使い分け

比較項目AnimateDiffWan
動きの自然さ普通〜良い非常に良い
アニメ系との相性
リアル系との相性
VRAM要件低い(8GB〜)高め(8〜24GB)
生成速度速い遅い
LoRA対応発展中
カメラ制御Motion LoRAで可能T2Vでプロンプト指定

アニメ系キャラを動かしたいなら AnimateDiff + Illustrious/NoobAI の組み合わせがまだ有利です。リアル系・映像的な品質を求めるなら Wan 系が上回ります。


よくある問題と対処法

問題1:VRAMエラーが出る

対処:1.3Bモデルを使う。量子化モデル(fp8/int8)を使う。フレーム数を減らす

問題2:動きがガクガクする

対処:StepsをFを増やす(25以上)。Motion Strengthを下げる

問題3:キャラが途中で崩れる

対処:短い動画(5秒以内)から始める。大きな動きを避ける。I2Vで静止画をベースにする

問題4:プロンプトが反映されない

対処:より具体的な動きの描写に変える。英語で記述する。CFGを少し上げる

関連記事

よくある質問

WANとは何ですか?

WANは動画生成に特化したモデルで、テキストからの動画生成(text-to-video)に加え、1枚の静止画を入力として動かすimage-to-videoに対応しているのが特徴です。既存のAI画像生成で作った「当たりの1枚」を、構図やキャラクターを保ったまま動画化できる点が実用上の強みです。

image-to-videoとtext-to-videoはどちらを使うべきですか?

狙った絵がすでにあるならimage-to-videoです。構図とキャラクターを固定したまま動かせるため、意図した映像に到達しやすくなります。text-to-videoはゼロから作るため自由度は高いものの、狙った絵にたどり着くまでの試行回数が増えます。実務ではimage-to-videoのほうが効率的です。

生成した動画が崩れます。どう改善しますか?

まず入力する静止画を見直してください。顔や手が崩れている静止画を入力すると、動画では破綻がさらに増幅されます。ADetailerなどで静止画を仕上げてから入力してください。加えて、モーションの強さを下げる、背景をシンプルにする、被写体の周囲に余白を残す、といった対策が有効です。

何秒くらいの動画が作れますか?

実用上は数秒の短いクリップが基本です。尺を延ばすほど一貫性が崩れ、VRAM消費も増えます。長尺が必要な場合は、短いクリップを複数生成してつなぐアプローチのほうが、破綻を抑えつつ制御しやすくなります。

同じ設定なのに毎回結果が違います。

動画生成も乱数(シード)に依存するため、出力はばらつきます。これは仕様であり、避けられません。したがって「1本で完成を狙う」のではなく、3〜5本生成して最も破綻の少ないものを採用する運用が前提になります。当たった条件はログに残しておいてください。

AIでエロコンテンツを作るときの参考に(FANZAの人気作品)

以下はAI生成物ではなく、FANZAで人気の同人作品です。どんな題材・構図・シチュエーションが支持されているのかを押さえておくと、AIでエロコンテンツを作るときの狙いが定まります。

【アニメ対応】サキュバス無双 〜三姉妹の淫乱ジュポワール〜Ver1.1.0

【アニメ対応】サキュバス無双 〜三姉妹の淫乱ジュポワール〜Ver1.1.0

★4.63(レビュー49件)

1,320円 FANZAで見る
先生、その診察はアウトです!

先生、その診察はアウトです!

★4.6(レビュー15件)

1,144円 FANZAで見る
ヤレるチケット-みつけた女が歩く生オナホになった日-

ヤレるチケット-みつけた女が歩く生オナホになった日-

★4.56(レビュー77件)

1,705円 FANZAで見る
チートアイテム管理局のお仕事EX 散々ヤラれた後だし、どうせ全部忘れるから、被害者つまみ食いしてもいいよね

チートアイテム管理局のお仕事EX 散々ヤラれた後だし、どうせ全部忘れるから、被害者つまみ食いしてもいいよね

★4.54(レビュー52件)・60P

495円 FANZAで見る

※ 本セクションはアフィリエイト広告(FANZA)を含みます。掲載作品はAI生成物ではありません。価格・配信状況は変わる場合があるため商品ページで最新情報をご確認ください。

次へ