AnimateDiff入門:静止画をAI動画にする方法を初心者向けに解説

静止画生成のスキルをそのまま動画に活かせるAnimateDiffの使い方を初心者向けに解説。セットアップから最初の動画を出力するまでの手順、NSFWアニメーションのコツまでカバー。

AnimateDiff入門:静止画をAI動画にする方法を初心者向けに解説 のサムネイル

この記事の要点

  • AnimateDiffは静止画モデルに「動き」のモジュールを足して短い動画を作る仕組み
  • 動きの強さを上げるほど顔と手の破綻が増える。小さな動きから始める
  • 元となる静止画(プロンプト)の品質がそのまま動画品質になる
  • 長い尺は破綻が蓄積する。数秒の短いクリップから作る

「静止画は作れるようになったけど、動く画像も作ってみたい」と思ったことはありませんか?AnimateDiffを使えば、これまで培ったStable Diffusionのプロンプト知識をそのまま動画生成に活用できます。専門的な動画生成ツールを新たに覚える必要はありません。

この記事では、AnimateDiffの仕組みの理解から最初の動画を出力するまでを、手順を追って解説します。

AnimateDiffとは:Static Diffusionとの違い

通常のStable Diffusion(Static Diffusion)は「1枚の画像」を生成します。AnimateDiffはこれを「複数フレームの連続した画像」として生成し、それをつなげてアニメーションにします。

重要な点として、AnimateDiffはCheckpointモデルやLoRAをそのまま使います。つまり、「お気に入りのアニメ系モデルでアニメーションを作る」「NSFW用途で使っているCheckpointで動画を作る」といったことが、追加のモデル学習なしに可能です。

静止画生成との違いをまとめると:

比較項目静止画(通常のSD)AnimateDiff
出力1枚の画像複数フレームの動画
使うモデルCheckpoint + LoRA同じCheckpoint + LoRA + モーションモジュール
VRAM消費普通フレーム数に比例して増加
生成時間数秒〜数十秒数分〜数十分
プロンプトそのまま使えるそのまま使えるが動きの指示が追加できる

AnimateDiffにしか必要ない追加ファイルは「モーションモジュール」と呼ばれる専用のモデルだけです。これをダウンロードして配置すれば準備完了です。

必要なVRAMと動作環境

AnimateDiffはフレーム数(何コマの動画を作るか)によってVRAM消費が大きく変わります。

VRAM対応フレーム数目安速度
8GB8〜12フレーム(SD1.5)非常に遅い、設定によっては不可
12GB16〜24フレーム(SD1.5)遅め(5〜15分/動画)
16GB24〜32フレーム(SD1.5)普通(3〜8分/動画)
24GB32〜48フレーム(SD1.5)快適(2〜5分/動画)

注意: SDXL + AnimateDiffはSD1.5より数倍のVRAMを必要とします。VRAM 16GB未満の場合は、まずSD1.5ベースのCheckpointでAnimateDiffを試すことを強くおすすめします。

CPUオフロードを使えばVRAMが少ない環境でも動かせますが、生成時間が大幅に延びます(8GB環境で1動画30分以上になることも)。

インストール方法

ComfyUIでのインストール(推奨)

ComfyUIはAnimateDiffのワークフローを視覚的に管理できるため、初心者にも扱いやすいです。

手順:

  1. ComfyUI Manager をインストール済みであることを確認する
  2. ComfyUI Managerを開き、「Install Missing Custom Nodes」→「ComfyUI-AnimateDiff-Evolved」を検索してインストール
  3. ComfyUIを再起動する
  4. モーションモジュールファイルをダウンロードして以下に配置する
ComfyUI/
└── custom_nodes/
    └── ComfyUI-AnimateDiff-Evolved/
        └── models/    ← ここにモーションモジュールを置く

AUTOMATIC1111での インストール

  1. 「Extensions」タブ →「Install from URL」
  2. 以下のURLを入力してインストール
https://github.com/continue-revolution/sd-webui-animatediff
  1. WebUIを再起動する
  2. txt2imgページに「AnimateDiff」タブが追加されることを確認

モーションモジュールの配置先(AUTOMATIC1111):

stable-diffusion-webui/
└── extensions/
    └── sd-webui-animatediff/
        └── model/    ← ここにモーションモジュールを置く

モーションモジュールの種類と選び方

モーションモジュールはAnimateDiff専用のファイルで、動きのスムーズさや特性を決定します。

v2とv3の違い

バージョン特徴推奨用途
mm_sd_v14古い世代、安定SD1.4ベース
mm_sd_v15v14より改善SD1.5系の基本
mm_sd_v15_v2最もよく使われる定番SD1.5系の標準推奨
AnimateDiff v3より滑らかな動き高品質な動画が必要な時

初心者が最初に使うべきは mm_sd_v15_v2.ckpt です。これが現時点でも安定した動きと品質を両立している基本モデルです。

ダウンロード先:

アニメ特化モーションモジュール

アニメ調の画像に特化したモーションモジュールも存在します。

  • mm-Stabilized_high.pth — アニメ向けの安定性重視
  • AnimateLCM — 高速生成に特化(8ステップ以下で動画生成可能)

最初の動画を出力するまでの最短手順

ComfyUIを使った最短手順を説明します。

ステップ1:ワークフローを準備する

ComfyUIのリポジトリにはComfyUI公式のサンプルワークフロー集が用意されています。ない場合は ComfyUI-AnimateDiff-Evolved のリポジトリ をダウンロードしてComfyUIにドラッグ&ドロップします。

ステップ2:各ノードを設定する

# 最低限設定するノード

Load Checkpoint:
  model: (使いたいCheckpointを選択)

Load AnimateDiff Model:
  model_name: mm_sd_v15_v2.ckpt

AnimateDiff Loader:
  context_length: 16    ← フレーム数
  context_stride: 1
  context_overlap: 4

CLIP Text Encode(Prompt):
  text: 1girl, standing, smiling, outdoor, (動きの描写をここに入れる)

KSampler:
  steps: 20
  cfg: 7.0
  sampler_name: euler_a
  scheduler: linear
  denoise: 1.0

ステップ3:解像度を設定する

AnimateDiffでは解像度を上げすぎるとVRAMが不足します。最初の試行には次の解像度を使ってください。

SD1.5: 512x512 または 512x768
SDXL: 768x768 または 768x1024

ステップ4:生成してVHS(動画)ノードで出力

ComfyUI-AnimateDiff-Evolvedには動画ファイルとして出力するためのノードが含まれています。「Video Helper Suite」または「VHS」ノードを使って .gif または .mp4 形式で保存します。

フレーム数・FPS設定の考え方

AnimateDiffの動画の長さと滑らかさを決める2つの設定です。

フレーム数(何枚の画像を生成するか):

16フレーム ÷ 8fps = 2秒の動画
24フレーム ÷ 8fps = 3秒の動画
32フレーム ÷ 8fps = 4秒の動画

VRAMに余裕がなければまず16フレームで試してください。8GBでも動く可能性があります。

FPS(1秒あたりのフレーム数):

4fps  = 動きがガクガク(ファイルサイズが小さい)
8fps  = 標準的なアニメーションの動き(推奨)
12fps = 滑らかな動き(VRAM消費増、生成時間増)
24fps = 映像品質(ハイエンドGPU推奨)

AnimateDiffで生成するのはあくまでフレームです。FPSはGIF/動画に変換するときに指定します。同じ16フレームでも4fpsにすれば4秒の動画に、8fpsにすれば2秒の動画になります。

プロンプトで動きを制御するコツ

AnimateDiffはプロンプトに「動き」を表現する言葉を入れることで、動画の内容を制御できます。

効果のある動き表現の例:

# 人物の動き
hair blowing in the wind, swaying hair
blinking eyes, slowly looking around
breathing motion, slight body movement
walking, slow walk

# カメラワーク
panning shot, camera pan
zoom in, slow zoom
rotating camera

動きの強さを調整するコツ:

動きを強調したい場合はMotion LoRAを使うことで、特定のカメラワークや動き方を強化できます。

# プロンプトに動き表現を入れる基本構成例
(masterpiece, best quality), 1girl, outdoor park,
(hair blowing in wind:1.2), (gentle breathing:1.1), sunny day,
soft lighting, detailed face

NSFW動画生成での注意点と設定

NSFWコンテンツでAnimateDiffを使う際の設定のポイントをまとめます。

推奨設定:

# NSFW AnimateDiff基本設定

フレーム数: 16(最初は控えめに)
解像度: 512x768(縦長構図)
Steps: 20〜25
CFG: 7.0〜8.0
モーションモジュール: mm_sd_v15_v2.ckpt
Motion Scale: 1.0〜1.2(動きの強さ)

注意点:

  • NSFW系Checkpointとモーションモジュールの相性は試してみるまでわからない部分がある
  • フレーム数を増やすと体の整合性(各フレームで体型が維持されるか)が崩れやすい
  • まず16フレームで体の動きが安定することを確認してからフレーム数を増やす

CivitaiにはAnimateDiff対応のNSFWモデルも多数配布されています。検索フィルターで「Motion」タイプを選択すると見つけやすいです。

出力動画のファイル形式とGIF変換方法

AnimateDiffで生成したフレームは、主に2つの形式で保存できます。

MP4形式(動画ファイル)

品質が高く、ファイルサイズが小さいため保存・共有に最適です。

ComfyUIのVHSノードでの設定例:

# VHS Video Combine ノード設定
frame_rate: 8
format: video/mp4
codec: h264
quality: 85

GIF形式(アニメーションGIF)

ブラウザやSNSで手軽に表示できますが、ファイルサイズが大きくなりがちで色数も制限されます。

# VHS Video Combine ノード設定(GIF)
frame_rate: 8
format: image/gif

MP4をGIFに変換したい場合(外部ツール使用):

# ffmpegを使ったGIF変換(コマンドライン)
ffmpeg -i input.mp4 -vf "fps=8,scale=512:-1" output.gif

または EZGif などのオンラインツールを使えばコマンドライン不要です。

おすすめモーションLoRA

モーションLoRAは特定のカメラワークや動き方をAnimateDiffに追加できるファイルです。

代表的なモーションLoRA:

  • AnimateDiff Motion LoRA(公式) — パン・ズーム・ローリングなどカメラワーク系
    • v2_lora_ZoomIn.ckpt — ズームイン
    • v2_lora_ZoomOut.ckpt — ズームアウト
    • v2_lora_PanLeft.ckpt — 左パン
    • v2_lora_PanRight.ckpt — 右パン

使い方はComfyUIのAnimateDiff Loaderノードで「motion_lora」スロットに設定します。

# モーションLoRAの重み設定例
motion_lora: v2_lora_ZoomIn.ckpt
strength: 0.6〜0.8

強さ(strength)を上げすぎると動きが激しくなりすぎます。0.6〜0.8から試してください。

まとめ:まずは16フレーム・低解像度から始めよう

AnimateDiffは最初の設定が少し手間に感じるかもしれませんが、一度ワークフローが動き始めれば、あとはプロンプトを変えるだけで動画を量産できます。

最初の一歩として推奨する設定をまとめます。

CheckPoint: 使い慣れたSD1.5系モデル
モーションモジュール: mm_sd_v15_v2.ckpt
フレーム数: 16
解像度: 512x512
FPS: 8
Steps: 20
CFG: 7.0

この設定で安定した動画が出るようになったら、フレーム数を増やしたり、モーションLoRAを追加したり、高解像度に挑戦したりと段階的にレベルアップしていきましょう。静止画生成の楽しさが一段広がります。

関連ガイド

次のステップAnimateDiff応用テクニック に、より長い動画・より滑らかな動き・キャラの一貫性を出す実践テクをまとめています。

AI動画ツール全体を比較したいAI動画ツール比較2026 では Runway・Kling・Luma などクラウド系と、AnimateDiff・Wan2.1・Stable Video Diffusion などローカル系を8軸で比較しています。

成人向け動画に本格運用したい

ローカル環境の下準備Stable Diffusion WebUI導入ガイド2026 / ComfyUI完全導入ガイド2026 / GPU別最適設定ガイド

キャラを固定して連作を作るAIキャラを固定する完全ガイド / IP-Adapter完全ガイド

よくある質問

AnimateDiffとは何ですか?

AnimateDiffは、Stable Diffusionなどの静止画生成モデルに「モーションモジュール」を追加することで、連続したフレームを生成し短い動画を作る技術です。既存のCheckpointやLoRAをそのまま活かせるのが大きな利点で、使い慣れた画風のまま動画化できます。

動画にすると顔や手が崩れます。

静止画の時点で許容できていた軽微な破綻が、フレーム間で揺れることで目立つようになるためです。対策は、動きの強さ(モーションスケール)を下げる、被写体を1人に絞る、背景をシンプルにする、そして何より静止画の段階で顔と手を仕上げておくことです。動画は静止画の品質を超えられません。

何秒くらいの動画が作れますか?

実用的には数秒程度の短いクリップが基本です。尺を長くするほど破綻や一貫性の崩れが蓄積し、またVRAM消費も増えます。まず2〜3秒のクリップで安定条件を見つけ、必要に応じて複数のクリップをつなぐアプローチが現実的です。

AnimateDiffとimage-to-videoはどう違いますか?

AnimateDiffはプロンプトから動画を直接生成する(text-to-video寄りの)アプローチで、image-to-videoは完成した1枚の静止画を入力として動かすアプローチです。狙った絵を確実に活かしたいならimage-to-videoのほうが向きます。AnimateDiffは既存のモデルとLoRA資産をそのまま使える点が強みです。

どんな動きが得意ですか?

まばたき、髪の揺れ、呼吸、わずかな体の揺らぎといった小さな動きが得意です。逆に、大きく歩く、複雑に手を動かすといった動作は破綻しやすくなります。「派手に動かす」よりも「微細に生きているように見せる」ほうが、現状の技術では自然で使える映像になります。

AIでエロコンテンツを作るときの参考に(FANZAの人気作品)

以下はAI生成物ではなく、FANZAで人気の同人作品です。どんな題材・構図・シチュエーションが支持されているのかを押さえておくと、AIでエロコンテンツを作るときの狙いが定まります。

ヴァージンリベンジャー2

ヴァージンリベンジャー2

★4.75(レビュー16件)・71P

715円 FANZAで見る
義理ですからっ2 いちゃらぶ花火大会編

義理ですからっ2 いちゃらぶ花火大会編

★4.69(レビュー26件)・108P

10円 FANZAで見る
完全包囲 恥辱まみれの修学旅行 混浴おじさん編

完全包囲 恥辱まみれの修学旅行 混浴おじさん編

★4.68(レビュー19件)・51P

550円 FANZAで見る
【スマホ対応】幼なじみと、恋人ごっこ。

【スマホ対応】幼なじみと、恋人ごっこ。

★4.66(レビュー321件)

1,980円 FANZAで見る

※ 本セクションはアフィリエイト広告(FANZA)を含みます。掲載作品はAI生成物ではありません。価格・配信状況は変わる場合があるため商品ページで最新情報をご確認ください。

次へ