Fish Speech と GPT-SoVITS 完全ガイド2026:多言語対応・音声クローンができる無料ローカルTTS

Fish Speech(Fish Audio S2)と GPT-SoVITS の特徴・導入の大枠・音声クローンの実務・倫理を整理。Style-Bert-VITS2/Irodori-TTS との使い分けと、同人音声向けの注意点までまとめました。

Fish Speech と GPT-SoVITS 完全ガイド2026:多言語対応・音声クローンができる無料ローカルTTS のサムネイル

この記事の要点

  • Fish Speech(Fish Audio)は多言語・ゼロショット寄り。GPT-SoVITS は数秒クローンと少量データ学習が強い
  • 日本語の感情演技だけなら Style-Bert-VITS2/Irodori-TTS、多言語や参照音声クローンなら本記事の2つが候補
  • 参照音声の長さは目安で、Fish Speech は十数秒〜、GPT-SoVITS は公式に5秒ゼロショット等の記述あり。最新はREADMEで確認
  • 他人・実在声優の声を無許可クローンして売る行為は権利・規約の両面でNG
  • ライセンスはリポジトリごとに違う。Fish Speech は FISH AUDIO RESEARCH LICENSE、GPT-SoVITS は MIT。商用前に必ず原文確認

日本語のローカル TTS といえば Style-Bert-VITS2Irodori-TTS がよく挙がります。ただ「英語や中国語も同じ環境で」「短い参照音声から声を寄せたい」となると、別系統のツールが必要になります。

この記事では Fish Speech(Fish Audio)GPT-SoVITS を、導入の大枠・クローンの実務・倫理・既存ツールとの使い分けに絞って整理します。細かいインストールコマンドや依存バージョンは変わりやすいので、実行時は必ず公式 GitHub とドキュメントを見てください。

Fish Speech とは何か

Fish Speech は Fish Audio 系のオープンソース TTS プロジェクトです。README では Fish Audio S2 Pro など、多言語・表現力を前面に出したモデルが紹介されています。学習データ規模や言語数の記述はモデル世代で更新されるため、数値は公式の表を正としてください。

公式が強調している強みはだいたい次です。

  • 多言語:日本語・英語・中国語を含む広範囲の言語を、音素表を言語ごとに張り替えなくても扱える方向
  • ゼロショット寄りの音声クローン:短い参照音声から音色・話し方を寄せる
  • 自然言語タグでの制御[whisper][excited] のようなタグで韻律・感情を細かく指示する(S2 系の説明)
  • WebUI/CLI/サーバ:ドキュメントにインストール、CLI、WebUI、Docker、サーバ推論の導線がある

ライセンスは README 上 FISH AUDIO RESEARCH LICENSE と明記されています。MIT や Apache とは別物なので、「オープンソース=何でも商用OK」と決めつけないでください。原文の LICENSE を読んでから用途を決めてください。違法利用について開発側が責任を負わない、という注意書きも README にあります。

必要環境の目安は、GPU メモリとモデルサイズ(S2-Pro はパラメータ規模が大きい、など)に依存します。公式の Installation ページに環境要件が書かれるので、手元の VRAM と照らし合わせてください。うろ覚えの「何GBあれば足りる」はここでは断定しません。

GPT-SoVITS とは何か

GPT-SoVITS は GPT-SoVITS-WebUI として公開されている、音声変換と TTS をまとめたプロジェクトです(リポジトリ: RVC-Boss/GPT-SoVITS)。README の Features では次が明示されています。

  1. Zero-shot TTS:約5秒のボーカルサンプルから即テキスト読み上げ
  2. Few-shot TTS:おおよそ1分程度のデータでのファインチューンにより類似度・自然さを上げる
  3. Cross-lingual:英語・日本語・韓国語・広東語・中国語などの記述
  4. WebUI ツール:ボーカル分離、データ分割、多言語 ASR、ラベル付けなど学習前処理

ライセンス表示は MIT です(バッジと LICENSE を確認)。こちらも「コードが MIT だから学習に使った他人の声も自由」ではありません。参照音声とデータセットの権利は別途処理が必要です。

導入は Windows 向け統合パッケージ、conda + install スクリプト、Docker など複数経路があります。Python は 3.10 前後がテスト環境として README に並びます。GPU(CUDA)/CPU/Apple silicon の表も公式にあります。VRAM の厳密な下限は用途(推論だけか、学習もか、バージョン v2/v3/v4/v2Pro か)で変わるので、公式とコミュニティの最新情報を見てください。

WebUI は webui.py や bat 起動が中心で、推論用 UI も同梱の流れです。初心者がデータ準備から学習まで一通り触りやすいのが GPT-SoVITS 側の実務的な利点です。

導入の大枠(コマンドは公式を正とする)

共通してやることはシンプルです。

  1. 公式リポジトリをクローン、または配布パッケージを取得する
  2. Python/PyTorch/CUDA(または CPU)を公式の組合せに合わせる
  3. 事前学習モデルを所定ディレクトリに置く(インストールスクリプトが取る場合もある)
  4. WebUI または CLI で推論を試す
  5. クローンや学習に進むなら、参照音声と台本を用意する

Fish Speech は speech.fish.audio のドキュメント が入口です。GPT-SoVITS は README の Installation と、中国語/英語のユーザガイドへのリンクがあります。この記事に貼ったコマンドをコピペして永久に動く、という前提は置かないでください。 依存とモデル配置は更新が速いです。

GPU が弱い場合は、推論のみ・短い音声・量子化や half 精度などの公式オプションを先に調べるとよいです。学習までやるなら余裕のある VRAM とストレージが要ります。

音声クローンの実務フロー

参照音声の準備

  • 長さ:GPT-SoVITS は公式に「5秒ゼロショット」「1分 few-shot」といった目安がある。Fish Speech S2 は「典型的には10〜30秒」といった説明がある。どちらも目安なので、手元のバージョンで試す
  • 音質:背景ノイズ・BGM・複数人の同時発話は類似度を落とす。可能なら静かな単一話者
  • 内容:母語に近い自然な発話。極端な加工ボイスだけだと再現がブレやすい
  • 権利:自分の声、または契約・許諾済みの素材だけを使う

ノイズ除去は GPT-SoVITS の WebUI に前処理ツールがある、Fish Speech 側は前処理パイプラインをドキュメントで確認する、という進め方が現実的です。

生成の手順(概念)

  1. 参照音声を指定する(話者トークンや参照スロットの概念はツールで違う)
  2. 読み上げるテキストを入れる(言語タグが要る場合は公式どおり)
  3. 感情・速度・ピッチなどがあれば弱めから調整する
  4. 短い文で試し、問題なければ長文・台本へ
  5. 波形を書き出し、DAW で無音・息・ノイズを整える

ゼロショットで「だいたい近い」ところまで行き、足りなければ few-shot 学習や別テイクの参照を足す、という二段構えが GPT-SoVITS ではよく使われます。Fish Speech はタグ付きテキストで演技を足す方向が強い、という整理がしやすいです。

倫理と法律(最重要)

他人の声・実在の声優や配信者の声を、許諾なくクローンして公開・販売しないでください。 技術的に可能でも、権利侵害やプラットフォームBAN、社会的な問題になります。同人音声を売る場合も同じです。

  • 実在人物の声の無断再現はしない
  • 「似てる声」を売り文句に有名人を連想させない
  • 学習データに権利不明の切り抜きを混ぜない
  • 利用規約と各国のデジタルレプリカ関連の議論を自分で追う

ツールの README にも、違法利用に責任を負わない旨が書かれていることがあります。それは「やってもよい」という意味ではありません。

Style-Bert-VITS2 / Irodori-TTS との使い分け

用途向きやすい候補
日本語の感情スタイルを細かく指定Style-Bert-VITS2、Irodori-TTS
絵文字やスタイル制御で同人演技Irodori-TTS
数秒〜数十秒の参照からすぐ声を寄せたいGPT-SoVITS、Fish Speech
英中日など多言語を同じ系統でFish Speech が特に強い説明。GPT-SoVITS も複数言語対応
少量データで自分用に学習を詰めたいGPT-SoVITS の few-shot
すでに日本語同人の型が決まっている既存の Bert-VITS 系を優先し、足りないときだけクローン系

「いちばん上手い日本語」一本で選ぶより、今日の台本に何が足りないかで選ぶと失敗が減ります。詳細な日本語運用は Style-Bert-VITS2 ガイドIrodori-TTS ガイド を先に読むとよいです。

同人音声・NSFW 用途での注意点

  • モデルライセンス:Fish Speech の RESEARCH LICENSE、GPT-SoVITS の MIT、依存コーデックや ASR モデルの条件を全部洗う
  • 声の権利:クローン元が自分の声か、契約済みか
  • 実在声優の再現販売はNG
  • プラットフォーム:DLsite / FANZA 同人などは AI 明記や音声作品の規約がある。販売フローは AI音声で同人音声を売る完全ガイド
  • 品質:息・哽え・叫びはローカル TTS が弱いことが多い。手動で波形編集する前提を持つ

NSFW だから規制がゆるい、ということはありません。むしろ成人向け販売の方が規約と表記が厳しいことがあります。

よくあるつまずき

  • 参照が短すぎる/雑音だらけで別人になる
  • 言語設定とテキストの言語が食い違う
  • VRAM 不足で学習や長文推論が落ちる → 公式の軽量経路や短い生成から
  • 「商用OK」と聞いて売ったが、参照音声の権利がアウト
  • 日本語の間や助詞が不自然 → 句読点・短い文への分割・後編集

まとめ

Fish Speech と GPT-SoVITS は、日本語特化 TTS の隣に置く 多言語・参照クローン枠 です。前者は多言語と表現タグ、後者は WebUI とゼロショット/few-shot の実務導線が強い、と覚えると選びやすいです。導入コマンドは公式を正とし、声の権利とライセンス原文を読んでから同人や販売に進んでください。

日本語演技の本丸は引き続き Style-Bert-VITS2 や Irodori-TTS が候補になります。足りない能力だけこの2系統で補う、という使い方がいちばん事故が少ないです。

よくある質問

Fish Speech と GPT-SoVITS の違いは?

ざっくり言うと、Fish Speech 側は多言語と自然言語タグでの感情・韻律制御、ゼロショット寄りのクローンが前面に出やすいです。GPT-SoVITS は WebUI 一体型で、数秒の参照からすぐ喋らせるゼロショットと、1分前後の少量データでのファインチューンが売りです。日本語専用の感情スタイル管理なら Style-Bert-VITS2 系も別候補です。

音声クローンは何秒の参照音声で動く?

公式の説明は時期とバージョンで変わります。GPT-SoVITS の README には、5秒サンプルのゼロショットや、1分程度の few-shot 学習といった記述があります。Fish Speech(S2)側は十数秒〜30秒前後の短い参照で音色を掴む、という説明が公式にあります。必ず利用中の README とドキュメントで最新値を確認してください。

他人の声を無許可でクローンしてもいい?

やってはいけません。肖像・パブリシティ・契約・プラットフォーム規約など複数の問題が重なります。同人音声を売る場合も、実在声優や配信者の声を無断再現して販売するのは避けるべきです。自分で収録した声、権利処理済みの素材だけを使ってください。

日本語の自然さは Style-Bert-VITS2 と比べてどう?

用途によります。日本語の感情演技やスタイル指定を細かく詰めたいなら Style-Bert-VITS2 や Irodori-TTS の方が扱いやすい場面が多いです。多言語・参照音声クローン・別言語の台詞が必要なら Fish Speech/GPT-SoVITS が強いです。最終的には同じ台本で聴き比べるのが確実です。

商用利用できる?

ツールごとに違います。GPT-SoVITS のリポジトリは MIT と表示されていますが、依存モデルや学習に使った音声の権利は別問題です。Fish Speech は FISH AUDIO RESEARCH LICENSE なので、商用前に LICENSE 原文を読んでください。生成物の販売可否と、モデルの再配布・サービス提供の可否は分けて考える必要があります。

Web UI はある?

どちらも WebUI/デモ系の導線があります。GPT-SoVITS は Gradio ベースの WebUI が中心です。Fish Speech は公式ドキュメントに WebUI 推論や Docker、サーバ推論の案内があります。インストール手順は公式の最新ページを正としてください。

AIでエロコンテンツを作るときの参考に(FANZAの人気作品)

以下はAI生成物ではなく、FANZAで人気の同人作品です。どんな題材・構図・シチュエーションが支持されているのかを押さえておくと、AIでエロコンテンツを作るときの狙いが定まります。

先生、好きです -先生×教え子総集編-

先生、好きです -先生×教え子総集編-

★4.96(レビュー50件)・202P

1,100円 FANZAで見る
密偵アリカの受難・上

密偵アリカの受難・上

★4.94(レビュー35件)・77P

495円 FANZAで見る
水泳女子、嫌いなコーチに堕とされる。

水泳女子、嫌いなコーチに堕とされる。

★4.92(レビュー13件)・65P

10円 FANZAで見る
今泉ん家はどうやらギャルの溜まり場になってるらしい 総集編2

今泉ん家はどうやらギャルの溜まり場になってるらしい 総集編2

★4.91(レビュー43件)・322P

1,595円 FANZAで見る
突然姉ができた話3

突然姉ができた話3

★4.91(レビュー23件)・63P

440円 FANZAで見る
僕にハーレムセフレができた理由 4

僕にハーレムセフレができた理由 4

★4.91(レビュー23件)・187P

550円 FANZAで見る

※ 本セクションはアフィリエイト広告(FANZA)を含みます。掲載作品はAI生成物ではありません。価格・配信状況は変わる場合があるため商品ページで最新情報をご確認ください。

次へ