Wan 2.5とは?
Wan 2.5は、2025年9月にリリースされたAlibaba(Tongyi / Wanチーム)の動画生成モデルです。テキストプロンプト、または静止画から、最大10秒、最大1080p(24fps)の動画クリップを生成し、同じ処理で音声も生成します。音声には、リップシンク付きの会話、環境音、音楽が含まれます。この一括音声・映像出力こそが、従来のWanシリーズや、無音の動画しか生成しない多くのオープン動画モデルとの違いです。
Wan 2.5はAPI専用のプレビュー版として提供されており、重みは一般公開されていません。(Wan 2.1と2.2は、セルフホスト可能なオープンウェイト版、Apache-2.0ライセンス版です。2.5と2.6はAPI専用です。)GPTProtoでは、モデル文字列 wan-2.5を指定して呼び出します。料金は解像度と長さに応じて生成ごとに課金され、200以上の他のモデルと同じ残高を利用できます。
| 仕様 | 値 |
|---|---|
| プロバイダー | Alibaba(Tongyi / Wan) |
| モダリティ | テキストから動画(このページ)、画像から動画 |
| 音声 | ネイティブ同期 — 音声 + リップシンク + 効果音 + 音楽を一括生成 |
| 解像度 | 480p / 720p / 1080p(24fps) |
| 最大長 | 約10秒 |
| 言語 | 多言語(中国語に強い) |
| 重み | API専用プレビュー(オープンソースではない) |
| モデル文字列 | wan-2.5 |
| エンドポイント | https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video |
Wan 2.5 APIで作成できるもの
短編ソーシャル動画・広告 — 音声編集を別途行わず、ボイスオーバーとサウンドを内蔵した5~10秒の縦型または横型クリップを作成できます。720p/5秒の実行1回あたり0.45ドルなので、広告バリエーションを12種類A/Bテストしても低コストに収まります。
大規模なローカライズ動画 — Wan 2.5は多言語プロンプトに対応し、リップシンク付きの音声を生成します。そのため、撮り直しや再吹き替えなしで、1つの絵コンテから複数言語版を作成できます。中国語に強く対応しています。
ストーリーテリングと解説動画 — 会話、環境音、音楽をまとめて生成するため、クリップ全体でナレーションと映像の同期を保てます。YouTubeのイントロ、製品解説、研修用セグメントなどに便利です。
静止画のアニメーション化 — 1枚の画像を最初のフレームとして入力し、動きのプロンプトでアニメーション化できます。
Wan 2.5が動画と音声を同時に生成する仕組み
ほとんどの動画モデルは無音のフレームを出力し、音声は後から別途追加します。Wan 2.5は逆の考え方で設計されています。生成処理では映像フレームと、それに対応する音声トラックを同時に生成するため、音声は正しい口の動きに合い、足音は歩みに一致し、音楽も編集なしでカットの下に自然に配置されます。実際には、2つのツール(動画モデル + TTS/フォーリー)を使う工程が、1回のAPI呼び出しに集約されます。
ここから2つの点が導かれます。まず、プロンプトでは動きだけでなく 音声も説明してください。会話のセリフ、環境音のベース、音楽を入れるかどうかを指定します(§6を参照)。次に、音声と動画は1回の処理で生成されるため、1回の実行が1つの課金単位になります。二重に支払ったり、トラックをつなぎ合わせたりする必要はありません。代わりに自分の音楽やボイスオーバーを使用したい場合は、audioパラメーターで指定でき、モデルがそれに合わせて動きを同期します。
Wanファミリー内での選び方
GPTProtoでは、複数のWanモデルを1つの残高で利用できます。バージョン番号ではなく、用途に応じて選びましょう。
- Wan 2.5 — テキストから動画(このページ): 1080p、最大10秒、ネイティブ音声。音声付きのプロンプトからクリップを作る場合の標準モデルです。
- Wan 2.5 — 画像から動画:静止画を最初のフレームとして開始し、アニメーション化します(「wan 2.5 animate」のケース)。
- Wan 2.2 (
wan-2.2-plus):無音、720p、約5秒ですが、オープンウェイトなので、セルフホストが必須の場合に適しています。 - Wan 2.6 (
wan-2.6):1080p、最大15秒に対応し、複数ショットのシーン設計と参照ベースの人物同一性保持も可能です。より長い、または複数カットのストーリーが必要な場合に選びます。
この比較表のような情報は、競合サービスが省きがちなものです。競合はモデルを列挙するだけで、どれを選ぶべきか説明しません。音声付きのワンショットクリップには2.5、重みが必要なら2.2、長さや複数ショットが必要なら2.6を使いましょう。
Wan 2.5とSora 2の比較
どちらも、テキストまたは画像から同期音声付きの動画を生成します。実用上の違いは次のとおりです。
| Wan 2.5 | Sora 2 | |
| 音声 | ネイティブ同期(音声 / 効果音 / 音楽) | ネイティブ同期 |
| 解像度 | 最大1080p | 最大1080p |
| 最大長 | 約10秒 | より長く — 最大約25秒(Pro) |
| 言語 | 多言語、中国語に強い | 多言語 |
| コンテンツ / IPルール | より緩やか | より厳格 — 一部のホストではIPや写実的な人物 likeness をブロック |
| オープンウェイト | いいえ(API専用) | いいえ |
| GPTProtoの料金 | 1回あたり0.225~1.35ドル(解像度 × 長さ) | 1回あたり0.4ドル |
率直に言うと:Sora 2は1回あたり一律0.4ドルで、より長いクリップ(Proでは最大約25秒)に対応しています。長さを重視する場合はこちらを選びましょう。Wan 2.5は1回あたり0.225ドル(480p/5秒)から利用でき、解像度とコストを交換できるうえ、多言語音声に強く、コンテンツ制限も少なめです。どちらも1つのGPTProto残高で利用できます。
関連:Sora 2 → · Wan 2.6 → · Wan 2.2 →
Wan 2.5のプロンプト例
Wan 2.5は動画と一緒に音声も生成するため、良いプロンプトでは動きだけでなく音声も説明します。プラットフォームの例では、Sound:というキューで音声をプロンプト内に記述しています。この形式に従いましょう。構成は、被写体 + アクション + カメラワーク + ライティング + Sound:キュー + スタイルです。コピーして調整してください。
1. 会話 + リップシンク(音声エンジンを確認)
夜明けの木造ボートに乗る高齢の漁師をミディアムクローズアップで撮影。柔らかな金色の光、穏やかに水が打ち寄せる。彼はカメラに目を向け、温かく「海はいつも約束を守る」と言う。ゆっくりとプッシュイン。Sound: 穏やかな波、遠くのカモメ、落ち着いた話し声、音楽なし。
2. 環境音 / 効果音、会話なし
夜のネオンに照らされた東京の路地に雨が降っている。猫が軒下へ駆け込み、濡れた路面に反射がきらめく。静的なワイドショット、シネマティック。Sound: 絶え間ない雨、遠くの交通音、音楽なし、話し声なし。
3. 製品 / マーケティング
大理石のカウンターに置かれたアイスコーヒーをクローズアップ。水滴が浮かび、朝のキッチンの光が差し込む。スプーンが氷をかき混ぜる。グラスの周囲をゆっくり180度オービット。Sound: 氷が軽く触れ合う音、静かなキッチンの環境音、控えめなBGM。
4. 動き / トラッキング
夕暮れの誰もいないコンクリート広場をスケートボーダーが滑る。横から並走するローアングルのトラッキングショット、控えめなレンズフレア。Sound: 路面を転がる車輪の音、風の環境音、会話なし。
ヒント:クリップの長さに収まるよう、会話は短くしてください(5秒あたり1行程度)。カメラワークは具体的に指定し、環境音だけが必要なら「音楽なし」と明記します。自分のトラックをaudioパラメーター経由で渡すこともできます。









