Wan 2.6とは?
Wan 2.6は、Alibaba(Tongyi / Wanチーム)が開発し、2025年12月にリリースしたマルチモーダル動画生成モデルです。テキストプロンプト、または画像・参照動画・音声から、最大15秒、最大1080p(24fps)の動画クリップを生成します。音声も同じパスで生成され、リップシンク付きのセリフ、効果音、音楽に対応します。
Wan 2.5と比べて、実制作に重要な3つの機能が追加されています。マルチショットのナラティブプランニング:1つのプロンプトで複数のカット(ワイド→クローズアップ→リアクション)を指定でき、別々に生成したクリップを自分でつなぎ合わせる代わりに、モデルがそれらを順番に構成します。参照ベースの生成:参照画像や参照動画を入力すると、複数のショットにわたってキャラクターのアイデンティティと外見を維持します。より高いモーション忠実度:15秒という長い実行時間でも、より滑らかで安定した動きを実現します。テキスト、画像、参照動画、音声の入力を1つのワークフローで受け付けます。
Wan 2.6はAPI専用モデルです—重みは公開ダウンロードできません。Wan 2.1と2.2はオープンウェイト(Apache-2.0)版で、2.5と2.6はAPI専用です。GPTProtoではモデル文字列wan-2.6を指定して呼び出し、解像度と長さに応じて実行単位で課金されます。
| 仕様 | 値 |
|---|---|
| プロバイダー | Alibaba(Tongyi / Wan)· 2025年12月リリース |
| モダリティ | テキストから動画(このページ);画像から動画、参照から動画にも対応 |
| 入力 | テキスト、画像、参照動画、音声 |
| 音声 | ネイティブ同期—音声+リップシンク+効果音+音楽を1回の処理で生成 |
| マルチショット | 対応—マルチショットプランニング+アイデンティティ保持 |
| 解像度 | 最大1080p(24fps);横長/縦長/正方形 |
| 長さ | 5 / 10 / 15秒 |
| 重み | API専用(オープンソースではない) |
| モデル文字列 | wan-2.6 |
| エンドポイント | https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video |
マルチショットと同期音声の仕組み
Wan 2.6を特徴づけるのは2つの機能で、どちらもプロンプトの作り方を変えます。
1回の処理で音声を同期。生成ステップでフレームと対応する音声トラックを同時に作成するため、発話が正しい唇の動きに合い、環境音や音楽も別途編集することなくカットに重なります。プロンプトにSound:キューを使って音を記述するか、audioパラメータで独自のトラックを渡すと、モデルが動きを音声に同期させます。
1回の実行でマルチショット。1つの連続したショットをレンダリングするのではなく、Wan 2.6は1つのクリップ内に複数の展開を構成できます。プロンプトを時間ごとに([0-5s] … [5-10s] … [10-15s] …)分割すると、モデルはそれぞれを1つのショットとして扱い、カットをまたいでキャラクターと設定を引き継ぎます。shot_typeパラメータで、1つの連続ショットにするか、マルチショット構成にするかを制御できます。一貫性を重視する場合、8–12秒のクリップが最も安定しやすく、長さが必要なときは15秒を利用できます。
Wanファミリーからの選び方
GPTProtoではWanモデルを1つの料金体系で利用できます。用途に応じて選択してください。
- Wan 2.6—テキストから動画(このページ):1080p、最大15秒、マルチショット、ネイティブ音声。プロンプトから長めの物語や複数カットのナラティブを作る場合に適しています。
- Wan 2.6—画像から動画 / 参照から動画:静止画を動かしたり、参照クリップや複数の参照画像でシーンを導き、アイデンティティを維持したりできます。
- Wan 2.5(
wan-2.5):1080p、最大10秒、ネイティブ音声、シングルショット—1回あたり$0.225から利用できる、日常利用向けの低価格モデルです。 - Wan 2.2(
wan-2.2-plus):音声なし、720p、約5秒—ただしオープンウェイトであり、自分でホスティングする必要がある場合に適しています。
競合サービスはこれらのモデルを選択基準なしに列挙しています。要点は次のとおりです。長さ+マルチショット+アイデンティティ維持なら2.6、音声付きの低価格なシングルショットクリップなら2.5、オープンウェイトなら2.2です。
Wan 2.6 vs Wan 2.5 vs Wan 2.2
| Wan 2.6 | Wan 2.5 | Wan 2.2 | |
|---|---|---|---|
| 音声 | ネイティブ同期 | ネイティブ同期 | なし(動画のみ) |
| 最大時間 | 15秒 | 10秒 | 約5秒 |
| 解像度 | 最大1080p | 最大1080p | 720p |
| マルチショット/参照 | はい | いいえ | いいえ |
| オープンウェイト | いいえ(API専用) | いいえ(API専用) | はい(Apache 2.0) |
| GPTProtoの価格 | $0.45–$2.025 / 実行 | $0.225–$1.35 / 実行 | $0.09 / 実行 |
率直に言うと:Wan 2.6は1回あたりの料金が高くなりますが、15秒の動画、マルチショットのシーン、またはカットをまたいだキャラクターの一貫性が必要な場合に使うべきモデルです。Wan 2.5は、音声付きで最大10秒のシングルショットクリップを作る日常利用向けの低価格モデルです。Wan 2.2は、セルフホスティングのためにオープンウェイトが必要な場合にのみ選ぶモデルです。
関連:Wan 2.5 → · Wan 2.2 → · Sora 2 →
Wan 2.6 APIで作成できるもの
マルチショットの短編映画や広告—1つのプロンプトで、カットをまたいで一貫したキャラクターと音声を持つ複数のショットを構成できます。手作業でつなぎ合わせることなく、15秒のナラティブ広告を作成できます。720p/5秒で20種類をテストすると、約$9.00です。
大規模なローカライズ動画—多言語プロンプトとリップシンク付き音声により、再撮影なしで1つの絵コンテを複数の言語に展開できます。中国語への対応も優れています。
アスペクト比を問わず同一価格—正方形(960×960、1440×1440)、縦長(720×1280、1080×1920)、横長はいずれも同じ料金ティア内で同一価格です。プラットフォームごとに形式を自由に選べます。
画像/参照から動画—関連エンドポイントで静止画を動かしたり、参照クリップでシーンを導いたりできます。
Wan 2.6のプロンプト例
Wan 2.6は音声を生成し、複数のショットを計画できるため、プロンプトではショット、動き、音をまとめて記述すると効果的です。プラットフォーム独自の例では、プロンプトを時間ごとに分割しています—マルチショットにはこの方法を使ってください。各展開を次の構成にします:ショット+被写体+アクション+カメラ+照明+Sound:キュー。
1. マルチショットのナラティブ(15秒+ショットプランニング)
[0-5s] ワイドショット:夜明け、1人のハイカーが霧に包まれた山の尾根に到着する。ゆっくりとプッシュイン。
[5-10s] ミディアムショット:彼女がカメラを持ち上げ、ほほ笑む。音:風、遠くの鳥の声。
[10-15s] クローズアップ:山頂の向こうから太陽が現れ、光がフレームいっぱいに広がる。音:セリフなし、環境音楽が柔らかく盛り上がる。
2. セリフ+リップシンク(シングルショット)
木製カウンターの奥に立つバリスタのミディアムクローズアップ。暖かな朝の光。彼女はカメラを見て「いつものですね?すぐにお持ちします」と言う。カップから湯気が立ち上る。音:セリフ、エスプレッソマシンの蒸気音、静かなカフェの環境音。
3. 商品/プロモーション、正方形フレーム正方形のフレーム。マットな台座の上でスニーカーがゆっくり回転し、スタジオ照明が表面を横切り、控えめな反射が生まれる。音:低いシンセのパルス、光が横切る際の柔らかな風切り音、セリフなし。
実用的なヒント:マルチショットでは各展開に時間範囲を付け、セリフはその時間内に収まる長さにします。シングルショットとマルチショットはshot_typeで設定します。一貫性を保つには8–12秒が最適で、長さが必要な場合は15秒を使用します。アーティファクトを除外するにはnegative_promptを使います(例:「テキストなし、透かしなし」)。prompt_extend: trueを使うとモデルが短いプロンプトを拡張できます—細かく制御したい場合はオフにしてください。結果を再現するにはseedを固定します。






