Schuyler Stacy2026-06-24

Wan 2.7とは?AlibabaのThinking Modeモデルガイド(2026年)

多くのガイドはWan 2.7がオープンソースだと説明しています。しかし公式情報はそれを否定しています。Alibabaが2026年4月のモデルで実際に提供したものと、その実行方法を解説します。

Wan 2.7とは?AlibabaのThinking Modeモデルガイド(2026年)

「wan 2.7」で検索すると、両立しない2つの答えが見つかります。一方のガイドは重みをダウンロードして自分のGPUで実行できると説明し、もう一方はAPI経由でしか利用できないとしています。どちらが正しいのか調べたのは、その答えによってこのモデルをセルフホストできるかどうかが決まるからです。簡潔に言えば、「オープンソースだ」と自信満々に書かれた記事の多くは、事実ではなく過去の慣習を繰り返しています。Wan 2.7の正体、Alibabaが提供したものと提供していないもの、そして今日Wanモデルを本番環境に導入する方法を解説します。

目次

Wan 2.7の正体

Wan 2.7は単一のモデルではありません。AlibabaのTongyi Labが2026年4月初旬に公開した一連のリリースで、画像と動画という2つのメディアにまたがっています。画像側にはWan2.7-Imageと、別モデルのWan2.7-Image Proがあり、ローンチ資料ではおよそ4月1日付けとされています。動画側には、テキストから動画、画像から動画、参照画像から動画、指示ベースの動画編集をカバーする4モデルのスイートがあり、その後数日間にわたって展開されました。この2つの領域をまたぐ構成こそ、Wan 2.7が「画像モデル」なのか「動画モデル」なのかについて検索結果が食い違う理由です。答えは両方であり、1つのバージョン番号の下で同時に提供されています。

名称自体も整理しておく価値があります。混同されやすいからです。「Wan」はAlibabaのクリエイティブAIシリーズ、Tongyi Wanxiang(通义万相)の国際的な略称です。同じ企業傘下のQwen言語モデルとは近い位置にありますが、別の製品ファミリーです。そのため、ホスティングプラットフォームがWanをqwenのパスに登録していても、それはカタログ上の都合であり、WanがQwenモデルだという意味ではありません。

一言で言えば、Wan 2.7はAlibabaが2026年4月に展開した画像・動画生成モデル群で、「Thinking Mode」を主な特徴としています。

Thinking Modeの仕組み

仕組みの前に、なぜ存在するのかを説明しましょう。一般的な動画モデルは、プロンプトをそのままフレームへ変換します。依頼内容を考えるための間はなく、テキストを読み、潜在空間内の経路を選び、デコードします。単純で整った1ショットなら問題ありません。しかし、複数ショットのシーケンス、3ショット目でも1ショット目と同じ外見を保つキャラクター、特定のタイミングで完了するカメラ移動など、構造を含む指示を出すと脆くなります。モデルが急いで指示を処理するため、つなぎ目が目立つのです。

Alibabaの説明によると、Thinking Modeは生成前に計画段階を挿入します。モデルはまず構成計画を作成します。つまり、プロンプトの意図をどう解釈するか、要素が空間と時間の中でどう関係するか、ショットの論理をどうするかを整理し、その後で生成します。狙いは、アーティファクトを減らし、シーケンス全体の一貫性を高めることです。

この改善幅は確定した数値ではなく、まだ検討すべき問題だと考えています。その理由は後ほど説明します。ただし、設計思想は妥当であり、ここで本当に新しい点でもあります。要するに、Thinking Modeは計画処理の分だけ速度を少し犠牲にしますが、プロンプトに複数の動く要素がある場合に特に効果を発揮します。

主な機能と、それぞれの数値をどこまで信頼できるか

ここでは情報の確度を分けて考える必要があります。Wan 2.7の機能一覧はほぼすべてAlibaba自身のローンチノートに基づいており、ベンダーが示す数値にはその旨を明記すべきだからです。

Alibabaは次のように報告しています。クリップ全体で顔を維持できるほどのキャラクター一貫性、「AIによる同じ顔」問題への対策、HEX値とパレットに対応する精密な色制御、表や数式をフレーム内に描画できる12言語・3,000トークン超の長文レンダリング、複数ショットの物語制御、最初と最後のフレームによるガイダンス、最大9枚の参照画像に対応する参照画像から動画への変換、そして同一パスで生成されるネイティブ音声です。これらはベンダーの主張であり、ベンダーの主張として提示されています。中立的なテストで検証することはまだできていません。

ハードスペックについては、多くの記事が認める以上に曖昧です。出力解像度は実行場所によって720pまたは1080pとされ、クリップ長は2~15秒程度、4Kという数値は画像モデルに関するものです。これらはホストによって異なるため、単一の数値を見たら「モデルの仕様」ではなく「そのプラットフォーム上での仕様」と考えてください。生成も即時ではありません。初期の実利用レポートでは、軽量な動画モデルより明らかに遅いとされており、これは計画処理の静かなコストです。大量にレンダリングする場合は予算に含めるべきでしょう。

正直なところ、執筆時点では中立的なリーダーボードでWan 2.7を確認できませんでした。Artificial Analysis Video Arenaにも掲載がなく、このバージョンの公開VBenchスコアもありません。品質が低いという意味ではありません。現在流通している品質に関する主張が、全面的にベンダー報告に依存しているということです。検証可能な最も近い手掛かりは系譜です。Wan 2.1は2025年2月の公開時にVBenchで首位になりましたが、それは以前のモデルの実績であり、2.7の代替にはなりません。

主張の種類 信頼度
現在検証可能 2.1/2.2はオープンウェイト、2.1は公開時にVBench首位 公式リポジトリとベンチマークで確認済み
ベンダー報告 Thinking Modeの効果、色・テキスト・一貫性の仕様 Alibabaの説明のみ。中立的なテストは未実施
ホストによって異なる 720p/1080p、2~15秒、4K(画像) プラットフォーム依存で、モデル固有の固定仕様ではない

Wan 2.7はオープンソース?

まず短く答えると、Wanシリーズから多くの人が期待する意味でのオープンソースではありません。

事実はこうです。Wan 2.1(2025年2月)とWan 2.2(2025年7月)はApache 2.0のオープンウェイトとして公開され、ダウンロード、セルフホスト、ファインチューニングが可能で、商用上の制限もありませんでした。これはWan-AI organization on Hugging FaceWan-Video organization on GitHubで自分でも確認できます。このオープンウェイトの実績は事実であり、多くのガイドが2.7もオープンだと想定する理由です。

もう1つの事実があります。同じ公式チャンネル、つまりGitHub組織、Hugging Face組織、Alibaba自身のModelScopeには、Wan 2.7の重みが掲載されていません。執筆時点で公式の履歴上最新のオープンウェイトリリースは、依然としてWan 2.2ファミリーです。A14Bのテキスト・画像から動画モデル、5B TI2V、さらに後発のS2VとAnimateの各バリエーションが含まれます。そのリポジトリの公式ニュースログも、2.7の記載よりかなり前で止まっています。

したがって、Wan 2.7が「Apache 2.0のオープンウェイト」だと説明するページを見たら、実際の公式重みリポジトリへのリンクがあるか確認してください。私が追跡したケースでは、どれもリンクがありませんでした。シリーズの評判に便乗した主張であり、広く引用されている情報源の少なくとも1つは、自身のページ間で矛盾していました。私の見立てでは、Wan 2.7は2.1や2.2のオープンな道ではなく、AlibabaがWan 2.5と2.6ですでに採用したAPI専用の道を進んでいます。ただし、これは確定的な事実ではなく判断です。Alibabaが来週重みをアップロードすれば状況は変わります。それでも今日、検証可能な証拠が示す方向は明確です。

実務上の判断は明快です。ローカル推論、ファインチューニング、インフラの外に出せないデータなど、どうしても重みが必要なプロジェクトなら、Wan 2.7では現時点で対応できず、現実的なオープンな選択肢はWan 2.2です。API経由で利用できるなら、2.5、2.6、2.7はいずれもその方法で利用できます。存在しないダウンロードを期待して2.7を選ばないでください。

実際に使うべきWanはどれ?

「最新」が「自分に最適」とは限らないと考えれば、ファミリーの違いは明確です。

バージョン アクセス方法 解像度 / 長さ 特徴 この条件なら選ぶ
Wan 2.2 オープンウェイト(Apache 2.0) 720p、約5秒 MoE、4090で実行可能 セルフホストまたはファインチューニングが必要
Wan 2.5 API専用 1080p、約10秒 ネイティブ音声 セルフホストなしで音声が必要
Wan 2.6 API専用 1080p、最大15秒 複数ショット、キャラクターの同一性 より長い複数ショットのクリップが必要
Wan 2.7 API専用 720p/1080p、2~15秒 Thinking Mode、最初/最後のフレーム、画像+動画 API経由で計画機能と参照制御が必要

Wan 2.7はWan以外のモデルと比べてどの位置にあるのでしょうか。オープンソース動画では、2.1以降、Wanシリーズが基準点となってきました。この系譜こそが実質的な強みです。クローズドなAPIモデルの中での2.7の差別化要因は、Thinking Modeと画像・動画を共有するスタックであり、他の現行APIモデルに対する品質面での優位性が証明されているわけではありません。Wan 2.7とSeedance、あるいはKlingを比較する表にここで数値を載せないのは、どちらかを裏付ける中立的なベンチマークがまだなく、数字を作りたくないからです。本格的な直接比較を望むなら、解説記事の簡単な1行ではなく、実際にテストした比較記事として扱うべきでしょう。

今日、API経由でWanモデルを使う方法

率直に言うと、GPT Protoでこの記事を読んでいる場合、2.7自体はカタログにありません。同じプロフィール(1080p、複数ショット、ネイティブ音声)を持つ最も近いホスト版の姉妹モデルはWan 2.6で、1回あたり0.45ドルです。実際に実行できるリクエストを紹介します。

貼り付ける前に、時間を無駄にしやすいいくつかの注意点を確認しましょう。まず、認証にはBearerトークンを使います。Wanのエンドポイントは/api/v3/alibaba/パス上にあり、rawキーではなくAuthorization: Bearer $KEYを要求します。次に、WebサイトのURLではモデルが/qwen/の下に登録されていますが、APIパスではalibabaを使います。セグメントは異なりますが、同じモデルです。3つ目は非同期の2段階呼び出しで、POSTで送信してIDを受け取り、その後GETで結果エンドポイントをポーリングします。4つ目に、パラメーターはモデルごとに異なります。2.6はaudioshot_typeを受け付けますが、2.2以降と2.5はenable_prompt_expansionを使い、前者の2つは使用しません。

# 1. ジョブを送信
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "prompt": "A first-person POV gliding through a damp stone tunnel toward a bright exit. [0-3s] fast forward motion, light at the end growing. [3-5s] emerge into a sunlit forest, a waterfall on the right. Sound: heavy breathing, then birdsong.",
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": true,
    "audio": "",
    "shot_type": "",
    "seed": 1
  }'
# -> returns a prediction id
 
# 2. 結果をポーリング
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY"

ポーリングループを含む同じ処理をPythonで記述すると次のようになります。

import os, time, requests
 
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
 
payload = {
    "prompt": (
        "A first-person POV gliding through a damp stone tunnel toward a bright exit. "
        "[0-3s] fast forward motion, light at the end growing. "
        "[3-5s] emerge into a sunlit forest, a waterfall on the right. "
        "Sound: heavy breathing, then birdsong."
    ),
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": True,
    "audio": "",
    "shot_type": "",
    "seed": 1,
}
 
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
                       headers=HEADERS, json=payload).json()
result_id = submit["id"]
 
while True:
    r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
    if r.get("status") in ("succeeded", "failed"):
        print(r)
        break
    time.sleep(5)

料金はクリップごとの固定額ではなく、設定に応じて変動します。解像度、長さ、音声によって金額が変わるため、1080p・10秒のプレビュー料金は基本料金の0.45ドルより高くなります。ホスト版Wanモデルはそれぞれのモデルページに現在の料金を表示しており、すべて他のcatalogと同じ残高を共有します。そのため、2.5と2.6を試すために別々のアカウントを管理する必要はありません。

Thinking Mode向けのプロンプト作成

2.7はレンダリング前に計画を立てるため、最も効果的なプロンプトはキーワードの羅列ではなく、企画書に近いものです。意図と構造を与えましょう。タイムスタンプ付きのビートシート、つまり[0-3s] … [3-5s] …のような記述は、計画処理に整理のための具体的な基準を与えます。上のサンプルコードでも同じパターンを使っています。音声も同じプロンプトの一部です。短いSound:キュー(「荒い息遣い、その後に鳥のさえずり」)によって、別の呼び出しなしでネイティブ音声トラックを生成できます。また、negative_promptを使って、予想される失敗を除外しましょう。「光る植物なし、歪んだ手なし」のように指定し、空欄のままにしないでください。特別な技術ではありません。生成前にブリーフ全体を読むモデルに合わせて書くだけです。

使うべき人、使うべきでない人

セルフホスト、ファインチューニング、組織内に留めるデータなど、オープンウェイトが必要なら、Wan 2.7は現時点では不適切で、Wan 2.2が適しています。API経由で制御可能な画像・動画生成を使いたく、クローズドモデルと遅めのレンダリングを受け入れられるなら、2.7は妥当な選択肢です。ただし、品質面での優位性は今のところAlibabaの主張であり、測定結果ではないという点には注意が必要です。予算を抑えて試作するなら、より安価なホスト版Wanを使えば、本格導入を決める前に1回数セントで試せます。バージョン番号ではなく、制約に合わせてモデルを選びましょう。

クリエイティブスタジオ

本番環境向けAPIを使用して、画像や動画などを生成します。

作成を開始する
クリエイティブスタジオ
関連モデル
すべてのモデル
Qwen
by Qwen
10% OFF
Qwen
by Qwen
10% OFF
Claude
20% OFF
Google
40% OFF

よくある質問

Wan 2.7はオープンソースですか?

入手可能な証拠からは、そうとは言えません。Wan 2.1と2.2はApache 2.0のオープンウェイトですが、執筆時点でWan 2.7の重みはAlibaba公式のHugging Face、GitHub、ModelScopeの各チャンネルに公開されていません。公式の重みが登場するまではAPI専用として扱ってください。

Wan 2.7はいつリリースされましたか?

2026年4月初旬です。画像モデルは4月1日頃、動画スイートはその後数日間に公開されました。

Wan 2.7は画像モデルですか、それとも動画モデルですか?

両方です。リリースには画像モデル(Wan2.7-Image / Image Pro)と、4モデル構成の動画スイートが含まれます。

Wan 2.7とWan 2.2の違いは何ですか?

2.2はオープンウェイトで720p、ローカル実行が可能です。2.7はAPI専用で、Thinking Mode、最初・最後のフレーム制御、参照画像から動画への変換、画像生成を追加しています。制約に応じて異なるツールです。

Wan 2.7は他の動画モデルより優れていますか?

中立的なベンチマークでは未検証です。まだArtificial AnalysisやVBenchへの掲載がないため、現時点での「Xより優れている」という主張はベンダー報告にすぎません。

Wan 2.7をローカルで実行できますか?

現時点ではできません。公開された重みがないためです。ローカル展開にはWan 2.2を使用してください。

API経由で利用する場合、料金はいくらですか?

解像度、長さ、音声によって異なります。最も近いホスト版の姉妹モデルであるWan 2.6は、1回あたり0.45ドルから利用できます。
wan.2.2:生成動画のスタンダード

wan.2.2:生成動画のスタンダード

要約 wan.2.2モデルは、生成速度そのものよりも、映像の整合性とプロンプトへの厳密な準拠を優先します。高性能なハードウェアを必要としますが、アーティファクトのない信頼性の高いAI動画出力をクリエイターに提供します。 生成動画モデルは、映像の一貫性を犠牲にして速度を優先することが少なくありません。詳細なシーンの説明を入力し、数分待った結果、顔が歪み、不自然な動きで埋め尽くされたクリップが生成されることがあります。wan.2.2の開発者たちは、異なるアプローチを採用しました。ソース素材の美的なディテールを尊重し、ピクセルのずれを防ぐためにモーションベクトルを緻密に計算するシステムを構築したのです。 このアーキテクチャをネイティブに実行するには、相当な計算能力が必要です。パラメータを効率的に処理するには最上位クラスのGPUが必要となるため、多くのプロフェッショナルは高性能なAPIに処理を任せています。ローカルハードウェアの制約から解放されることで、ComfyUI、SVI Pro、PainterI2Vなどのツールを統合し、モデルを自分の思い描いた通りに動作させられます。 映画のような結果を実現するには、最初の5秒という出力制限を超えて考える必要があります。クリップを連結し、ネイティブのフレーム補間を活用することで、最初に入力したテキストプロンプトに実際に一致する、一貫性のある高解像度シーケンスを構築できます。

Schuyler Stacy | 2026-03-02

Wan 2.5:4K AI動画生成の未来

Wan 2.5:4K AI動画生成の未来

動画制作は大きな変革期を迎えており、 Wan 2.5 はその変革の中心に位置しています。高品質なビジュアルコンテンツへの需要が急速に高まる中、クリエイターにはハリウッド級の予算なしで映画のような成果を実現できるツールが求められています。 Wan 2.5 は、高度なAIを活用してテキストや画像を魅力的な4K動画シーケンスへ変換し、このニーズに応えます。従来世代の制約を克服するために開発されたこのモデルは、リアルな動き、長時間のクリップ、そして2つのモードに対応する柔軟性を提供します。本稿では、 Wan 2.5 がAI動画生成の世界をどのように再定義しているのかを詳しく解説します。

Michael Johnson | 2026-03-02

WAN 2.5ガイド:最新AI動画モデルとその機能を徹底解説

WAN 2.5ガイド:最新AI動画モデルとその機能を徹底解説

要約 :WAN 2.5はAI動画分野における大きな転換点です。手頃な価格でプロ品質の1080p機能を提供し、Soraのような主要競合に挑戦しています。 WAN 2.5の登場は、オープンソース開発とクローズドソースのスケーリングのどちらが今後の主流となるのかについて、大きな議論を巻き起こしました。オープンウェイトから離れたことに不満を抱く開発者もいますが、一貫した動きと高精度な動画合成を求めるクリエイターにとって、このモデルは依然として強力なツールです。 技術面では、WAN 2.5は音声と映像の優れた同期に加え、高度なキーフレーム対応を備えており、映像ディレクターがより細かく制御できます。これらの機能をコスト効率の高いワークフローに組み込むことで、現代のマーケティング業界やゲーム業界にとって実用的なソリューションとしての地位を確立しています。

Tiffany Layne | 2026-03-17

Wan Video:オープンソース生成を極める

Wan Video:オープンソース生成を極める

TL;DR 生成AI市場では通常、最先端の機能を利用するために、高額な独自サブスクリプションへの加入をクリエイターに求めます。Alibabaのwan videoは、高い流動性を持つテキスト・動画および画像・動画シーケンスを生成できるオープンソースモデルを提供することで、その状況を変えます。 アルゴリズムのブラックボックスの中で何が起きているのか、もう推測する必要はありません。重みが公開されているため、開発者やデジタルアーティストは一般向けのグラフィックカードでソフトウェアを実行したり、堅牢なAPIパイプラインを通じてスケールさせたりできます。このレベルのアクセス性により、映像を使ったストーリーテリングへの参入障壁は大幅に下がります。 それでも、良い結果を得るには技術的な意図が必要です。成功の鍵は、プロンプトの構成方法、カメラの動きの説明、そしてすべてのフレームで時間的一貫性を維持するためのハードウェア制約の管理に大きく左右されます。

Schuyler Stacy | 2026-03-17