Schuyler Stacy2026-06-24

什麼是 Wan 2.7?Alibaba 思考模式模型指南(2026)

多數指南都說 Wan 2.7 是開源的,但第一方證據顯示並非如此。Alibaba 在 2026 年 4 月實際發布了什麼,以及如何執行它。

什麼是 Wan 2.7?Alibaba 思考模式模型指南(2026)

搜尋「wan 2.7」,你會得到兩個不可能同時為真的答案。一些指南告訴你下載權重並在自己的 GPU 上執行;另一些則說只能透過 API 使用。我開始查找哪一個才是正確的,因為答案決定了你是否能自行託管這個模型——簡短結論是,多數信誓旦旦宣稱「它是開源的」的文章,只是在重複一種慣例,而非事實。以下說明 Wan 2.7 的真實面貌、Alibaba 已經與尚未發布的內容,以及今天如何將 Wan 模型投入生產環境。

目錄

Wan 2.7 的真實面貌

Wan 2.7 並不是單一模型,而是 Alibaba Tongyi Lab 在 2026 年 4 月初推出的一波版本更新,同時涵蓋兩種媒體。影像方面有 Wan2.7-Image,以及另一個獨立的 Wan2.7-Image Pro,發布資料將其日期標示在 4 月 1 日左右;影片方面則是一套四模型系列,涵蓋文字轉影片、影像轉影片、參考圖轉影片,以及以指令為基礎的影片編輯,並在接下來幾天陸續推出。正是這種雙重範圍,導致搜尋結果頁面對 Wan 2.7 究竟是「影像模型」還是「影片模型」各說各話。答案是兩者皆是,只是以同一個版本號一併發布。

這個名稱本身值得釐清,因為很容易讓人混淆。「Wan」是 Tongyi Wanxiang(通義萬相)的國際簡稱,也是 Alibaba 的創意 AI 產品線。它與 Qwen 語言模型同屬一個企業體系,但屬於不同的產品家族。因此,當託管平台將 Wan 歸在 qwen 路徑下時,那是目錄分類的選擇,並不表示 Wan 是 Qwen 模型。

一句話版本:Wan 2.7 是 Alibaba 在 2026 年 4 月推出的影像與影片生成系列,主打其稱為 Thinking Mode 的功能。

Thinking Mode 的運作方式

先談機制之前,先說明它為何存在。標準影片模型會將提示詞直接映射為影格。它不會停下來思考你的要求——讀取文字、在潛在空間中選擇一條路徑,然後進行解碼。對於單一且乾淨的鏡頭,這樣就足夠了。但當你要求的是具有結構的內容時,情況會立即變得脆弱:多鏡頭序列、必須在第三個鏡頭和第一個鏡頭中保持外觀一致的角色,或必須在特定節拍上完成的攝影機移動。模型匆忙處理簡報,接縫便會暴露出來。

按照 Alibaba 的說法,Thinking Mode 會在生成前加入規劃階段。模型首先建立構圖規劃——理解提示詞的意圖、元素在空間與時間上的關係,以及鏡頭邏輯應如何安排——然後才進行生成。其主張是能減少瑕疵,並提升整個序列的一致性。

我會把這項提升的幅度視為尚未定論的問題,而不是已確定的數字,稍後也會回來說明原因。不過,這個設計理念是合理的,也是這裡真正新穎的部分。重點是:Thinking Mode 以少許速度換取一次規劃流程,當你的提示詞包含不只一個動態元素時,這一點最為重要。

主要能力——以及各項數字該相信多少

這裡需要區分信心層級,因為 Wan 2.7 的能力清單幾乎完全來自 Alibaba 自己的發布說明,而供應商提供的數字應該明確標註來源。

Alibaba 提到以下能力:足以讓臉部在整段影片中保持一致的角色一致性(用來解決「AI 千人一面」問題);接受 HEX 值與調色盤的精確色彩控制;可在 12 種語言中渲染超過 3,000 個 token 的長文本,並將表格與公式繪製到影格中;多鏡頭敘事控制;首尾影格引導;最多接受九張參考影像的參考圖轉影片;以及在同一個流程中生成原生音訊。這些都是供應商的主張,我會以供應商的主張來呈現。我目前無法透過中立測試驗證它們。

至於硬體規格,實際情況比多數文章承認的更加模糊。輸出解析度會依執行位置不同而標示為 720p 或 1080p,片段長度約在 2 至 15 秒之間,而 4K 數字則是影像模型具備的能力。這些數值會因託管平台而異,因此應將你看到的單一數字理解為「在該平台上為真」,而非「模型本身的固定規格」。生成也不是即時完成的——早期實測報告指出,它明顯比輕量影片模型更慢;這是規劃流程帶來的低調成本,如果你要大量渲染,值得預先納入預算。

坦白說,仍存在一個明顯缺口:截至本文撰寫時,我找不到 Wan 2.7 出現在任何中立排行榜上——沒有 Artificial Analysis Video Arena 項目,也沒有這個版本已發布的 VBench 分數。這不代表它不好,而是代表目前流傳的品質主張仍全部由供應商自行報告,僅此而已。最接近可驗證的參考點是其產品沿革:Wan 2.1 在 2025 年 2 月發布時登上 VBench 首位;那是較早模型的真實結果,不能代替 2.7。

主張類型 範例 可信程度
目前可驗證 2.1/2.2 為開放權重;2.1 在發布時登上 VBench 首位 已在第一方儲存庫與基準測試中確認
供應商報告 Thinking Mode 的提升、色彩/文字/一致性規格 Alibaba 的說法;目前尚無中立測試
依託管平台而異 720p/1080p、2–15 秒、4K(影像) 取決於平台,而非固定的模型規格

Wan 2.7 是開源的嗎?

先說簡短答案:不是以 Wan 系列過去讓大家形成的期待方式開放。

以下是第一個事實。Wan 2.1(2025 年 2 月)與 Wan 2.2(2025 年 7 月)以 Apache 2.0 授權的開放權重形式發布——可下載、自行託管、微調,且沒有商業限制。你可以在 Hugging Face 上的 Wan-AI 組織以及 GitHub 上的 Wan-Video 組織自行確認。這段開放權重的歷史是真實的,也正是許多指南想當然認為 2.7 同樣開放的原因。

以下是第二個事實。那些相同的官方管道——GitHub 組織、Hugging Face 組織,以及 Alibaba 自己的 ModelScope——都沒有列出 Wan 2.7 權重。截至本文撰寫時,第一方資訊中最新的開放權重版本仍是 Wan 2.2 系列(A14B 文字轉影片與影像轉影片模型、5B TI2V,以及後來的 S2V 和 Animate 變體)。該儲存庫的官方新聞記錄也早在任何 2.7 項目之前就停止更新。

因此,當某個頁面告訴你 Wan 2.7 是「Apache 2.0 授權的開放權重」時,請確認它是否連結到真正的第一方權重儲存庫。在我追查的每個案例中,答案都是否定的——這項主張只是借用了該系列的聲譽,而且至少有一個廣受引用的來源在自己的不同頁面之間互相矛盾。我的判斷是:Wan 2.7 遵循 Alibaba 在 Wan 2.5 與 2.6 上採取的僅限 API 路線,而不是 2.1 與 2.2 的開放路線。我會把這視為判斷,而非絕對真理——如果 Alibaba 下週上傳權重,情況就會改變——但截至今天,可驗證證據都指向同一個方向。

實際上,這代表一個很清楚的決策。如果你的專案確實需要權重——本機推論、微調,或不能離開基礎設施的資料——Wan 2.7 今天無法提供這些,你真正的開放選項仍是 Wan 2.2。如果你可以透過 API 使用,2.5、2.6 與 2.7 都能以這種方式取得。不要因為期待一個不存在的下載檔而選擇 2.7。

你實際上應該使用哪個 Wan?

一旦你不再把「最新」等同於「最適合你」,這個系列就能清楚區分開來。

版本 存取方式 解析度/長度 特色 適用情境
Wan 2.2 開放權重(Apache 2.0) 720p,約 5 秒 MoE,可在 4090 上執行 你必須自行託管或微調
Wan 2.5 僅限 API 1080p,約 10 秒 原生音訊 你想要音訊,但不想自行託管
Wan 2.6 僅限 API 1080p,最長 15 秒 多鏡頭、角色身分一致性 你需要更長的多鏡頭片段
Wan 2.7 僅限 API 720p/1080p,2–15 秒 Thinking Mode、首/尾影格、影像+影片 你想透過 API 使用規劃與參考控制

Wan 2.7 與非 Wan 模型相比處於什麼位置?在開源影片領域,自 2.1 以來 Wan 系列一直是參考基準——這段產品沿革才是它真正的主張。在封閉式 API 模型之間,2.7 的差異化優勢是 Thinking Mode 加上共用的影像與影片技術堆疊,而不是已證實的品質領先於其他目前的 API 競爭者。我刻意不在這裡製作 Wan 2.7 與 Seedance 或 Kling 的比較表,因為目前沒有中立基準能支持其中任何一方,我也不會捏造一個。如果你想要真正的正面比較,應該進行獨立測試,而不是在說明文章中隨意加入一列。

今天如何透過 API 使用 Wan 模型

直說吧:如果你是在 GPT Proto 上閱讀本文,請注意目錄中目前沒有 2.7——具有相同定位(1080p、多鏡頭、原生音訊)的最接近託管版本是 Wan 2.6,每次執行 $0.45。以下是一個確實可以對它執行的請求。

在貼上任何內容前,有幾個容易踩雷的地方值得提醒,因為它們曾讓人浪費時間。第一,驗證使用 Bearer token——這些 Wan 端點位於 /api/v3/alibaba/ 路徑,要求使用 Authorization: Bearer $KEY,而不是原始金鑰。第二,網站 URL 將模型歸在 /qwen/ 下,但 API 路徑使用 alibaba——區段不同,但模型相同。第三,這是兩步驟的非同步呼叫:先以 POST 提交並取得 id,再以 GET 取得結果端點進行輪詢。第四,不同模型的參數不同——2.6 接受 audioshot_type,而 2.2-plus 與 2.5 使用 enable_prompt_expansion,且不使用前述參數。

# 1. 提交工作
curl --request POST "https://gptproto.com/api/v3/alibaba/wan-2.6/text-to-video" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "prompt": "A first-person POV gliding through a damp stone tunnel toward a bright exit. [0-3s] fast forward motion, light at the end growing. [3-5s] emerge into a sunlit forest, a waterfall on the right. Sound: heavy breathing, then birdsong.",
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": true,
    "audio": "",
    "shot_type": "",
    "seed": 1
  }'
# -> returns a prediction id
 
# 2. 輪詢結果
curl --request GET "https://gptproto.com/api/v3/predictions/$RESULT_ID/result" \
  --header "Authorization: Bearer $GPTPROTO_API_KEY"

以下是使用 Python 實作相同流程的方式,並完整寫出輪詢迴圈:

import os, time, requests
 
KEY = os.environ["GPTPROTO_API_KEY"]
HEADERS = {"Authorization": f"Bearer {KEY}", "Content-Type": "application/json"}
BASE = "https://gptproto.com/api/v3"
 
payload = {
    "prompt": (
        "A first-person POV gliding through a damp stone tunnel toward a bright exit. "
        "[0-3s] fast forward motion, light at the end growing. "
        "[3-5s] emerge into a sunlit forest, a waterfall on the right. "
        "Sound: heavy breathing, then birdsong."
    ),
    "negative_prompt": "",
    "size": "1920*1080",
    "duration": 5,
    "prompt_extend": True,
    "audio": "",
    "shot_type": "",
    "seed": 1,
}
 
submit = requests.post(f"{BASE}/alibaba/wan-2.6/text-to-video",
                       headers=HEADERS, json=payload).json()
result_id = submit["id"]
 
while True:
    r = requests.get(f"{BASE}/predictions/{result_id}/result", headers=HEADERS).json()
    if r.get("status") in ("succeeded", "failed"):
        print(r)
        break
    time.sleep(5)

計費會隨配置調整,而不是採用固定的每片段費率——解析度、時長與音訊都會影響價格,這也是為什麼 1080p/10 秒的預覽報價會高於 $0.45 基本費率。每個託管 Wan 模型都會在自己的模型頁面顯示目前費率,而且它們與 catalog 中的其他模型共用同一個餘額,因此測試 2.5 與 2.6 時不必管理不同帳戶。

Thinking Mode 的提示詞寫法

由於 2.7 會先規劃再渲染,效果最好的提示詞不像關鍵字堆疊,更像一份簡報。請提供意圖與結構。帶有時間戳的節拍表——[0-3s] … [3-5s] …——能為規劃流程提供具體的組織依據,這也是上方可執行程式碼使用的相同模式。音訊是同一個提示詞的一部分:簡短的 Sound:提示(「喘息聲,接著是鳥鳴」)會驅動原生音訊軌,而不需要額外呼叫。你也可以使用 negative_prompt 排除真正預期會出現的失敗——「不要發光植物,不要扭曲的手」——而不是將其留白。這些做法並不特別;只是要對一個會在開始前讀完整份簡報的模型進行描述。

誰該使用它——誰不該使用它

如果你需要開放權重——自行託管、微調,或讓資料留在自己的基礎設施內——Wan 2.7 今天不是正確選擇,Wan 2.2 才是。如果你希望透過 API 進行可控的影像與影片生成,並且能接受封閉模型與較慢的渲染速度,2.7 是合理選擇,但必須誠實說明:目前它的品質領先仍只是 Alibaba 的主張,而非經過測量的結果。如果你正在以有限預算製作原型,較便宜的託管 Wan 方案可以讓你以每次幾美分的成本先開始,再決定是否投入。請根據限制選擇模型,而不是根據版本號。

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
Qwen
by Qwen
10% OFF
Qwen
by Qwen
10% OFF
Claude
20% OFF
Google
40% OFF

常見問題

Wan 2.7 是開源的嗎?

根據目前可取得的證據,並非如此。Wan 2.1 與 2.2 以 Apache 2.0 授權的開放權重形式發布;截至本文撰寫時,Wan 2.7 的權重尚未出現在 Alibaba 官方的 Hugging Face、GitHub 或 ModelScope 管道中。在第一方權重發布前,請將其視為僅限 API 使用。

Wan 2.7 何時發布?

2026 年 4 月初——影像模型約在 4 月 1 日發布,影片系列則在接下來幾天推出。

Wan 2.7 是影像模型還是影片模型?

兩者皆是。此版本包含影像模型(Wan2.7-Image/Image Pro)與四模型影片系列。

Wan 2.7 與 Wan 2.2 有什麼差異?

2.2 是開放權重、支援 720p,並可在本機執行。2.7 僅限 API,新增 Thinking Mode、首/尾影格控制、參考圖轉影片與影像生成。兩者是針對不同限制的工具。

Wan 2.7 比其他影片模型更好嗎?

目前尚未在中立基準測試中證實。它還沒有 Artificial Analysis 或 VBench 項目,因此目前任何「比 X 更好」的主張都只是供應商報告。

我可以在本機執行 Wan 2.7 嗎?

目前不行——尚未發布權重。若要在本機部署,請使用 Wan 2.2。

透過 API 使用需要多少費用?

取決於解析度、長度與音訊。最接近的託管版本 Wan 2.6 每次執行起價為 $0.45。

相關文章

更多部落格
wan.2.2:生成式影片的標準

wan.2.2:生成式影片的標準

重點摘要 wan.2.2 模型將視覺完整性與嚴格的提示詞遵循度置於原始生成速度之上。它需要相當強大的硬體,但能以可靠、無瑕疵的 AI 影片輸出回饋創作者。 生成式影片模型通常會以視覺連貫性為代價來追求速度。你輸入詳細的場景描述,等待幾分鐘後,得到的片段卻充滿變形的臉孔與不自然的動作。wan.2.2 背後的創作者採取了不同的方法。他們打造出一套尊重來源素材美學細節的系統,並仔細計算動態向量,以防止像素漂移。 原生運行這套架構需要強大的運算能力。你需要頂級 GPU 才能有效處理這些參數,這也是許多專業人士將繁重工作交給高效能 API 的原因。擺脫本地硬體限制後,你可以整合 ComfyUI、SVI Pro 與 PainterI2V 等工具,迫使模型完全按照你的構想運作。 要取得電影級成果,就不能只看最初五秒的輸出限制。串接多個片段並運用原生影格插值,你便能建構連貫的高解析度序列,真正符合最初的文字提示。

Schuyler Stacy | 2026-03-02

Wan 2.5:4K AI 影片生成的未來

Wan 2.5:4K AI 影片生成的未來

影片製作正經歷劇烈變革,而 Wan 2.5 正位於這場轉型的核心。隨著對高品質視覺內容的需求迅速攀升,創作者需要能在無需好萊塢預算的情況下,打造電影級成果的工具。 Wan 2.5 透過先進 AI 將文字與影像轉換為令人驚嘆的 4K 影片序列,回應了這項需求。此模型旨在克服前代產品的限制,提供逼真的動態效果、更長的影片片段,以及雙模式彈性。在這篇完整評測中,我們將深入探討 Wan 2.5 如何重新定義 AI 影片生成的版圖。

Michael Johnson | 2026-03-02

WAN 2.5 指南:深入解析最新 AI 影片模型及其功能

WAN 2.5 指南:深入解析最新 AI 影片模型及其功能

TL;DR :WAN 2.5 代表 AI 影片領域的一個重大轉折點,在專業級 1080p 功能與實惠價格之間取得平衡,對 Sora 等主要競爭者形成挑戰。 WAN 2.5 的出現引發了關於開源開發與閉源擴展未來走向的重大討論。儘管停止提供開放權重讓部分開發者感到失望,這個模型仍是尋求動作一致性與高保真影片合成創作者的強大工具。 從技術層面來看,WAN 2.5 能實現令人印象深刻的音訊與視覺同步,並支援進階關鍵影格,讓導演擁有更多控制權。透過將這些能力整合到具成本效益的工作流程中,它成為現代行銷與遊戲產業的實用解決方案。

Tiffany Layne | 2026-03-17

Wan Video:掌握開源生成技術

Wan Video:掌握開源生成技術

重點摘要 生成式人工智慧市場通常迫使創作者訂閱昂貴的專有服務,才能使用頂尖功能。Alibaba 的 wan video 打破了這種局面,提供一個能夠生成高度流暢文字轉影片與圖片轉影片序列的開源模型。 你不再需要猜測演算法黑箱內發生了什麼。由於模型權重公開,開發者與數位藝術家可以在消費級顯示卡上執行軟體,或透過強大的 API 管線進行擴展。這種程度的可及性大幅降低了電影級敘事的入門門檻。 要取得良好結果,仍需要明確的技術意圖。成功與否高度取決於你如何組織提示詞、描述鏡頭運動,以及管理硬體限制,以維持每一幀之間的時間一致性。

Schuyler Stacy | 2026-03-17