什麼是 Wan 2.5?
Wan 2.5 是阿里巴巴(通義/Wan 團隊)的影片生成模型,於 2025 年 9 月發布。它能將文字提示詞 — 或靜態圖片 — 轉換為最長 10 秒、最高 1080p(24fps)的影片片段,並在同一次生成中產生音訊:包括具備唇形同步的對話、環境音效和音樂。這種一次生成的視聽輸出,正是它有別於早期 Wan 版本及大多數僅產生無聲影片的開放影片模型之處。
Wan 2.5 以僅限 API 的預覽版形式提供 — 其權重無法公開下載。(Wan 2.1 和 2.2 是採用 Apache-2.0 授權、可自行託管的開放權重版本;2.5 和 2.6 則僅限 API。)在 GPTProto 上,你可以使用模型字串 wan-2.5 呼叫它,依解析度和時長按每次生成計費,並與其他 200 多個模型共用同一個餘額。
| 規格 | 值 |
|---|---|
| 提供者 | 阿里巴巴(通義/Wan) |
| 模態 | 文字轉影片(本頁)、圖片轉影片 |
| 音訊 | 原生同步 — 語音 + 唇形同步 + 音效 + 音樂,一次生成 |
| 解析度 | 480p / 720p / 1080p(24fps) |
| 最長時長 | 約 10 秒 |
| 語言 | 多語言(中文能力強) |
| 權重 | 僅限 API 的預覽版(非開源) |
| 模型字串 | wan-2.5 |
| 端點 | https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video |
使用 Wan 2.5 API 可以建立什麼
短影音社群內容與廣告 — 具備內建旁白和音效的 5–10 秒直式或橫式影片片段,不需要另外編輯音訊。每次 720p/5 秒執行僅需 0.45 美元,測試十幾種廣告版本的 A/B 測試仍然相當便宜。
大規模本地化影片 — Wan 2.5 能處理多語言提示詞並產生具備唇形同步的語音,因此同一份分鏡腳本可以轉成多種語言版本,不必重新拍攝或配音。中文支援能力強。
說故事與解說影片 — 對話、環境音和音樂一同生成,能讓整段影片中的旁白與畫面保持同步 — 適合用於 YouTube 開場、產品解說和培訓片段。
讓靜態圖片動起來 — 將單張圖片作為第一幀,再搭配動作提示詞為其添加動畫。
Wan 2.5 如何同時生成影片與音訊
大多數影片模型輸出的是無聲畫面,音效則是之後另外加入的工作。Wan 2.5 的設計理念正好相反。它的生成步驟會共同產生視覺畫面和相匹配的音軌,因此語音會對準正確的嘴唇動作,腳步聲會與步伐同步,音樂也能在剪輯下方自然襯托,而不需要你進行任何編輯。實際上,這將「影片模型 + TTS/擬音」的雙工具流程整合成一次 API 呼叫。
這會帶來兩個結果。第一,你的提示詞應該同時描述 聲音與動作 — 說明對話內容、環境音,以及是否需要音樂(請參閱第 6 節)。第二,由於音訊和影片來自同一次生成,一次執行就是一個計費單位;你不需要支付兩次費用,也不必拼接音軌。如果你想改用自己的音樂或旁白,audio 參數可以接受自訂音訊,模型會讓動作與其同步。
如何在 Wan 系列中選擇
GPTProto 在同一個餘額中提供多個 Wan 模型。請根據工作需求選擇,而不是只看版本號:
- Wan 2.5 — 文字轉影片(本頁):最高 1080p、最長 10 秒、原生音訊。適合需要帶有聲音的提示詞轉影片片段,為預設選項。
- Wan 2.5 — 圖片轉影片:從靜態圖片作為第一幀開始,為其添加動畫(即「wan 2.5 animate」使用情境)。
- Wan 2.2 (
wan-2.2-plus):無聲、720p、約 5 秒 — 但它採用開放權重,因此當你必須自行託管時,應選擇它。 - Wan 2.6 (
wan-2.6):1080p、最長 15 秒,此外還支援多鏡頭場景規劃和基於參考圖的身分維持 — 當你需要更長或多段剪輯的敘事時,升級選用它。
這正是競爭對手常常省略的比較資訊:他們只列出模型,卻不告訴你該選哪一個。單鏡頭且需要音訊的影片片段使用 2.5,需要權重時使用 2.2,需要更長時長和多鏡頭時使用 2.6。
Wan 2.5 與 Sora 2
兩者都能從文字或圖片生成帶有同步音訊的影片。實際上的差異如下:
| Wan 2.5 | Sora 2 | |
| 音訊 | 原生同步(語音/音效/音樂) | 原生同步 |
| 解析度 | 最高 1080p | 最高 1080p |
| 最長時長 | 約 10 秒 | 更長 — Pro 最高約 25 秒 |
| 語言 | 多語言,中文能力強 | 多語言 |
| 內容/IP 規則 | 較寬鬆 | 較嚴格 — 部分主機會封鎖 IP 與寫實人像相似內容 |
| 開放權重 | 否(僅限 API) | 否 |
| GPTProto 價格 | 每次執行 0.225–1.35 美元(依解析度 × 時長) | 每次執行 0.4 美元 |
坦白說: Sora 2 的價格固定為每次 0.4 美元,並支援更長的影片片段(Pro 最長約 25 秒)— 當時長最重要時,應選擇它。Wan 2.5 的起始價格較低,每次執行 0.225 美元(480p/5 秒),並可在解析度與成本之間取捨,同時具備強大的多語言語音能力和較少的內容限制。兩者都能使用同一個 GPTProto 餘額。
相關內容:Sora 2 → · Wan 2.6 → · Wan 2.2 →
Wan 2.5 提示詞範例
Wan 2.5 會與影片一同生成音訊,因此優質提示詞應同時描述聲音與動作。平台本身的範例會將音訊放在Sound:提示中 — 請依循這種格式。結構如下:主體 + 動作 + 鏡頭移動 + 燈光 + Sound:提示 + 風格。直接貼上並調整即可。
1. 對話 + 唇形同步(展示音訊引擎)
黎明時分,一位年長的漁夫在木船上的中近景,柔和的金色光線,水面輕輕拍打。 他望向鏡頭,溫和地說:「大海總是信守承諾。」緩慢推近。Sound:柔和的海浪聲、遠處的海鷗、平靜的說話聲,無音樂。
2. 環境音/音效,無對話
夜晚霓虹燈照亮的東京小巷中下著雨,一隻貓迅速躲到遮雨棚下,濕漉漉的路面上反射光芒。靜態廣角鏡頭,電影感。Sound:持續的雨聲、遠處的交通聲,無音樂,無人聲。
3. 產品/行銷
大理石檯面上的冰咖啡特寫,水氣凝結成珠,晨光照進廚房。湯匙攪動冰塊。鏡頭以玻璃杯為中心緩慢旋轉 180 度。Sound:冰塊輕碰聲、安靜的廚房環境音、輕柔的背景音樂。
4. 動作/跟拍
夕陽下,一名滑板者滑過空曠的混凝土廣場,鏡頭從低角度在側面跟拍,帶有細微的鏡頭光暈。Sound:滑輪在路面上滾動的聲音、風的環境音,無對話。
提示:對話要足夠簡短,以配合影片片段長度(約每 5 秒一行台詞);明確說明鏡頭移動方式;如果只想要環境音,請註明「無音樂」;或者透過 audio 參數傳入自己的音軌。









