GPT Proto

GPTProto

  • 儀表板
  • LLM

    • claude
      Claude Opus 5新功能
    • google
      Gemini 3.6 Flash
    • google
      Gemini 3.5 Flash Lite
    • moonshotai
      Kimi K3
    • openai
      GPT 5.6 Luna

    影像

    • bytedance
      Dola Seedream 5.0 Pro 260628新功能
    • google
      Gemini 3.1 Flash Lite Image
    • google
      Gemini 3.1 Flash Image
    • openai
      GPT Image 2
    • google
      Gemini 3.1 Flash Image Preview

    影片

    • kling
      Kling v3.0 4k新功能
    • bytedance
      Dreamina Seedance 2.0 Mini 260615
    • kling
      Kling v3 Omni 4k
    • bytedance
      Dreamina Seedance 2.0 Fast 260128
    • bytedance
      Dreamina Seedance 2.0 260128
    探索 214+ 種模型 >
  • 生成器

    • 建立圖片
    • 建立影片
    • 在畫布中編輯

    功能

    • 動漫轉真人 AI新功能
    • 動漫 AI 藝術生成器
    • AI 物件移除器
    • AI 圖片編輯器
    • 無限制 AI 圖像生成器
    • AI 動作轉移
    • AI 衣物移除器
    • AI 浮水印移除工具
    • 線上 AI 圖片增強器
    • 線上背景移除工具
    探索全部 >

    提示詞

    • Seedance 2.0 提示詞新功能
    • GPT Image 2 提示詞
    • Nano Banana Pro 提示詞
    • Seedream 5.0 Pro 提示詞
  • AI 部落格

    • GLM 5.2 與 MiniMax M3:哪個更適合程式設計與前端工作?
    • 如何使用 API 建立自己的 AI 角色——無需撰寫程式碼
    • Kimi K3 與 Claude Opus 5:哪個更適合程式設計與 AI 代理?
    • 20 個免費 Seedream 5.0 Pro 產品與電子商務包裝設計提示詞
    • GLM-5.2 與 Kimi K3 程式設計比較:2026 年哪個更適合開發者?
    探索全部 >

    AI 洞察

    • 什麼是 Emochi AI?以及它為什麼成長得這麼快?(2026)
    • Kimi K3 是什麼?真的接近 GPT-5.6 與 Fable 5 嗎?
    • 2026 年 YouTube、TikTok、文字與圖片適用的 12 款最佳 AI 影片生成工具
    • 什麼是 Qwen 3.8 Max?發布日期、2.4T 預覽版、價格與早期基準測試
    • Gemini 3.6 Flash 與 Gemini 3.5 Flash-Lite 詳解:您應該使用哪一個?
    探索全部 >

    AI 文件

    • gpt-image-2
    • gpt-5.4
    • kimi-k2.5
    • claude-opus-4-6
    • kling-v3.0-pro
    探索全部 >

    AI 技能

    • browser-use
    • claude-to-im
    • competitive-ads-extractor
    • content-creator
    • data-storytelling
    探索全部 >
定價
English繁體中文한국어日本語EspañolРусский
立即開始
  1. 首頁
  2. /模型
  3. /Qwen
  4. /wan-2.5 / text-to-video
Qwen
wan-2.5 / text-to-video
說明文件
說明文件
Wan 2.5 文字轉影片可根據文字描述,建立最長 10 秒、解析度達 1080p 的電影感影片,呈現逼真的動態、光影與豐富的時間細節。它還能產生同步音訊,包括語音與環境音,非常適合用於說故事與行銷。在 GPTProto 上呼叫,只需使用一個餘額即可存取 200 多個模型,每次執行費用低至 $0.225。

$ 0.027
$ 0.03

text

video

$ 0.027
$ 0.03

text

video

Playground
JSON
API

輸入

Your browser does not support the video tag.
您的請求將花費$0每次執行,對於$100您大約可以執行此模型0次
相關模型
所有模型
Kling
Kling
kling-v3.0-4k
$ 1.008
$ 1.26
Bytedance
Bytedance
dreamina-seedance-2-0-mini-260615
$ 0.2365
Vidu
Vidu
viduq3-turbo
$ 0.032
$ 0.04
Qwen
Qwen
wan-2.6
$ 0.45
$ 0.5
Google
Google
veo-3.1-fast-generate-preview
$ 1.2
MiniMax
MiniMax
hailuo-2.3-pro
$ 0.441
$ 0.49
範例
Studio Ghibli anime style, a bustling ancient Chinese market, streets are crowded with people, vendors are shouting their wares, and children are chasing each other playfully. The background features traditional architecture and waving banners. The camera moves through the crowd in a first-person perspective. Sound: A cacophony of human voices, including vendor calls, customer haggling, and children's laughter. In the background, there are sounds of gongs, distant opera music, and the general din of footsteps and objects. The background music is a lively and festive traditional Chinese folk tune.
A handsome, muscular man with well-defined abs is catching his breath after an intense workout. Sweat drips down his torso. He is shirtless, wearing only black athletic shorts, and is leaning against gym equipment. The lighting comes from the upper side, highlighting the contours of his chest and arms. The scene is filled with a raw, masculine energy, hyper-realistic, high-contrast lighting.
A middle-aged man sitting at a wooden desk in a cozy study room, surrounded by bookshelves and a warm lamp glow. He opens an old book and reads aloud with a calm, deep voice: 'History teaches us more than just facts… it shows us who we are.' The room has subtle background sounds: pages turning, the faint ticking of a clock, and distant rain against the window.
A vibrant young woman in her early 20s runs toward the camera in Times Square at night, ecstatic and wide-eyed, shouting passionately into a black microphone. She wears a neon green windbreaker and black headphones around her neck. She yells: “Yo, Wan2.5 just dropped on WaveSpeedAI — sound and texture are next level, try it right now!” Wet reflective streets, glowing blue-white-magenta billboards, blurred pedestrians, dynamic handheld follow-shot, sharp face focus, shallow depth of field. 4K UHD, saturated colors, viral UGC style.

什麼是 Wan 2.5?

Wan 2.5 是阿里巴巴(通義/Wan 團隊)的影片生成模型,於 2025 年 9 月發布。它能將文字提示詞 — 或靜態圖片 — 轉換為最長 10 秒、最高 1080p(24fps)的影片片段,並在同一次生成中產生音訊:包括具備唇形同步的對話、環境音效和音樂。這種一次生成的視聽輸出,正是它有別於早期 Wan 版本及大多數僅產生無聲影片的開放影片模型之處。

Wan 2.5 以僅限 API 的預覽版形式提供 — 其權重無法公開下載。(Wan 2.1 和 2.2 是採用 Apache-2.0 授權、可自行託管的開放權重版本;2.5 和 2.6 則僅限 API。)在 GPTProto 上,你可以使用模型字串 wan-2.5 呼叫它,依解析度和時長按每次生成計費,並與其他 200 多個模型共用同一個餘額。

規格 值
提供者 阿里巴巴(通義/Wan)
模態 文字轉影片(本頁)、圖片轉影片
音訊 原生同步 — 語音 + 唇形同步 + 音效 + 音樂,一次生成
解析度 480p / 720p / 1080p(24fps)
最長時長 約 10 秒
語言 多語言(中文能力強)
權重 僅限 API 的預覽版(非開源)
模型字串 wan-2.5
端點 https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video

使用 Wan 2.5 API 可以建立什麼

短影音社群內容與廣告 — 具備內建旁白和音效的 5–10 秒直式或橫式影片片段,不需要另外編輯音訊。每次 720p/5 秒執行僅需 0.45 美元,測試十幾種廣告版本的 A/B 測試仍然相當便宜。

大規模本地化影片 — Wan 2.5 能處理多語言提示詞並產生具備唇形同步的語音,因此同一份分鏡腳本可以轉成多種語言版本,不必重新拍攝或配音。中文支援能力強。

說故事與解說影片 — 對話、環境音和音樂一同生成,能讓整段影片中的旁白與畫面保持同步 — 適合用於 YouTube 開場、產品解說和培訓片段。

讓靜態圖片動起來 — 將單張圖片作為第一幀,再搭配動作提示詞為其添加動畫。

 

Wan 2.5 如何同時生成影片與音訊

大多數影片模型輸出的是無聲畫面,音效則是之後另外加入的工作。Wan 2.5 的設計理念正好相反。它的生成步驟會共同產生視覺畫面和相匹配的音軌,因此語音會對準正確的嘴唇動作,腳步聲會與步伐同步,音樂也能在剪輯下方自然襯托,而不需要你進行任何編輯。實際上,這將「影片模型 + TTS/擬音」的雙工具流程整合成一次 API 呼叫。

這會帶來兩個結果。第一,你的提示詞應該同時描述 聲音與動作 — 說明對話內容、環境音,以及是否需要音樂(請參閱第 6 節)。第二,由於音訊和影片來自同一次生成,一次執行就是一個計費單位;你不需要支付兩次費用,也不必拼接音軌。如果你想改用自己的音樂或旁白,audio 參數可以接受自訂音訊,模型會讓動作與其同步。

 

如何在 Wan 系列中選擇

GPTProto 在同一個餘額中提供多個 Wan 模型。請根據工作需求選擇,而不是只看版本號:

  • Wan 2.5 — 文字轉影片(本頁):最高 1080p、最長 10 秒、原生音訊。適合需要帶有聲音的提示詞轉影片片段,為預設選項。
  • Wan 2.5 — 圖片轉影片:從靜態圖片作為第一幀開始,為其添加動畫(即「wan 2.5 animate」使用情境)。 
  • Wan 2.2 (wan-2.2-plus):無聲、720p、約 5 秒 — 但它採用開放權重,因此當你必須自行託管時,應選擇它。
  • Wan 2.6 (wan-2.6):1080p、最長 15 秒,此外還支援多鏡頭場景規劃和基於參考圖的身分維持 — 當你需要更長或多段剪輯的敘事時,升級選用它。

這正是競爭對手常常省略的比較資訊:他們只列出模型,卻不告訴你該選哪一個。單鏡頭且需要音訊的影片片段使用 2.5,需要權重時使用 2.2,需要更長時長和多鏡頭時使用 2.6。

 

Wan 2.5 與 Sora 2

兩者都能從文字或圖片生成帶有同步音訊的影片。實際上的差異如下:

  Wan 2.5 Sora 2
音訊 原生同步(語音/音效/音樂) 原生同步
解析度 最高 1080p 最高 1080p
最長時長 約 10 秒 更長 — Pro 最高約 25 秒
語言 多語言,中文能力強 多語言
內容/IP 規則 較寬鬆 較嚴格 — 部分主機會封鎖 IP 與寫實人像相似內容
開放權重 否(僅限 API) 否
GPTProto 價格 每次執行 0.225–1.35 美元(依解析度 × 時長) 每次執行 0.4 美元

坦白說: Sora 2 的價格固定為每次 0.4 美元,並支援更長的影片片段(Pro 最長約 25 秒)— 當時長最重要時,應選擇它。Wan 2.5 的起始價格較低,每次執行 0.225 美元(480p/5 秒),並可在解析度與成本之間取捨,同時具備強大的多語言語音能力和較少的內容限制。兩者都能使用同一個 GPTProto 餘額。

相關內容:Sora 2 → · Wan 2.6 → · Wan 2.2 →

Wan 2.5 提示詞範例

Wan 2.5 會與影片一同生成音訊,因此優質提示詞應同時描述聲音與動作。平台本身的範例會將音訊放在Sound:提示中 — 請依循這種格式。結構如下:主體 + 動作 + 鏡頭移動 + 燈光 + Sound:提示 + 風格。直接貼上並調整即可。

1. 對話 + 唇形同步(展示音訊引擎)

黎明時分,一位年長的漁夫在木船上的中近景,柔和的金色光線,水面輕輕拍打。 他望向鏡頭,溫和地說:「大海總是信守承諾。」緩慢推近。Sound:柔和的海浪聲、遠處的海鷗、平靜的說話聲,無音樂。

2. 環境音/音效,無對話

夜晚霓虹燈照亮的東京小巷中下著雨,一隻貓迅速躲到遮雨棚下,濕漉漉的路面上反射光芒。靜態廣角鏡頭,電影感。Sound:持續的雨聲、遠處的交通聲,無音樂,無人聲。

3. 產品/行銷

大理石檯面上的冰咖啡特寫,水氣凝結成珠,晨光照進廚房。湯匙攪動冰塊。鏡頭以玻璃杯為中心緩慢旋轉 180 度。Sound:冰塊輕碰聲、安靜的廚房環境音、輕柔的背景音樂。

4. 動作/跟拍

夕陽下,一名滑板者滑過空曠的混凝土廣場,鏡頭從低角度在側面跟拍,帶有細微的鏡頭光暈。Sound:滑輪在路面上滾動的聲音、風的環境音,無對話。

提示:對話要足夠簡短,以配合影片片段長度(約每 5 秒一行台詞);明確說明鏡頭移動方式;如果只想要環境音,請註明「無音樂」;或者透過 audio 參數傳入自己的音軌。

如何取得 wan-2.5 API 金鑰

取得 wan-2.5 API 金鑰只需四個步驟,僅需幾分鐘。建立免費的 GPTProto 帳號、儲值、產生金鑰,並進行第一次呼叫 — 在 $0.027 這裡能以比直連更划算的價格取得 wan-2.5 API 金鑰,且單一金鑰即可在平台上所有模型通用。完整 wan-2.5 說明文件 請參閱說明文件。

註冊

註冊

建立您的免費 GPT Proto 帳號即可開始。您可以隨時為您的團隊設定組織。

儲值

儲值

您的餘額可用於平台上的所有模型,包括 wan-2.5,讓您能靈活地進行實驗並隨需求擴充。

產生您的 API 金鑰

產生您的 API 金鑰

在您的儀表板中建立 API 金鑰 — 進行 wan-2.5 請求時,您將需要它來進行驗證。

進行第一次 API 呼叫

進行第一次 API 呼叫

使用您的 API 金鑰搭配我們的範例程式碼,透過 GPT Proto 向 wan-2.5 發送請求,並立即查看 AI 生成的結果。

取得 API 金鑰

wan-2.5/text-to-video 常見問題

關於 wan-2.5/text-to-video 模型功能、使用方式與效能的常見開發者問題與解答。

什麼是 wan-2.5/text-to-video?

阿里巴巴的影片模型,可將文字提示轉換為最長 10 秒、最高 1080p 的影片片段,並在同一輪生成同步音訊(語音、音效、音樂)。

Wan 2.5 是開源的嗎?

不是。Wan 2.5 以僅限 API 的預覽版形式發布,其權重無法公開下載。Wan 2.1 和 2.2 是採用開放權重(Apache-2.0)的版本,可自行託管;2.5 和 2.6 則僅限 API 使用。

Wan 2.5 與 Wan 2.2 有何不同?

Wan 2.5 新增原生同步音訊,將標準解析度提升至 1080p(2.2 最高為 720p),並將影片片段延長至約 10 秒(2.2 約為 5 秒)。如果你需要開放權重進行本機部署,Wan 2.2 仍是較適合的選擇。

Wan 2.5 與 Sora 2 相比如何?

兩者都能生成帶有同步音訊的影片。Sora 2(每次執行 $0.4)支援更長的影片片段(Pro 最高約 25 秒),但內容與智慧財產權限制較為嚴格;Wan 2.5 起價為每次執行 $0.225,支援多語言,並使用同一個餘額。

Wan 2.5 會生成音訊嗎?

可以 — 語音與唇形同步、音效和音樂會在同一輪中與影片一併生成。你也可以透過 audio 參數提供自己的音軌,或在提示中使用 Sound: 提示來內嵌描述聲音。

我可以使用 Wan 2.5 將靜態圖像製作成動畫嗎?

可以,透過圖像轉影片功能:提供一張圖像作為第一幀,再加上動態提示。

Wan 2.5 是否未經審查/允許 NSFW 內容?

wan-2.5/text-to-video 擅長創意呈現的忠實度與輸出一致性。其多模態理解能力可生成精緻的影片細節、準確地講述故事,並實現流暢的轉場。輸出品質適合專業用途,支援多種視覺風格與敘事技巧。

在 GPTProto 上使用 Wan 2.5 API 的費用是多少?

每次執行費用介於 $0.225(480p/5 秒)至 $1.35(1080p/10 秒)之間 — 請參閱上方的價格矩陣。費用按每次生成計算,並從單一餘額中扣除。

如何透過 API 呼叫 Wan 2.5?

向 https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video 發送 POST 請求,附上你的提示與設定,然後輪詢 /api/v3/predictions/{id}/result 以取得完成的影片。請參閱上方的快速入門指南。

wan-2.5/text-to-video 是否支援圖像或音訊等多模態輸入?

wan-2.5/text-to-video 為強大的文字轉影片轉換而設計,並可能支援特定的多模態輸入擴充功能。核心工作流程依賴文字輸入,但進階開發者可根據持續更新的官方文件,探索圖像或音訊提示。

使用 wan-2.5/text-to-video 生成內容時是否有著作權風險?

wan-2.5/text-to-video 會根據使用者提示生成原創影片。若你提供獨特想法,一般使用情況不會帶來著作權風險。不過,商業使用者應避免使用直接仿製知名受保護作品的提示。在公開發布前,請務必查閱當地著作權法規。

更多相關 GPTProto AI 工具

Wan AI 影片生成器

Wan AI 影片生成器

使用 Wan AI 將簡單的文字提示轉化為充滿動感的故事。幾秒內即可體驗流暢的唇形同步、同步音訊與逼真的鏡頭運動。

InVideo AI

InVideo AI

使用我們先進的 InVideo AI 製作工具,立即將文字轉化為令人驚豔的視覺效果。

Picsart AI 影片生成器

使用先進的 AI 生成器將您的創意轉化為熱門內容,讓您的 Picsart 工作流程更上一層樓。存取高級模型,實現流暢動畫效果。

圖片轉影片 AI

使用我們尖端的圖片轉影片 AI,將靜態媒體轉化為動態序列。立即打造您自己的線上照片轉影片製作器 API。

相關文章

更多部落格
Wan 2.5:4K AI 影片生成的未來

Wan 2.5:4K AI 影片生成的未來

探索 Wan 2.5 如何運用 AI 將圖片轉換為 4K 電影級影片。了解功能、定價與 GPT Proto API 選項。

2025 年最佳 AI 影片生成模型:排名前 5 名

2025 年最佳 AI 影片生成模型:排名前 5 名

探索 2025 年頂尖的 AI 影片生成模型。透過我們的指南比較定價、探索免費 API,並找出最適合您需求的 AI 影片生成器。

wan2.2-animate:AI 領域中品質勝過速度

wan2.2-animate:AI 領域中品質勝過速度

當其他模型急於產出結果時,wan2.2-animate 專注於電影級視覺保真度與提示詞遵循度。立即了解如何最佳化您的影片工作流程。

Wan 2.2 Animate:真實的圖片轉影片

Wan 2.2 Animate:真實的圖片轉影片

別再為 AI 影片閃爍問題而苦惱。了解如何設定 wan 2.2 animate,以實現精確的角色一致性與流暢動態。閱讀完整指南。

GPT Proto

以全球規模與穩定性,賦能 AI 創新:

透過我們的旗艦產品 GPT Proto,我們提供統一的介面,讓您能存取並整合全球頂尖 AI 供應商的 API,涵蓋文字、視覺、語音等領域。我們協助開發者與企業簡化整合流程,並無限制地加速創新。

全球基礎設施,在地合規:

To ensure enterprise-grade reliability and compliance, Talent Tech Global Limited operates specifically as our global Billing and Contracting Entity. Meanwhile, our core technical infrastructure and R&D teams are strategically distributed across global innovation hubs, including Silicon Valley, Singapore, and Hong Kong.

為擴展而生:

我們深知穩定性至關重要。我們的平台建立在強大的去中心化架構之上,支援動態自動擴展。無論您是進行試點專案還是處理數百萬次併發請求,我們的系統都能即時擴展以滿足需求,確保您的業務永遠不會受限於基礎設施。

導覽

  • 儀表板
  • 模型
  • 建立圖片
  • AI 圖片放大
  • AI 背景移除
  • 建立影片
  • 在畫布中編輯
  • 功能
  • 定價
  • AI 文件
  • AI 部落格
  • AI 洞察
  • AI 技能

功能

  • 動漫轉真人 AI
  • 動漫 AI 藝術生成器
  • AI 物件移除器
  • AI 圖片編輯器
  • 無限制 AI 圖像生成器
  • AI 動作轉移
  • AI 衣物移除器
  • AI 浮水印移除工具
  • 線上 AI 圖片增強器
  • 線上背景移除工具
  • AI 臉部交換圖片
  • AI 護照照片製作器
  • MS Paint AI 生成器
Explore all features >

LLM

  • Claude Opus 5
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • Kimi K3
  • GPT 5.6 Luna
  • GPT 5.6 Terra
  • GPT 5.6 Sol
  • Grok 4.5
  • Claude Sonnet 5
  • Minimax M3
  • GLM 5.2
  • GPT 5.1 Chat Latest
  • Claude Fable 5
  • Qwen3.7 Max
  • Claude Opus 4.8 Thinking
  • Claude Opus 4.8
  • Gemini 3.5 Flash
  • DeepSeek v4 Flash
  • DeepSeek v4 Pro
  • Grok 4.3
探索所有模型 >

影像

  • Dola Seedream 5.0 Pro 260628
  • Gemini 3.1 Flash Lite Image
  • Gemini 3.1 Flash Image
  • GPT Image 2
  • Gemini 3.1 Flash Image Preview
  • Seedream 5.0 260128
  • Doubao Seedream 5.0 260128
  • Vidu Q2
  • Grok Imagine Image
  • Kling Image O1
  • GPT Image 1.5
  • Seedream 4.5 251128
  • Doubao Seedream 4.5 251128
  • Grok Imagine 0.9
  • Gemini 3 Pro Image Preview
  • Qwen Image Lora
  • Qwen Image Plus Lora
  • Qwen Image Plus
  • Grok 4 Image
  • GPT Image 1 Mini
探索所有模型 >

影片

  • Kling v3.0 4k
  • Dreamina Seedance 2.0 Mini 260615
  • Kling v3 Omni 4k
  • Dreamina Seedance 2.0 Fast 260128
  • Dreamina Seedance 2.0 260128
  • Vidu 2.0
  • Doubao Seedance 2.0 260128
  • Doubao Seedance 2.0 Fast 260128
  • Kling v3 Omni Pro
  • Kling v3 Omni Std
  • Vidu Q3 Turbo
  • Kling v3.0 Pro
  • Kling v3.0 Std
  • Vidu Q3 Pro
  • Kling v2.6 Std
  • Vidu Q2 Pro
  • Vidu Q2 Turbo
  • Vidu Q2 Pro Fast
  • Vidu Q2
  • Kling Video O1 Pro
探索所有模型 >

© 2026 Talent Tech Global Limited (Hong Kong) / Talent Tech Global LLC (US). 保留所有權利。

  • 關於我們
  • 隱私權政策
  • 服務條款
  • 網站地圖