GPT Proto

GPTProto

  • ダッシュボード
  • LLM

    • claude
      Claude Opus 5新機能
    • google
      Gemini 3.6 Flash
    • google
      Gemini 3.5 Flash Lite
    • moonshotai
      Kimi K3
    • openai
      GPT 5.6 Luna

    画像

    • bytedance
      Dola Seedream 5.0 Pro 260628新機能
    • google
      Gemini 3.1 Flash Lite Image
    • google
      Gemini 3.1 Flash Image
    • openai
      GPT Image 2
    • google
      Gemini 3.1 Flash Image Preview

    動画

    • kling
      Kling v3.0 4k新機能
    • bytedance
      Dreamina Seedance 2.0 Mini 260615
    • kling
      Kling v3 Omni 4k
    • bytedance
      Dreamina Seedance 2.0 Fast 260128
    • bytedance
      Dreamina Seedance 2.0 260128
    214+ 種類のモデルを見る >
  • ジェネレーター

    • 画像生成
    • 動画生成
    • キャンバスで編集

    機能

    • アニメをリアルな人物に変換するAI新機能
    • アニメAIアートジェネレーター
    • AIオブジェクト除去
    • AI画像エディター
    • 制限なしAI画像生成
    • AIモーション転送
    • AI Clothes Remover
    • AIウォーターマーク除去
    • オンラインAI画像高画質化ツール
    • オンライン背景削除ツール
    すべて表示 >

    プロンプト

    • Seedance 2.0 プロンプト新機能
    • GPT Image 2 プロンプト
    • Nano Banana Pro プロンプト
    • Seedream 5.0 Pro プロンプト
  • AIブログ

    • GLM 5.2とMiniMax M3:コーディングとフロントエンド作業に優れているのはどちら?
    • APIで自分だけのAIキャラクターを作る方法——コーディング不要
    • Kimi K3とClaude Opus 5:コーディングとAIエージェントに適しているのはどちら?
    • 製品とEコマース向けの無料Seedream 5.0 Proパッケージデザインプロンプト20選
    • コーディングにおけるGLM-5.2 vs Kimi K3:2026年、開発者にとって優れているのはどちら?
    すべて表示 >

    AIインサイト

    • Emochi AIとは?なぜこれほど急成長しているのか(2026年)
    • Kimi K3とは?GPT-5.6やFable 5に本当に近いのか?
    • 2026年版:YouTube・TikTok・テキスト・画像に最適なAI動画生成ツール12選
    • Qwen 3.8 Maxとは?リリース日、2.4Tプレビュー、料金、初期ベンチマーク
    • Gemini 3.6 FlashとGemini 3.5 Flash-Liteを解説:どちらを使うべき?
    すべて表示 >

    AIドキュメント

    • gpt-image-2
    • gpt-5.4
    • kimi-k2.5
    • claude-opus-4-6
    • kling-v3.0-pro
    すべて表示 >

    AIスキル

    • browser-use
    • claude-to-im
    • competitive-ads-extractor
    • content-creator
    • data-storytelling
    すべて表示 >
料金プラン
English繁體中文한국어日本語EspañolРусский
今すぐ始める
  1. ホーム
  2. /モデル
  3. /Qwen
  4. /wan-2.5 / text-to-video
Qwen
wan-2.5 / text-to-video
ドキュメント
ドキュメント
Wan 2.5 Text to Video は、テキストによる説明から、リアルな動きやライティング、豊かな時間的ディテールを備えた、最大10秒・1080pの映画のような動画を生成します。ストーリーテリングやマーケティングに最適な、音声や環境音を含む同期音声も生成できます。GPTProtoでは、200以上のモデルで共通の残高を使って、1回あたり$0.225から利用できます。

$ 0.027
$ 0.03

text

video

$ 0.027
$ 0.03

text

video

Playground
JSON
API

入力

Your browser does not support the video tag.
このリクエストのコスト:$0(1回あたり)$100このモデルの実行可能回数(目安):0回
関連モデル
すべてのモデル
Kling
Kling
kling-v3.0-4k
$ 1.008
$ 1.26
Bytedance
Bytedance
dreamina-seedance-2-0-mini-260615
$ 0.2365
Vidu
Vidu
viduq3-turbo
$ 0.032
$ 0.04
Qwen
Qwen
wan-2.6
$ 0.45
$ 0.5
Google
Google
veo-3.1-fast-generate-preview
$ 1.2
MiniMax
MiniMax
hailuo-2.3-pro
$ 0.441
$ 0.49
例
Studio Ghibli anime style, a bustling ancient Chinese market, streets are crowded with people, vendors are shouting their wares, and children are chasing each other playfully. The background features traditional architecture and waving banners. The camera moves through the crowd in a first-person perspective. Sound: A cacophony of human voices, including vendor calls, customer haggling, and children's laughter. In the background, there are sounds of gongs, distant opera music, and the general din of footsteps and objects. The background music is a lively and festive traditional Chinese folk tune.
A handsome, muscular man with well-defined abs is catching his breath after an intense workout. Sweat drips down his torso. He is shirtless, wearing only black athletic shorts, and is leaning against gym equipment. The lighting comes from the upper side, highlighting the contours of his chest and arms. The scene is filled with a raw, masculine energy, hyper-realistic, high-contrast lighting.
A middle-aged man sitting at a wooden desk in a cozy study room, surrounded by bookshelves and a warm lamp glow. He opens an old book and reads aloud with a calm, deep voice: 'History teaches us more than just facts… it shows us who we are.' The room has subtle background sounds: pages turning, the faint ticking of a clock, and distant rain against the window.
A vibrant young woman in her early 20s runs toward the camera in Times Square at night, ecstatic and wide-eyed, shouting passionately into a black microphone. She wears a neon green windbreaker and black headphones around her neck. She yells: “Yo, Wan2.5 just dropped on WaveSpeedAI — sound and texture are next level, try it right now!” Wet reflective streets, glowing blue-white-magenta billboards, blurred pedestrians, dynamic handheld follow-shot, sharp face focus, shallow depth of field. 4K UHD, saturated colors, viral UGC style.

Wan 2.5とは?

Wan 2.5は、2025年9月にリリースされたAlibaba(Tongyi / Wanチーム)の動画生成モデルです。テキストプロンプト、または静止画から、最大10秒、最大1080p(24fps)の動画クリップを生成し、同じ処理で音声も生成します。音声には、リップシンク付きの会話、環境音、音楽が含まれます。この一括音声・映像出力こそが、従来のWanシリーズや、無音の動画しか生成しない多くのオープン動画モデルとの違いです。

Wan 2.5はAPI専用のプレビュー版として提供されており、重みは一般公開されていません。(Wan 2.1と2.2は、セルフホスト可能なオープンウェイト版、Apache-2.0ライセンス版です。2.5と2.6はAPI専用です。)GPTProtoでは、モデル文字列 wan-2.5を指定して呼び出します。料金は解像度と長さに応じて生成ごとに課金され、200以上の他のモデルと同じ残高を利用できます。

仕様 値
プロバイダー Alibaba(Tongyi / Wan)
モダリティ テキストから動画(このページ)、画像から動画
音声 ネイティブ同期 — 音声 + リップシンク + 効果音 + 音楽を一括生成
解像度 480p / 720p / 1080p(24fps)
最大長 約10秒
言語 多言語(中国語に強い)
重み API専用プレビュー(オープンソースではない)
モデル文字列 wan-2.5
エンドポイント https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video

Wan 2.5 APIで作成できるもの

短編ソーシャル動画・広告 — 音声編集を別途行わず、ボイスオーバーとサウンドを内蔵した5~10秒の縦型または横型クリップを作成できます。720p/5秒の実行1回あたり0.45ドルなので、広告バリエーションを12種類A/Bテストしても低コストに収まります。

大規模なローカライズ動画 — Wan 2.5は多言語プロンプトに対応し、リップシンク付きの音声を生成します。そのため、撮り直しや再吹き替えなしで、1つの絵コンテから複数言語版を作成できます。中国語に強く対応しています。

ストーリーテリングと解説動画 — 会話、環境音、音楽をまとめて生成するため、クリップ全体でナレーションと映像の同期を保てます。YouTubeのイントロ、製品解説、研修用セグメントなどに便利です。

静止画のアニメーション化 — 1枚の画像を最初のフレームとして入力し、動きのプロンプトでアニメーション化できます。

 

Wan 2.5が動画と音声を同時に生成する仕組み

ほとんどの動画モデルは無音のフレームを出力し、音声は後から別途追加します。Wan 2.5は逆の考え方で設計されています。生成処理では映像フレームと、それに対応する音声トラックを同時に生成するため、音声は正しい口の動きに合い、足音は歩みに一致し、音楽も編集なしでカットの下に自然に配置されます。実際には、2つのツール(動画モデル + TTS/フォーリー)を使う工程が、1回のAPI呼び出しに集約されます。

ここから2つの点が導かれます。まず、プロンプトでは動きだけでなく 音声も説明してください。会話のセリフ、環境音のベース、音楽を入れるかどうかを指定します(§6を参照)。次に、音声と動画は1回の処理で生成されるため、1回の実行が1つの課金単位になります。二重に支払ったり、トラックをつなぎ合わせたりする必要はありません。代わりに自分の音楽やボイスオーバーを使用したい場合は、audioパラメーターで指定でき、モデルがそれに合わせて動きを同期します。

 

Wanファミリー内での選び方

GPTProtoでは、複数のWanモデルを1つの残高で利用できます。バージョン番号ではなく、用途に応じて選びましょう。

  • Wan 2.5 — テキストから動画(このページ): 1080p、最大10秒、ネイティブ音声。音声付きのプロンプトからクリップを作る場合の標準モデルです。
  • Wan 2.5 — 画像から動画:静止画を最初のフレームとして開始し、アニメーション化します(「wan 2.5 animate」のケース)。 
  • Wan 2.2 (wan-2.2-plus):無音、720p、約5秒ですが、オープンウェイトなので、セルフホストが必須の場合に適しています。
  • Wan 2.6 (wan-2.6):1080p、最大15秒に対応し、複数ショットのシーン設計と参照ベースの人物同一性保持も可能です。より長い、または複数カットのストーリーが必要な場合に選びます。

この比較表のような情報は、競合サービスが省きがちなものです。競合はモデルを列挙するだけで、どれを選ぶべきか説明しません。音声付きのワンショットクリップには2.5、重みが必要なら2.2、長さや複数ショットが必要なら2.6を使いましょう。

 

Wan 2.5とSora 2の比較

どちらも、テキストまたは画像から同期音声付きの動画を生成します。実用上の違いは次のとおりです。

  Wan 2.5 Sora 2
音声 ネイティブ同期(音声 / 効果音 / 音楽) ネイティブ同期
解像度 最大1080p 最大1080p
最大長 約10秒 より長く — 最大約25秒(Pro)
言語 多言語、中国語に強い 多言語
コンテンツ / IPルール より緩やか より厳格 — 一部のホストではIPや写実的な人物 likeness をブロック
オープンウェイト いいえ(API専用) いいえ
GPTProtoの料金 1回あたり0.225~1.35ドル(解像度 × 長さ) 1回あたり0.4ドル

率直に言うと:Sora 2は1回あたり一律0.4ドルで、より長いクリップ(Proでは最大約25秒)に対応しています。長さを重視する場合はこちらを選びましょう。Wan 2.5は1回あたり0.225ドル(480p/5秒)から利用でき、解像度とコストを交換できるうえ、多言語音声に強く、コンテンツ制限も少なめです。どちらも1つのGPTProto残高で利用できます。

関連:Sora 2 → · Wan 2.6 → · Wan 2.2 →

Wan 2.5のプロンプト例

Wan 2.5は動画と一緒に音声も生成するため、良いプロンプトでは動きだけでなく音声も説明します。プラットフォームの例では、Sound:というキューで音声をプロンプト内に記述しています。この形式に従いましょう。構成は、被写体 + アクション + カメラワーク + ライティング + Sound:キュー + スタイルです。コピーして調整してください。

1. 会話 + リップシンク(音声エンジンを確認)

夜明けの木造ボートに乗る高齢の漁師をミディアムクローズアップで撮影。柔らかな金色の光、穏やかに水が打ち寄せる。彼はカメラに目を向け、温かく「海はいつも約束を守る」と言う。ゆっくりとプッシュイン。Sound: 穏やかな波、遠くのカモメ、落ち着いた話し声、音楽なし。

2. 環境音 / 効果音、会話なし

夜のネオンに照らされた東京の路地に雨が降っている。猫が軒下へ駆け込み、濡れた路面に反射がきらめく。静的なワイドショット、シネマティック。Sound: 絶え間ない雨、遠くの交通音、音楽なし、話し声なし。

3. 製品 / マーケティング

大理石のカウンターに置かれたアイスコーヒーをクローズアップ。水滴が浮かび、朝のキッチンの光が差し込む。スプーンが氷をかき混ぜる。グラスの周囲をゆっくり180度オービット。Sound: 氷が軽く触れ合う音、静かなキッチンの環境音、控えめなBGM。

4. 動き / トラッキング

夕暮れの誰もいないコンクリート広場をスケートボーダーが滑る。横から並走するローアングルのトラッキングショット、控えめなレンズフレア。Sound: 路面を転がる車輪の音、風の環境音、会話なし。

ヒント:クリップの長さに収まるよう、会話は短くしてください(5秒あたり1行程度)。カメラワークは具体的に指定し、環境音だけが必要なら「音楽なし」と明記します。自分のトラックをaudioパラメーター経由で渡すこともできます。

wan-2.5 APIキーの取得方法

wan-2.5 APIキーの取得は、4つのステップで数分で完了します。GPTProtoの無料アカウントを作成し、クレジットを追加してキーを生成し、最初のAPIコールを行ってください。$0.027 GPTProto経由であれば、直接契約するよりも安価にwan-2.5 APIキーを利用でき、1つのキーでプラットフォーム上のすべてのモデルにアクセス可能です。詳細はwan-2.5 ドキュメントをご覧ください。

サインアップ

サインアップ

無料のGPT Protoアカウントを作成して開始しましょう。チーム用の組織はいつでも設定可能です。

チャージ

チャージ

残高はwan-2.5を含むプラットフォーム上の全モデルで利用可能です。必要に応じて柔軟に実験やスケールアップを行えます。

APIキーを生成

APIキーを生成

ダッシュボードでAPIキーを作成してください。wan-2.5へのリクエスト時に認証用として必要になります。

最初のAPIコールを実行

最初のAPIコールを実行

サンプルコードでAPIキーを使用し、GPT Proto経由でwan-2.5にリクエストを送信して、AIによる結果をすぐに確認しましょう。

APIキーを取得

wan-2.5/text-to-video FAQ

wan-2.5/text-to-videoモデルの機能、利用方法、性能に関する開発者向けのよくある質問と回答です。

wan-2.5/text-to-videoとは何ですか?

テキストプロンプトを最大10秒、最大1080pの動画クリップに変換するAlibabaの動画モデルです。音声、効果音、音楽などの同期音声も同じ処理で生成されます。

Wan 2.5はオープンソースですか?

いいえ。Wan 2.5はAPI専用のプレビューとして提供されており、重みは一般公開されていません。Wan 2.1と2.2はセルフホスティング可能なオープンウェイト(Apache-2.0)版で、2.5と2.6はAPI専用です。

Wan 2.5とWan 2.2の違いは何ですか?

Wan 2.5では、同期音声のネイティブ対応、標準解像度の1080pへの引き上げ(2.2は最大720p)、クリップ長の約10秒への延長(2.2は約5秒)が行われました。ローカルデプロイ用にオープンウェイトが必要な場合は、Wan 2.2が適しています。

Wan 2.5とSora 2の違いは何ですか?

どちらも同期音声付きの動画を生成します。Sora 2($0.4/回)はより長いクリップ(Proでは最大約25秒)に対応していますが、コンテンツおよび知的財産に関する制限がより厳しくなっています。Wan 2.5は$0.225/回から利用でき、多言語に対応し、同じ残高で実行できます。

Wan 2.5は音声を生成できますか?

はい。リップシンク付きの音声、効果音、音楽を動画と一緒に1回の処理で生成できます。audioパラメータを使って独自の音声トラックを指定することも、プロンプト内でSound:キューを使って音声を記述することもできます。

Wan 2.5で静止画をアニメーション化できますか?

はい、image-to-videoで可能です。画像を最初のフレームとして指定し、動きのプロンプトを入力してください。

Wan 2.5は検閲されていませんか?NSFWを許可していますか?

wan-2.5/text-to-videoは、クリエイティブな忠実度と出力の一貫性に優れています。マルチモーダル理解により、洗練された動画の細部、正確なストーリーテリング、滑らかなトランジションを実現できます。さまざまなビジュアルスタイルやストーリーテリング手法に対応し、出力品質はプロフェッショナルな用途に適しています。

GPTProtoでWan 2.5 APIを利用する料金はいくらですか?

1回あたり$0.225(480p/5秒)から$1.35(1080p/10秒)までです。上記の料金マトリックスをご覧ください。料金は1つの残高から生成ごとに請求されます。

API経由でWan 2.5を呼び出すにはどうすればよいですか?

Submit a POST to https://gptproto.com/api/v3/alibaba/wan-2.5/text-to-video with your prompt and settings, then poll /api/v3/predictions/{id}/result for the finished video. See the Quick Start above.

wan-2.5/text-to-videoは画像や音声などのマルチモーダル入力に対応していますか?

wan-2.5/text-to-videoは、強力なテキストから動画への変換を目的として設計されており、特定のマルチモーダル入力拡張に対応する場合があります。基本的なワークフローはテキスト入力に基づいていますが、公式ドキュメントの更新に応じて、開発者は画像や音声のプロンプトを試すこともできます。

wan-2.5/text-to-videoで生成したコンテンツには著作権上のリスクがありますか?

wan-2.5/text-to-videoは、ユーザーのプロンプトに基づいてオリジナルの動画を生成します。独自のアイデアを入力する限り、通常の利用で著作権上のリスクが生じることはありません。ただし、商用ユーザーは、著名な保護対象作品を直接再現するプロンプトを避けるべきです。公開配布する前に、必ず現地の著作権法を確認してください。

関連するGPTProto AIツール

Wan AI動画ジェネレーター

Wan AI動画ジェネレーター

Wan AIを使って、シンプルなテキストプロンプトを躍動感のある動くストーリーに変換できます。シームレスなリップシンク、同期された音声、リアルなカメラモーションを数秒で体験しましょう。

InVideo AI

InVideo AI

高度なinvideo AIメーカーを使って、テキストを瞬時に美しいビジュアルへ変換できます。

Picsart AI動画ジェネレーター

Picsartのワークフローを次のレベルへ引き上げる高度なAIジェネレーターで、アイデアをバイラルコンテンツに変換できます。シームレスなアニメーションを実現するプレミアムモデルにアクセスしましょう。

画像から動画AI

最先端の画像から動画AIを使って、静止画メディアをダイナミックなシーケンスに変換できます。今すぐオンラインの画像から動画を作成する独自のAPIを構築しましょう。

関連記事

他のブログを見る
Wan 2.5:4K AI動画生成の未来

Wan 2.5:4K AI動画生成の未来

Wan 2.5がAIで画像を4Kのシネマティック動画に変換する仕組みをご紹介します。機能、料金、GPTProto APIのオプションについて学びましょう。

2025年の最高のAI動画生成モデル:トップ5ランキング

2025年の最高のAI動画生成モデル:トップ5ランキング

2025年に注目されるAI動画生成モデルをご紹介します。料金を比較し、無料APIを探し、ガイドを参考にニーズに最適なAI動画生成ツールを見つけましょう。

wan2.2-animate:AIにおいて速度より品質を重視

wan2.2-animate:AIにおいて速度より品質を重視

他のモデルが出力を急ぐ一方で、wan2.2-animateはシネマティックな映像の忠実度とプロンプトへの忠実性を重視しています。今すぐ動画ワークフローを最適化する方法を学びましょう。

Wan 2.2 Animate:リアルな画像から動画への変換

Wan 2.2 Animate:リアルな画像から動画への変換

AI動画のちらつきに悩むのはもう終わりです。正確なキャラクターの一貫性と滑らかな動きを実現するためのwan 2.2 animateの設定方法を学びましょう。詳しいガイドをお読みください。

GPT Proto

グローバルな規模と安定性でAIイノベーションを推進:

主力製品であるGPT Protoを通じて、テキスト、ビジョン、音声など、世界をリードするAIプロバイダーのAPIにアクセスし、統合するための統一インターフェースを提供します。開発者や企業が統合を簡素化し、制限なくイノベーションを加速できるよう支援します。

グローバルなインフラストラクチャ、ローカルなコンプライアンス:

To ensure enterprise-grade reliability and compliance, Talent Tech Global Limited operates specifically as our global Billing and Contracting Entity. Meanwhile, our core technical infrastructure and R&D teams are strategically distributed across global innovation hubs, including Silicon Valley, Singapore, and Hong Kong.

拡張性を考慮した設計:

私たちは安定性が何よりも重要であると理解しています。当社のプラットフォームは、動的なオートスケーリングをサポートする堅牢な分散型アーキテクチャ上に構築されています。パイロット運用から数百万件の同時リクエストの処理まで、システムは需要に合わせて即座に拡張され、ビジネスの成長を妨げないインフラストラクチャを保証します。

ナビゲーション

  • ダッシュボード
  • モデル
  • 画像生成
  • AI画像高画質化
  • AI背景削除
  • 動画生成
  • キャンバスで編集
  • 機能
  • 料金プラン
  • AIドキュメント
  • AIブログ
  • AIインサイト
  • AIスキル

機能

  • アニメをリアルな人物に変換するAI
  • アニメAIアートジェネレーター
  • AIオブジェクト除去
  • AI画像エディター
  • 制限なしAI画像生成
  • AIモーション転送
  • AI Clothes Remover
  • AIウォーターマーク除去
  • オンラインAI画像高画質化ツール
  • オンライン背景削除ツール
  • AI顔交換画像
  • AIパスポート写真メーカー
  • MS Paint AI Generator
Explore all features >

LLM

  • Claude Opus 5
  • Gemini 3.6 Flash
  • Gemini 3.5 Flash Lite
  • Kimi K3
  • GPT 5.6 Luna
  • GPT 5.6 Terra
  • GPT 5.6 Sol
  • Grok 4.5
  • Claude Sonnet 5
  • Minimax M3
  • GLM 5.2
  • GPT 5.1 Chat Latest
  • Claude Fable 5
  • Qwen3.7 Max
  • Claude Opus 4.8 Thinking
  • Claude Opus 4.8
  • Gemini 3.5 Flash
  • DeepSeek v4 Flash
  • DeepSeek v4 Pro
  • Grok 4.3
すべてのモデルを見る >

画像

  • Dola Seedream 5.0 Pro 260628
  • Gemini 3.1 Flash Lite Image
  • Gemini 3.1 Flash Image
  • GPT Image 2
  • Gemini 3.1 Flash Image Preview
  • Seedream 5.0 260128
  • Doubao Seedream 5.0 260128
  • Vidu Q2
  • Grok Imagine Image
  • Kling Image O1
  • GPT Image 1.5
  • Seedream 4.5 251128
  • Doubao Seedream 4.5 251128
  • Grok Imagine 0.9
  • Gemini 3 Pro Image Preview
  • Qwen Image Lora
  • Qwen Image Plus Lora
  • Qwen Image Plus
  • Grok 4 Image
  • GPT Image 1 Mini
すべてのモデルを見る >

動画

  • Kling v3.0 4k
  • Dreamina Seedance 2.0 Mini 260615
  • Kling v3 Omni 4k
  • Dreamina Seedance 2.0 Fast 260128
  • Dreamina Seedance 2.0 260128
  • Vidu 2.0
  • Doubao Seedance 2.0 260128
  • Doubao Seedance 2.0 Fast 260128
  • Kling v3 Omni Pro
  • Kling v3 Omni Std
  • Vidu Q3 Turbo
  • Kling v3.0 Pro
  • Kling v3.0 Std
  • Vidu Q3 Pro
  • Kling v2.6 Std
  • Vidu Q2 Pro
  • Vidu Q2 Turbo
  • Vidu Q2 Pro Fast
  • Vidu Q2
  • Kling Video O1 Pro
すべてのモデルを見る >

© 2026 Talent Tech Global Limited (Hong Kong) / Talent Tech Global LLC (US). All rights reserved.

  • 会社概要
  • プライバシーポリシー
  • 利用規約
  • サイトマップ