要約
happyhorseとして知られる謎の新しいテキスト・動画生成AIが、最近Artificial Analysisのリーダーボードで首位を奪いました。ブラインドA/Bテストで、現王者のSeedanceを前例のない74ポイント差で下しました。
業界関係者は、AlibabaのTaotian Future Life Labがこの匿名リリースの背後にいると推測しています。元Kuaishou幹部のZhang Di氏が率いるこのチームは、わずか5か月でこの高忠実度モデルを開発したと報じられています。このシステムは、完璧な物理的一貫性とダイナミックなカメラワークを実現し、旧来のアーキテクチャを悩ませていた空間の歪み問題を解消しています。
開発者たちは現在、公式APIへのアクセスを待っています。エンドポイントが公開されれば、計算リソースの割り当ては大幅に制限されるでしょう。スマートなエンジニアリングチームは、公開された瞬間に統合できるよう、すでにルーティング層の設定を進めています。
HappyHorse動画モデルの突然の台頭
開発者コミュニティが、OpenAIはひそかにSoraを一時停止したのだろうと考え、誰もがSeedanceモデルがマルチモーダル分野を永遠に支配すると信じていた、まさにそのとき、業界全体に大きな衝撃が走りました。火曜日の深夜、遅れてダークホースが参戦したのです。
高く評価されているArtificial Analysisのベンチマークプラットフォームで、匿名のエントリーが突然1位を奪いました。リーダーボードはこの謎のシステムをHappyHorse動画モデルと名付けました。
誰もこの展開を予想していませんでした。業界関係者はこの1週間、マルチアングルでのカメラの一貫性と完璧な時間的整合性を備えたSeedance 2.0を称賛していました。そこへ新しいHappyHorse AIが突如現れ、わずか7日間のステルステストで既存のベンチマークを打ち破ったのです。
Artificial Analysisベンチマークを圧倒
Artificial Analysisのプラットフォームでは、あらかじめ用意したマーケティング動画でチームが不正をすることはできません。すべてのランキングは、世界中のユーザーがブラインド形式で横並びのA/Bテストを実施した結果から直接算出されます。2本の動画を見て、より現実的な方を選ぶと、システムがEloレーティングを調整します。
この厳格な手法により、スコアを操作することはできません。高いEloレーティングには、真の映像的優位性が必要です。ユーザーがHappyHorse動画生成AIを現在の市場リーダーと比較したところ、投票結果は新たに登場したモデルを大きく支持しました。
テキスト・動画生成における優位性を解説
その数値は驚異的です。純粋なテキスト・動画生成カテゴリーで、HappyHorse動画モデルは1347のEloレーティングを記録しました。
この数字の意味を考えてみてください。Seedanceモデルが王座を維持したのは、わずか5日ほどでした。その後、新しいHappyHorse AIは現王者を単に上回っただけでなく、実に74ポイント差をつけて完全に打ち負かしました。
HappyHorse動画生成AIがインターネットを騒然とさせた理由
AI研究者たちが74ポイントの差に熱狂している理由を理解するには、背景を知る必要があります。Eloレーティングは、難易度が指数関数的に上昇する仕組みです。リーダーボード上位で5ポイント上げるには、大規模なアーキテクチャの改善が必要になります。
現在の人工知能動画の階層表を見ると、2位のモデルと19位のモデルの総得点差は約70ポイントです。HappyHorse AIモデルは単独で、次に続く18の競合モデルを合わせた差よりも大きなギャップを生み出しました。
74ポイントのElo差を分析
これは世代を超えた飛躍と言えるでしょう。テキスト・動画モデルが74ポイントのリードを確立したということは、人間の評価者がほぼ常に代替モデルよりもその出力を選んでいることを意味します。映像の忠実度、物理シミュレーション、プロンプトへの忠実性は、まったく異なるレベルにあります。
さらに驚くべきことに、データはその差が実際に広がっていることを示しています。テストプラットフォームでHappyHorse動画生成AIを利用するユーザーが増えるほど、勝率は上昇し続けています。
動画・音声モデルの性能
ただし、注意点があります。動画と音声を組み合わせた生成指標にも目を向ける必要があります。映像出力と同時にネイティブな効果音を求めるベンチマークでは、HappyHorse AIモデルは2位に下がります。
音声と映像の同期では、Seedance 2.0がわずかに優位を保っています。完璧なタイミングの足音、街の環境音、会話を生成するには、非常に大きな計算コストがかかります。HappyHorse動画モデルの音声は許容できる水準ですが、真の強みは純粋な映像美とカメラロジックにあります。
謎のHappyHorse AIを開発したのは誰か?
開発者が匿名でリリースしたため、開発者フォーラムでは憶測が飛び交いました。このシステムには、まだ公式のHappyHorse APIアクセスがありません。サーバーを立ち上げてエンドポイントにリクエストを送るだけ、というわけにはいかないのです。
中国の開発者たちは、すぐに名称の由来に気づきました。「Happy Horse」はよく知られたインターネット上の呼び名に訳され、しかも私たちはちょうど午年を迎えようとしています。この命名規則は、シリコンバレーのスタートアップではなく、中国国内のAI研究所を強く示唆しています。
業界大手とのつながりを探る
消去法で考えてみましょう。過去2か月間に、ほぼすべての主要プレイヤーがフラッグシップのテキスト・動画モデルを投入しました。
BytedanceはSeedance 2.0を発表し、AlibabaはWan 2.7-Videoをリリースしました。KuaishouはKling 3.0を、KunlunはSkyReels V4を投入しました。基盤モデルには数千台のGPUと数か月の学習時間が必要です。これらのチームが、さらに大規模な基盤モデルをどこからともなく開発した可能性は、ほぼゼロでしょう。
DeepSeekが長く噂されてきたマルチモーダルアーキテクチャをテストしているのでしょうか?あるいは、Xiaomiが匿名のMiMoシリーズを推進しているのでしょうか?可能性はありますが、基盤となるアーキテクチャは非常に特定の系譜を示しています。
| 企業/研究所 |
最近のフラッグシップリリース |
HappyHorse所有の可能性 |
| Bytedance |
Seedance 2.0 |
極めて低い(リリース直後) |
| Kuaishou |
Kling 3.0 |
非常に低い(異なるアーキテクチャ) |
| Alibaba(本体) |
Wan 2.7-Video |
低い(最近の導入) |
| Alibaba Taotian Future Life Lab |
最近はなし |
極めて高い(有力な噂) |
Zhang Di氏とKuaishou Klingの系譜
現在の業界のコンセンサスは、Alibaba Taotian Future Life Labを直接指し示しています。より具体的には、元Kuaishou Klingプロジェクト責任者のZhang Di氏に注目が集まっています。
Zhang Di氏はAI動画分野で非常に大きな存在感を持つ人物です。2010年に上海交通大学を卒業した後、Alibabaで10年間にわたり検索アルゴリズムとディープラーニングを極めました。2020年から2025年にかけてはKuaishouの副社長を務め、「Klingの父」と呼ばれるまでになりました。
同氏はKling 1.0と2.0の基盤アーキテクチャを構築しており、市場最高の動画生成AIを作る方法を熟知していることを証明しています。
新しいHappyHorse AIの背後にあるアーキテクチャ
Klingエコシステムが大きな商業的成功を収めていたにもかかわらず、Zhang Di氏は2025年に予想外の形でKuaishouを退社しました。2025年11月、同氏はひそかにAlibabaへ戻り、Taotian GroupのFuture Life Labを率いることになりました。直属の上司はAlibabaの経営陣です。
この噂が本当なら、競合にとってその開発期間はまさに恐ろしいものです。Zhang Di氏とチームが、わずか5か月で世界最高水準のテキスト・動画モデルを開発したことになるからです。
トップに到達するまでの5か月
半年も経たないうちにSeedanceモデルを打ち破る基盤アーキテクチャを構築することは、AI開発における既知の常識をすべて覆します。チームが非常に効率的な新しい学習パラダイム、あるいは時空間データを処理する画期的な方法を発見したことを示唆しています。
ほとんどのチームは、5か月間を学習データセットのクリーニングだけに費やします。HappyHorse動画モデルは従来のスケーリング則を回避し、通常なら数年かかる開発サイクルを経ることなく、超写実的なレンダリングを実現しています。
初期テストとソーシャルメディアでのリーク
公式のHappyHorse APIドキュメントを待つ間も、機転の利く開発者たちはベンチマークツールを通じてサンプル動画を抽出し続けています。現在、ソーシャルメディアにはこうした無許可のデモ動画があふれています。
リークされた動画は、驚異的な物理法則への忠実性を示しています。液体の動き、布の物理挙動、複雑な人間の微表情が、非常に安定して再現されています。余分な指や溶けた背景を幻覚的に生成していた旧世代モデルとは異なり、HappyHorse動画生成AIは、長いプロンプトの動画全体で厳密な空間認識を維持します。
HappyHorse APIへのアクセスと今後の提供予定
現時点で、開発者たちはもどかしい待機状態に置かれています。公式リリースを追跡するには
最新のAI業界ニュースを確認できますが、直接統合することはまだ不可能です。
匿名リリースであるため、商用価格、レート制限、コンテキストウィンドウのサイズについては何も分かっていません。しかし、エンジニアリングチームは何もせずに待つべきではありません。HappyHorse APIがついに公開されたとき、計算リソースの割り当てをめぐる競争は熾烈になるでしょう。
リリースに向けてスタックを準備する
優れた開発チームは、主要モデルの登場前にインフラを準備します。新しいHappyHorse AIが利用可能になった瞬間に統合したいなら、柔軟なバックエンドアーキテクチャが必要です。
単一プロバイダーのエンドポイントをハードコーディングすると、レート制限や突然の価格変更に弱くなります。現代的なアプローチでは、Seedanceモデル、HappyHorse AIモデル、そして将来の競合モデルの間で即座にルーティングできる統合アクセスレイヤーを利用します。
GPT Protoのような統合プラットフォームを利用する
ここでアグリゲータープラットフォームが重要になります。リリース後は、統合システムを通じて
HappyHorseやその他のモデルを閲覧できます。GPT Protoのような統合APIプラットフォームを使えば、統合コードを書くのは一度だけです。
HappyHorse APIのアクセスキーがついに解放されたら、GPT Protoユーザーは設定ファイルのスイッチを切り替えるだけで済みます。また、12種類もの異なるクレジットカード契約を管理することなく、複数モデルの
API請求を管理することも簡単です。
HappyHorse対Seedance:新たなテキスト・動画生成の標準
私たちは、マルチモーダルの覇権をめぐる熾烈で急速な戦いを目撃しています。Seedanceモデルは、従来の拡散技術を捨て、純粋なトランスフォーマーアーキテクチャへ移行するよう、業界全体に迫りました。今やHappyHorse動画生成AIは、純粋な映像レンダリングにもまだ大きな改善の余地があることを証明しています。
業界は映像の忠実度が頭打ちになったと考えていました。次の戦場は、プロンプトへの忠実性とネイティブ音声生成に限定されると、私たちは考えていたのです。
映像の一貫性とカメラワーク
HappyHorse動画モデルの最大の強みは、ダイナミックなカメラ移動にあります。初期テストでは、パン、ズーム、ドローンのような追跡ショットでも、背景のジオメトリが完璧に維持されることが明らかになっています。
ネオンに照らされた都市を高速で飛ぶドローン映像をプロンプトで指示すると、旧モデルは建築物の一貫性を失います。建物は歪み、道路は融合します。HappyHorse AIモデルはジオメトリを固定したまま、2Dピクセルの推測器ではなく、本物の3Dレンダリングエンジンのように動作します。
AIクリエイターにとっての意味
個人映像制作者やマーケティングチームにとって、このレベルの一貫性はコスト構造を変えます。使える3秒動画を1本得るために、プロンプトのバリエーションを50個も生成する必要はもうありません。
「Eloの差が、知るべきことをすべて教えてくれます。HappyHorse AIモデルは、プロンプトから利用可能な動画までの比率を大幅に改善し、時間とAPI推論コストの両方を削減します。」
制作ツールを開発しているなら、現在利用しているプロバイダーの
APIドキュメント全文を読むとともに、シームレスに切り替えられるようパイプラインを準備しておくべきです。この謎のモデルが門戸を開いた瞬間、顧客の需要によって対応を迫られるでしょう。
HappyHorse AIリリースについての最終考察
HappyHorse動画モデルの突然の登場は、基盤AIをめぐる競争が依然として極めて流動的であることを証明しました。マルチモーダル生成において、どの巨大企業も崩れない独占を確立しているわけではありません。
適切なリーダーシップを持つ小規模で非常に集中したチーム――おそらくAlibaba TaotianのZhang Di氏のチーム――が、今でもわずか数か月で業界全体を一変させることができます。彼らは現在利用可能な最高の動画生成AIを提供し、匿名のベンチマークリリースでインターネットを騒然とさせました。
公式のHappyHorse APIアクセスを待つ中、開発者への指針は明確です。柔軟なシステムを構築しましょう。ルーティング層を準備しましょう。HappyHorse AIモデルがついに正体を明かしたとき、テキスト・動画生成の状況は二度と同じではなくなるからです。
執筆者:GPT Proto
「GPT Protoの統合APIプラットフォームで、世界をリードするAIモデルを利用しましょう。」