Schuyler Stacy2026-07-31

MiniMax H3 正式登場:其影片編輯升級實際帶來哪些改變

了解 MiniMax H3 帶來的變革,包括 2K 影片、15 秒片段、原生音訊、生成式影片編輯、電子商務使用案例、定價與 Hailuo 比較。

MiniMax H3 正式登場:其影片編輯升級實際帶來哪些改變

TL;DR:你需要知道的事

  • MiniMax H3 已於 2026 年 7 月 31 日正式發布。

  • 它可生成 4 至 15 秒、2K 解析度且幀率為 24 fps 的影片。

  • 它接受文字、圖片、影片和音訊等多模態輸入。

  • 它支援文字轉影片、首幀和尾幀控制、基於參考內容生成、動態轉移,以及生成式影片編輯。

  • 它可以與影片一同生成原生立體聲音訊。

  • 其官方 API 已上線,但 MiniMax H3 尚無法透過 GPTProto 使用。

  • MiniMax 計畫發布可下載的模型權重,但截至本文上次檢查時,這些權重尚未公開。

  • 當你需要來源影片參考、編輯、音訊或 2K 輸出時,H3 是相較於 Hailuo 2.3 的重大工作流程升級。對於較簡單的短篇文字轉影片和圖片轉影片工作,Hailuo 2.3 仍然足夠。

目錄

MiniMax H3 can generate a 15-second video at 2K resolution with native stereo sound. That makes for a neat launch headline, but resolution is not the upgrade that matters most.

The more consequential change is what you can give the model before it generates anything. H3 accepts text, images, video, and audio as references, then uses them to create or modify a clip. Instead of asking only, “What new video can this model generate?”, you can ask, “What parts of this existing video should stay, and what should change?”

That makes H3 relevant to campaign revisions, product videos, motion transfer, music visuals, and other jobs that previously required several separate generation and editing steps. It does not turn H3 into a frame-accurate timeline editor, however. Its video editing is generative: the model interprets the source and renders a new result.

MiniMax H3 Examples: Two Useful Tests

The following examples are designed to test two different sides of MiniMax H3. The first tests whether H3 can preserve an existing performance while changing its art direction and adding exact typography. The second tests whether it can hold together a complex 15-second action sequence.

Example 1: Edit a K-pop Video With Kinetic Typography

Media placeholder: Insert the original dance clip and the edited H3 output here.

Input: One existing video featuring exactly three performers
Mode: Reference-to-video
What changes: Studio background, clothing direction, graphics, typography, and audio treatment
What should remain: Performer count, identities, choreography, timing, and source-camera movement

Edit the uploaded source video into a high-fashion K-pop campaign.

Preserve exactly three female performers, their facial identities, choreography timing, body positions, expressions, and the original camera movement. Do not add, remove, duplicate, or merge any performer.

Replace the original environment with a high-contrast white cyclorama fashion studio. Restyle the performers in coordinated futuristic black, silver, and deep-red techwear with metallic panels, structured silhouettes, utility straps, and reflective accessories.

Add bold kinetic typography that reacts to the rhythm and camera cuts. Render only the exact words “FEARLESS” and “NO LIMITS” in large, correctly spelled, black condensed sans-serif letters. Show one phrase at a time. Let the typography slide, scale, and briefly pass behind the performers without covering their faces or hands.

Add torn-paper collage elements, red editorial cutouts, subtle digital scan lines, and controlled glitch-signal effects in the background. Emphasize close-ups of confident expressions, finger-pointing gestures, leg-strap details, and synchronized dance poses while following the source video’s existing shot sequence.

High-key editorial lighting, clean white highlights, sharp fashion-photography detail, crisp fabric texture, stable faces and limbs, and a dynamic but controlled visual rhythm. Preserve the original video duration and synchronization. Native stereo audio with punchy electronic percussion, sharp transition hits, and subtle glitch accents.

This is not merely a test of whether H3 can create an attractive music video. Check whether it can preserve three distinct people through fast movement, keep the choreography aligned with the source, spell both phrases correctly, and place the typography without repeatedly covering faces or hands.

Those details matter because “change the look but keep the performance” is the actual editing problem. A visually impressive output that changes the dancer count or abandons the original timing has failed the brief.

Example 2: A 15-Second Miniature Skateboard Chase

Media placeholder: Insert the generated 15-second H3 output here.

Input: Text prompt only
Mode: Text-to-video
What it tests: Long motion, scale consistency, collisions, occlusion, camera tracking, and synchronized environmental sound

A 15-second photorealistic miniature chase sequence filmed as one continuous shot with no cuts.

0–4 seconds: An ultra-low, floor-level macro tracking camera follows directly behind a tiny miniature skateboarder riding smoothly across a polished wooden floor. The skateboarder and board remain clearly visible and maintain the same scale and appearance. Warm sunlight reflects softly across the wood. Shallow depth of field, realistic wheel vibration, subtle motion blur.

4–9 seconds: Giant colorful toy blocks suddenly tumble into the path from both sides. The skateboarder leans, swerves, and narrowly passes between them as a large toy truck rolls across the foreground. The camera keeps pace without losing the subject. Blocks collide naturally and cast realistic moving shadows.

9–15 seconds: A giant cute baby crawls rapidly into view in the background and reaches one enormous hand toward the skateboarder and the camera. The skateboarder accelerates beneath the approaching hand as the camera continues tracking inches above the floor. The hand passes close to the lens without touching it. End with the skateboarder escaping beneath the toy truck as the baby reacts with a surprised laugh.

Maintain consistent miniature scale, skateboarder identity, floor layout, lighting direction, and object positions throughout the shot. Realistic physics, natural hand anatomy, detailed wood and toy textures, cinematic macro perspective, warm bright indoor daylight, and energetic but readable motion.

Native stereo sound: tiny skateboard wheels rolling across wood, blocks clattering from left and right, the toy truck rumbling across the foreground, a soft baby laugh behind the camera, and a brief low whoosh as the giant hand approaches.

The timeline gives H3 a clearer sequence than a single paragraph full of simultaneous actions. Even so, this is a hard prompt. The camera must track one tiny subject while several much larger objects enter, collide, and partially obscure the view. A useful review should check continuity at the 4-second and 9-second transitions rather than judging only the sharpest frame.

 

什麼是 MiniMax H3?

MiniMax H3 是 MiniMax 於 2026 年 7 月 31 日發布的通用多模態影片模型。簡單來說,它可以同時讀取多種創意輸入—文字指令、靜態圖片、影片片段和音訊—並利用這些內容生成新影片。

這個定義使 H3 有別於 MiniMax M3。H3 是本文討論的影片生成模型;M3 則屬於 MiniMax 的語言與程式碼模型系列。名稱相似,但用途不同。

官方 API 模型 ID 為 MiniMax-H3。MiniMax 目前的文件列出三種主要生成方式:文字轉影片、首幀和/或尾幀圖片轉影片,以及參考內容轉影片。模型以 24 fps 輸出,支援 4 至 15 秒、以整秒為增量的影片,目前可透過公開 API 產生 2K 輸出。 MiniMax H3 影片文件

規格 MiniMax H3
官方 API 模型 ID MiniMax-H3
輸出解析度 2K
輸出時長 4–15 秒
影格率 24 fps
輸入類型 文字、圖片、影片、音訊
主要模式 文字轉影片、首幀/尾幀圖片轉影片、參考內容轉影片
參考圖片 最多 9 張
參考影片 最多 3 個片段;總計 15 秒
參考音訊 最多 3 個片段;總計 15 秒
混合參考檔案 最多 12 個
提示詞長度 最多 7,000 個字元
支援的輸出比例 21:9、16:9、4:3、1:1、3:4、9:16,或在支援的情況下採用自適應比例

你也可能會看到 H3 被描述為「Hailuo 3.0」。若將其視為 Hailuo 2.x 系列之後的版本,這個稱呼作為非正式說法是合理的;但 MiniMax 目前的模型清單和 API 文件使用的是 MiniMax H3,而不是 Hailuo 3.0,作為正式名稱。

MiniMax H3 升級版有哪些新功能?

Hailuo 2.3 著重於提升物理動作、人類微表情、風格化視覺效果,以及對動作指令的回應。H3 改變了產品的使用範圍。它不再只是從文字或單張圖片生成短片;現在,模型可以將現有媒體作為工作脈絡。

1. 最長 15 秒影片支援 2K 輸出

MiniMax H3 將舊版 Hailuo API 模型提供的 6 秒或 10 秒格式,上限提升為彈性的 4–15 秒。同時,它也將最高解析度從 1080p 提升至 2K。

更長並不會自動代表更連貫。15 秒的鏡頭給模型更多時間改變臉部、遺失物件,或誤解後續事件。因此,上方的第二個範例使用了具備時間安排的序列和明確的連續性限制。

2. 原生立體聲音訊

H3 將聲音作為影片的一部分生成,而不需要完全獨立的音訊生成流程。路透社報導指出,原生立體聲音效是其發布功能之一。對於短篇廣告、音樂視覺內容和動作片段而言,這能讓音效更貼近產生這些聲音的事件。 路透社發布報導

取捨在於可預測性。原生音訊可減少工作流程步驟,但不保證每次都能產生精確對白、完美唇形同步,或可直接投入製作的混音。如果專案依賴已取得法律授權的音樂、精確的旁白文案或嚴格的響度標準,請將生成的音軌視為草稿,直到通過獨立審查為止。

3. 多模態參考內容生成

參考內容轉影片的請求最多可以結合 9 張圖片、3 個影片片段和 3 個音訊片段,但參考檔案總數上限為 12 個,參考影片或音訊的總時長上限為 15 秒。每個請求仍需提供文字提示詞。音訊也不能單獨提交;必須至少搭配一張參考圖片或一段參考影片。

當單一素材無法承載完整需求時,這項功能非常實用。產品圖片可以定義物件,模特兒圖片可以定義人物,來源片段可以定義動作,而音訊片段可以定義節奏。接著,提示詞會說明要保留哪些特徵,以及最終場景應呈現的樣貌。

更多參考內容也會帶來更多指令互相衝突的可能性。9 張圖片不一定比 3 張更好。如果兩張產品圖片呈現不同包裝,或兩個角色參考圖顯示不同髮型,模型就必須猜測哪一個應優先採用。

4. 首幀與尾幀控制

H3 支援首幀、尾幀,或同時設定兩者。當開頭的產品構圖和結尾的品牌畫面已經核准,但兩者之間的動態仍需要生成時,這項功能非常實用。

首幀/尾幀模式與多模態參考模式是分開的 API 路徑。MiniMax 目前的規格表示,兩者不能在同一個請求中混用。這個界線很容易被忽略:你可以錨定開頭和結尾的圖片,或使用一組參考圖片、影片和音訊,但不能同時使用這兩種輸入結構。 MiniMax H3 API 參考文件

5. 動作轉移與參考影片控制

H3 可以利用參考影片引導動作、攝影機行為、剪輯節奏及其他時間資訊。這為舞蹈動作轉移、產品操作手勢、鏡頭移動和場景時序提供了實用途徑,而這些內容僅靠文字很難描述。

這不代表來源動作會逐幀複製。H3 會解讀參考內容並重新生成結果。對於容易辨識的舞蹈動作或經過嚴格核准的產品移動,應將輸出與來源時間軸進行比較,而不要假設「參考」代表完全複製。

6. 生成式影片編輯

影片編輯是 H3 的主要特色,但這個術語需要明確界定。H3 不是傳統的編輯器,不能讓你選取圖層、替換一個詞,同時讓所有未受影響的像素保持不變。

相反地,來源影片會成為參考內容。提示詞告訴 H3 要保留什麼、改變什麼,模型則生成修訂後的片段。這可以支援大幅度的創意變更—新場景、服裝、圖像、聲音或風格—但同樣的變更也可能導致身分漂移、構圖改變、文字拼寫錯誤或細微的動作變化。

一句話總結:H3 透過重新生成來編輯,而不是以手術式方式修改原始檔案。

MiniMax H3 影片編輯實際上如何運作

一個好的 H3 編輯指令包含兩個層次:

  1. 保留限制: 片段中要保留哪些人物?哪些產品細節、動作、鏡頭移動、時間安排和構圖必須維持不變?

  2. 轉換指示:哪些背景、服裝、視覺風格、字體、聲音或氛圍應該改變?

K-pop 提示詞刻意採用了這種拆分方式。它首先鎖定表演者人數、臉部身分、編舞、時間安排和鏡頭移動,接著才要求更換工作室、時尚方向、圖像設計和音訊處理方式。

這種順序很重要。“把這段影片變成未來感 K-pop 影片”等於允許模型重新詮釋幾乎所有內容。“完整保留三位表演者和原始編舞;只更換藝術指導”則為模型提供了明確的優先層級。

對於較複雜的編輯,一次只更改一個主要類別。先測試背景和服裝,再加入字體,最後調整音訊。單一請求可以完成這三項工作,但分開處理能讓你了解是哪一項指示導致失敗,也更容易診斷重試結果。

此外,發布摘要通常會忽略一項成本細節。MiniMax 的 2K 輸出費用為每秒 $0.13,而參考影片則會依其時長,按照相同的每秒費率計費。因此,生成一段 15 秒的 2K 影片約需 $1.95。如果請求同時使用一段 15 秒的參考影片,輸入影片與輸出的合計費用約為 $3.90,尚未計入超過五張參考圖片的額外費用。 MiniMax 隨用隨付定價

這並不代表參考影片編輯不合理,但會改變你規劃迭代的方式。按照列出的費率,十次 15 秒的文字轉影片嘗試約需 $19.50;十次同樣長度、且使用 15 秒來源影片的編輯則約需 $39.00。先從較短的診斷性生成開始,才是合理的第一步。

MiniMax H3 可以製作哪些類型的影片?

H3 可以處理常見的文字轉影片和圖片轉影片工作,但更適合的使用情境,是那些能受益於多種參考類型或現有時間軸的任務。

無需全部重新拍攝即可修改行銷活動

品牌可以提供已核准的原始表演內容,然後要求更換地點、服裝方向、季節性處理方式或圖像系統。這對於構思地區版或特定活動版本非常有用。但如果每個產品標籤、臉部細節和手勢都必須以逐格精準度保留,這種方式就不太適合。

將產品圖片轉換成電子商務影片

產品圖片可以定義形狀、色彩和包裝,而動態參考則示範產品應如何旋轉、打開、傾倒、折疊或在場景中移動。結尾圖片可用於固定的結尾卡,但目前無法在同一個請求中與參考影片轉換輸入結合使用。

轉移編舞或鏡頭動態

參考片段可以傳達需要數百字才能描述的時間節奏。舞蹈、運動動作、手持攝影機行為和產品揭示鏡頭移動都是明顯的適用情境。務必確認你有權使用來源表演和肖像。

製作短篇音樂和時尚視覺內容

快速的視覺變化、生成聲音、參考動態和藝術指導提示詞相互結合,非常適合音樂預告片和時尚活動。精確的字體仍是需要品質控管的環節,不能視為理所當然。

製作遊戲宣傳片和電影感標題畫面

參考圖片可以讓角色、道具或介面更接近已核准的設計,同時由提示詞加入動態、鏡頭運動、粒子和聲音。生成影片對概念預告片很有用,但介面文字和類似遊戲過程的片段仍需要人工審核。

生成 15 秒的動作或追逐片段

較長的時長能讓提示詞有足夠空間呈現鋪陳、升級和結果,但也會讓連貫性變得更困難。提示詞應將動作分成不同時間範圍,並重複說明不可改變的主體特徵。

MiniMax H3 用於電子商務與廣告

思考 H3 在電子商務中的用途,最實用的方式不是「生成一則廣告」。不如把它視為利用多種媒體素材組合成一份製作簡報。

輸入 工作流程中的用途
產品圖片 定義產品的形狀、色彩、材質和包裝
標誌或包裝參考 限制品牌標誌和視覺識別
模特兒或角色圖片 讓展示者的外觀更接近已核准的形象
動態參考影片 指定手勢、示範動作、鏡頭移動或剪輯節奏
音訊參考 引導節奏、聲音或音效方向
文字提示詞 說明最終場景、保留規則、變更內容和排除項目

例如,化妝品品牌可以提供五個乾淨的產品角度、一張模特兒參考圖片、一段 6 秒的手部動作片段,以及一段簡短的音訊參考。接著,提示詞可以要求生成一段 10 秒的直式產品揭示影片,同時保留瓶身形狀、標籤位置、瓶蓋色彩、模特兒身分和手勢時機。

這比「製作一則奢華化妝品廣告」更完善,也並非保證。產品幾何形狀可能變形,小型標籤文字可能改變,標誌也可能在不同影格之間漂移。如果輸出內容將成為付費廣告,請逐格將產品與核准的攝影畫面進行比對,必要時在傳統編輯器中替換關鍵品牌文字。

在這裡,H3 最適合作為概念、變體和短篇活動素材的製作加速工具,而不是品牌核准流程的替代品。

MiniMax H3 與 Hailuo 2.3 及 Hailuo 02 的比較

這一代的差異比解析度欄位所顯示的更大。MiniMax 先前的 Hailuo 模型是以文字和影像輸入為核心的短片生成器。H3 新增了參考系統,可以接收影片和音訊,接著使用這些素材進行創作、動作轉移或編輯。

功能 MiniMax H3 Hailuo 2.3 Hailuo 02
最高公開記載解析度 2K 1080p 1080p
公開記載時長 4–15 秒 1080p 下為 6 秒;768p 下為 6 或 10 秒 1080p 下為 6 秒;768p/512p 下為 6 或 10 秒
影格率 24 fps 24 fps 24 fps
文字轉影片
影像轉影片
首幀/末幀輸入 未列為目前的主要模式
參考影片與音訊 目前的模型規格未列出 目前的模型規格未列出
原生生成音訊 未列出 未列出
生成式影片編輯 是,透過基於參考素材的重新生成 未列出 未列出
最適合的用途 多模態簡報、編輯、動作轉移、音訊,以及較長的 2K 片段 具備更強動作與表情處理能力的短片 T2V/I2V 傳統短片生成與較低解析度選項

實際選擇很明確:

  • 當任務需要現有影片、多個參考素材、原生聲音、2K 輸出,或超過 10 秒的影片時,請選擇 MiniMax H3

  • 當您只需要短片文字轉影片或影像轉影片片段,且不需要 H3 的參考與編輯系統時,請選擇 Hailuo 2.3

  • 當其首幀/末幀流程或較低解析度的定價適合簡單的舊版工作流程時,可以考慮 Hailuo 02

MiniMax H3 尚未透過 GPT Proto 提供。如果您需要已在 GPT Proto 上線的 MiniMax 影片模型,請嘗試 Hailuo 2.3 Pro for image-to-videoHailuo 2.3 Pro for text-to-video

MiniMax H3 的價格與可用性

MiniMax H3 的官方 API 已以模型 ID MiniMax-H3 上線。目前公開的 API 文件列出 2K 為可用的輸出解析度。雖然已公布 768p 的價格,但 MiniMax 標示該選項為封閉測試版,並要求使用者在使用前聯絡銷售人員。

項目 公布價格
2K 輸出影片 每秒 $0.13
768p 輸出影片 每秒 $0.09;封閉測試版
音訊參考素材 免費
參考影像 前 5 張免費;每增加一張影像需支付 $0.04
參考影片 申請 2K 輸出時,每個輸入秒數需支付 $0.13
15 秒 2K 文字轉影片生成 約 $1.95
15 秒參考影片 + 15 秒 2K 輸出 約 $3.90

此 API 採用非同步工作流程:提交生成請求、接收工作 ID、輪詢工作狀態,並在成功後下載結果。MiniMax H3 目前尚未在 GPT Proto 上提供,因此本文不包含 GPT Proto 程式碼範例,也不會暗示 GPT Proto H3 端點已經上線。

關於開放權重的狀態也需要精確措辭。MiniMax 將 H3 定位為開放的通用模型,並已宣布計畫發布模型權重。路透社報導稱,相關檔案預計在數日內發布。然而,截至本文 7 月 31 日查核時,可下載的權重、授權條款、模型大小及實際的本機硬體需求,尚未獲得公開確認。

因此,「開放權重」是已宣布的方向,並不代表您今天就能下載 H3 並在本機執行。

MiniMax H3 仍無法保證的事項

H3 擴展了單次生成中可以嘗試的內容,但並未消除生成式影片常見的失敗模式。

精確文字可能仍需要多次重試。第一個範例刻意只使用兩個簡短片語。如果這些文字在不同影格中發生變化,請使用生成結果處理動態,再在一般編輯器中加入最終文字排版。

大幅編輯可能會改變人物身分。在單一請求中替換背景、服裝、圖像系統、音訊和光線,會給模型更多重新詮釋來源人物的機會。

15 秒的複雜鏡頭比簡單的 6 秒動畫更難處理。片段越長、包含的事件越多,模型就必須保留越多連貫性方面的決策。

生成式編輯並非保留像素的編輯。H3 會根據參考素材建立新的結果。對於法律、醫療或產品合規編輯而言,如果所有未修改的像素都必須保持一致,H3 並不是合適的工具。

官方範例無法證明其具備可重複的生產可靠性。發布影片展示的是模型能夠產出什麼,而不是結果需要多少次嘗試。可重複性、失敗率和對提示詞的敏感度,都需要獨立測試。

本機部署需求仍未知。在實際權重、架構細節、授權和服務部署指南公布之前,任何精確的 VRAM 建議都只是推測。

一項獨立訊號令人鼓舞:7 月 31 日,MiniMax H3 在 Artificial Analysis 的含音訊影片編輯排行榜中排名第一,根據 5,043 個樣本取得 1,130 的 Elo 分數。這是一項有參考價值的盲測偏好結果,但它只是某個時間點的快照,並不保證適用於每項任務。 Artificial Analysis 影片編輯排行榜

最終結論:MiniMax H3 是有意義的升級嗎?

是。MiniMax H3 相較於 Hailuo 2.3 的升級幅度,比「從 1080p 提升到 2K」所暗示的更大。

它存在的最大理由,在於以參考素材驅動的生成與編輯。文字、產品影像、來源表演、動作指引和音訊,現在都能共同用於一次影片請求。對廣告和電子商務團隊而言,這會將需求從「生成類似的內容」改變為「保留這些素材和這個時間安排,然後變更這些特定的創意元素」。

代價是控制力。由於 H3 會重新生成片段,編輯可能會影響您想保留的細節。較長的鏡頭也會增加連貫性失敗的機會,而輸入影片則會提高每次嘗試的價格。

對於簡單的 6 秒影像動畫,Hailuo 2.3 可能已經足夠。對於多模態行銷活動、動作轉移、原生聲音、現有影片修訂,或 15 秒動作序列,H3 是更值得測試的模型。

MiniMax H3 目前尚未在 GPT Proto 上提供。在準備存取權限期間,您可以 探索 GPT Proto 模型庫中的其他影片生成模型,或造訪 GPT Proto,比較透過單一帳戶即可使用的模型。

 

創意工作室

使用生產級 API 生成圖像、影片及更多內容。

開始創作
創意工作室
相關模型
全部模型
MiniMax
10% OFF
Claude
20% OFF
Google
40% OFF
Google
40% OFF