🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

MiniMax H3:開源權重 2K 影片模型完整指南

文章目錄

MiniMax H3:開源權重 2K 影片模型完整指南

MiniMax H3 是 MiniMax 推出的開源權重通用多模態影片模型。它能一次生成 2560×1440 的原生 2K 影片與同步的立體聲音訊,最多可接受 12 個多模態參考資源(文字、圖片、影片、音訊),並以開放權重形式提供,方便企業自行架設。MiniMax 將其定價壓在同等級前沿影片模型的三分之一左右:在標準閘道(OpenRouter、Vercel AI Gateway、EvoLink)上,768p 畫質為每秒 $0.09,原生 2K 畫質為每秒 $0.13。

本頁面彙整經過驗證的規格表、定價、API 接取路徑、提示詞操作手冊與使用限制,協助創作者判斷 H3 在實際工作流程中的定位。若要直接動手生成,請使用 PixMind MiniMax H3 路徑MiniMax H3 線上生成器

重點摘要

  • 可輸出原生 2K(2560×1440)畫質,24 FPS,片長 5 至 15 秒,並在同一推理過程中同步生成原生立體聲音訊。
  • 單次生成可同時接受文字提示詞,以及最多 9 張參考圖片、3 支參考影片、3 段參考音訊,合計 12 個參考資源。
  • 根據 OpenRouter、Vercel AI Gateway 與 EvoLink 的費率卡,第三方閘道上的定價約為 2K 每秒 $0.13、768p 每秒 $0.09,約為同等級前沿模型的三分之一。
  • 權重以開源形式提供,供使用者自行架設,並依地區分階段釋出。
  • Reddit 上獨立評測者的共識認為,H3 已達到約 Seedance 等級品質的 98%,具備強烈的時間一致性與準確的畫面內文字呈現。

PixMind AI 影片中心

MiniMax H3 是什麼?

MiniMax H3 是由北京創立的 AI 實驗室 MiniMax 所開發的 Transformer 架構、開源權重、通用多模態影片模型。它是該公司前沿影片模型的第三代產品。

此模型的核心特色在於「統一」。H3 不再使用各自獨立的文字轉影片、圖片轉影片、音訊與剪輯模型,而是在單一上下文視窗中同時接收文字、圖片、參考影片與參考音訊,先生成畫面,再於同一推理階段產生同步的立體聲音訊。對白、音效與環境音都與影格同步生成,而非事後配音。(MiniMax 官方部落格,〈MiniMax H3〉MiniMax 平台文件

MiniMax H3 實戰演示:真實生成範例

在進入規格表之前,先看看這個模型實際能產出什麼。下列影片是完整的 MiniMax H3 操作示範,從單一提示詞一路走完生成流程、產出最終短片,這是觀察 H3 原生 2K 畫質與多模態參考資源實際表現最快的方式。

這份完整教學從參考資源設定與提示詞撰寫,一路示範 MiniMax H3 流程,產出一支內含同步音訊的 2K 短片。

MiniMax 將 H3 以開源權重形式推出,並具備原生 2K、流程內立體聲音訊與 12 個參考資源的多模態輸入額度,這正是上方教學端到端演練的能力組合。

核心技術規格

H3 的規格表圍繞「原生解析度」而非「放大後輸出」打造。下方關鍵數據來自 MiniMax 官方部落格與 API 文件,並與 OpenRouter、Vercel AI Gateway 及 EvoLink 發布的模型卡相互印證。

規格項目 數值
原生解析度 2560×1440(2K)
影格率 24 FPS
片長 5 至 15 秒
音訊 原生同步立體聲,於生成流程內產生
圖片參考 最多 9 張
影片參考 最多 3 支
音訊參考 最多 3 段
單次生成總參考數 最多 12 個,可與文字提示詞合併使用
長寬比 21:9、16:9、4:3、1:1、3:4、9:16
權重 開源權重,分階段區域性釋出
剪輯 對話式,可針對已生成的短片下指令修改

原生 2K 輸出是它最關鍵的差異化優勢。許多標榜「2K」或「4K」的影片模型其實是透過事後放大達成,這種做法能銳化邊緣,卻無法合成模型本身從未生成的細節。H3 在模型內部即以 2560×1440 進行渲染,因此細微材質、毛髮、布料與小字體都能在最終交付尺寸下保留,無需額外的放大步驟。(MiniMax 官方部落格

開源權重發布與自行架設

H3 以開源權重模型形式推出,這一點將它與 Google(Veo)的封閉前沿產品線,以及大多數封閉的消費級影片工具區隔開來。開放權重意味著,只要組織具備足夠的 GPU 運算資源,就能在自己的基礎設施上架設模型、進行稽核、進行微調,並免除每秒鐘計費的 API 費用。

發布過程採分階段進行。MiniMax 已確認將以開源權重形式提供,但會依各地區的法規與授權條件分批釋出。任何計畫自行架設的團隊,都應將官方 MiniMax 管道視為所在地區目前可用性的權威來源,而非仰賴第三方鏡像。(MiniMax 官方部落格

實務上的重點是:需要保證延遲、資料駐留或長期成本可預測性的團隊,可在所屬地區權重釋出後規劃自行架設。而今天就需要產出影片的團隊,則應使用代管 API,或透過如 PixMind、OpenRouter、Vercel AI Gateway、EvoLink 等閘道。

多模態輸入:12 個參考資源系統如何運作

H3 的輸入系統是撰寫提示詞前最值得理解的部分。單次生成可以同時結合:

  • 一段含鏡頭指引的文字提示詞。
  • 最多 9 張參考圖片(可用於首格、末格、角色身分、產品、服裝或風格參考)。
  • 最多 3 支參考影片(可用於動態語彙、節奏或表演)。
  • 最多 3 段參考音訊(可用於人聲、音樂氛圍或聲音設計節奏)。

也就是在一個上下文中,容納 12 個參考資源加上文字提示詞。(MiniMax 平台文件

每個參考資源都應只負責一項任務。多模態模型最常見的失敗模式,就是給予彼此衝突的參考資源:兩張身分不同的角色圖片,或一支與首格、末格相互矛盾的動態參考影片。請將這 12 個位置各自視為單一用途的控制項。一張圖鎖定角色身分、另一張鎖定服裝、再一張鎖定產品幾何形狀;影片參考提供動態節奏;音訊參考提供步調。

這也是使用 H3 對話式剪輯功能的正確時機。短片一經生成,你就可以下指令修改角色、物件、場景、聲音或節奏,而不需要從零重建整顆鏡頭。

原生 2K 輸出與同步立體聲音訊

原生 2K 畫面結合流程內立體聲音訊,是考量升級至 H3、而非沿用前一代 MiniMax 模型時最具決定性的理由。

畫面方面,原生 2K 意味著模型實際渲染出 2560×1440 個像素的真實細節。髮絲、膚質、包裝上的細小印刷字體,以及螢幕錄製風格鏡頭裡的小型 UI 元素,都能在完整交付尺寸下保持清晰。24 FPS 的影格率符合電影與高階廣告製作需求,而不只是適合純社群傳遞的 30 FPS。

電影級特寫靜態畫面,展示 MiniMax H3 在女性臉部上的原生 2K 細節,搭配溫暖的黃金時刻光線與底片顆粒感

音訊方面,H3 在與畫面同一輪推理中生成對白、音效與環境音,再將它們鎖定到對應影格。這省去了封閉式無音訊流程必須進行的後期配音與擬音階段。畫面中說話的角色,嘴部動作與人聲是一起生成的;玻璃撞擊桌面的那一刻,撞擊聲也與視覺接觸點同步產生。(MiniMax 官方部落格

需要留意的限制:任何生成的音訊,尤其是對白,在正式發布前仍需人工審核用詞、發音、節奏與瑕疵。

各家供應商的 MiniMax H3 定價

H3 的定價是它最強的競爭優勢之一。在主要第三方閘道上,費率集中在原生 2K 輸出每秒 $0.13、768p 輸出每秒 $0.09。下方總價直接依這些每秒費率計算。

輸出規格 費率 5 秒短片 10 秒短片 15 秒短片
原生 2K(2560×1440) 約 $0.13/秒 約 $0.65 約 $1.30 約 $1.95
768p 約 $0.09/秒 約 $0.45 約 $0.90 約 $1.35

這些費率公開於 OpenRouter、Vercel AI Gateway 與 EvoLink,且與 MiniMax 自有平台上的定價資訊一致。(OpenRouterVercel AI GatewayEvoLinkMiniMax 平台

MiniMax 將這份費率定位在同等級前沿影片模型的三分之一左右。對於高產量的製作流程(社群活動、多版本廣告素材、視覺預覽),這個價差會迅速放大。一間製作 1,000 支 15 秒 2K 短片的工作室,在 H3 上的成本約為 $1,950,而在同等產量下改用定價較高的前沿路徑,開支會明顯更高。

MiniMax API 與整合路徑

實務上有四種接取 H3 的方式,各自適合不同類型的使用者。

1. PixMind 生成器(無需程式)。 想要現成可用介面、不想寫程式的創作者最快的路徑。打開 PixMind MiniMax H3 生成器,上傳參考資源、撰寫提示詞、選擇片長與長寬比,即可渲染。MiniMax H3 線上生成器

2. MiniMax 平台 API(直接串接)。 想使用官方 API 介面的開發者,可直接透過 platform.minimax.io 呼叫 MiniMax。這是新功能、參數支援與定價變更的權威來源,但需要設定 MiniMax 帳號、視情況完成實名認證(KYC),並自行處理整合工作。(MiniMax 平台文件

3. 聚合閘道(OpenRouter、Vercel AI Gateway、EvoLink)。 這些服務透過統一的計費與 SDK 介面,與其他模型家族一同提供 H3。當你想以一次整合涵蓋多個影片模型,或現有應用程式已採用該閘道協定時,這就是合適選擇。費率可能包含小幅閘道利潤。(OpenRouterVercel AI GatewayEvoLink

4. 自行架設權重。 當開源權重在你的所在地區開放後,即可在自己的 GPU 上執行 H3。這能免除每秒鐘的 API 費用,但成本會轉嫁到硬體、維運與推理基礎設施上。這只適合具有持續高產量或嚴格資料駐留需求的團隊。

對多數讀者而言,合適的起點是無需程式的 PixMind 生成器,或透過閘道整合。當你需要的參數是閘道未開放時,再改為直接使用 MiniMax API;只有當產量規模足以攤提營運成本時,才升級到自行架設。

H3 與前一代 MiniMax 及其他影片模型的比較

H3 相較於前一代 MiniMax 模型屬於跨世代升級,在價格面上更是其他前沿影片模型之外有實質意義的替代選項。下方比較觀點使用 MiniMax 對 H3 的官方能力聲明、公開文件記載的前一代 MiniMax 模型,以及前文提到的公開費率卡。

MiniMax H3 與前一代 MiniMax 模型比較

前一代 MiniMax 模型輸出 768p 或 1080p 影片,沒有原生音訊,輸入介面僅支援文字加圖片。H3 則新增了原生 2K、同步立體聲音訊、完整多模態參考(圖片加影片加音訊)、生成過程中的對話式剪輯,以及開源權重。對已採用官方產品的使用者來說,H3 在規格面上是嚴格的超集,只要在你的使用路徑上線,就應該成為預設選擇。

MiniMax H3 與 Seedance 2.5、Veo 3.1 比較

Reddit 上獨立評測者的共識指出,H3 已達到約 Seedance 等級品質的 98%,在時間一致性與畫面內文字呈現方面尤其出色,近乎完美。剩餘差距主要出現在電影級寫實度的頂端區段,以及複雜的物理互動場景。

取捨在於價格。H3 的 2K 費率約為同等級前沿模型的三分之一,這使它成為高產量工作的預設選擇,因為在那類情境中,些微的品質差距並不足以讓人付出三倍成本。對於以極致寫實為唯一目標的主視覺活動鏡頭,Seedance 2.5 或 Veo 3.1 可能仍是更合適的選擇。

MiniMax H3 與 Kling 3.0 Turbo、PixVerse V6 比較

Kling 3.0 Turbo 與 PixVerse V6 在速度與社群格式廣度上競爭,而非原生 2K 畫質。H3 在電影級與活動製作場景中是更強的選擇;Kling Turbo 與 PixVerse V6 則在短篇社群短片的快速迭代方面仍具價值,特別是當不需要原生音訊時。

比較所有已串接的影片模型

Reddit 與社群共識

來自 r/LocalLLaMA、r/aivideo 與鄰近社群的 Reddit 討論串,對 H3 的早期獨立評測共識可歸納為三點:

  1. 品質接近前沿水準。 評測者將 H3 評為約 Seedance 等級品質的 98%,差距集中在擬真度的頂端區段與複雜物理效果。
  2. 時間一致性是真正的強項。 角色、物件與場景在影格之間的連貫性,優於前一代 MiniMax 模型。
  3. 文字呈現問題幾乎已解決。 畫面內文字一直是影片模型的常見失敗模式,在多數 H3 產出中都能乾淨渲染。

Reddit 上的評論無法取代以你自己的測試提示詞進行基準評估,但具有方向性參考價值。請把「Seedance 品質的 98%」這個數字當作社群的簡略說法,而非嚴格測量。

MiniMax H3 提示詞操作手冊

H3 比起「描述者」,更偏愛「導演」。請把每次生成當作一顆只承擔一項任務的鏡頭,並將 12 個參考位置當作精準的控制項。

先錨定不可變動的元素

在撰寫文字之前,先決定整段短片裡有哪些元素絕對不能變動。在提示詞中明確點出它們:角色身分、產品幾何形狀、配色、服裝、標籤位置、構圖。用來記錄這些不可變條件的參考資源,應該各自只負責一項任務。

一個主要動作,一次運鏡

當一顆短鏡頭只承載一個主體動作與一次運鏡時,敘事會更清晰。把三個轉換塞進 5 秒短片裡,會迫使模型快速跑過每一個轉換,這正是閃爍問題最主要的原因。

把聲音寫進鏡頭

由於 H3 在同一輪推理中生成音訊,請在產生聲音的動作旁邊描述聲音。具體標明對白(用引號)、環境音的質感,以及刻意留白的位置。不要讓音訊保持隱含狀態。

四組提示詞範本

  • 電影級產品短片:「[產品] 在 [表面] 上的高質感主視覺鏡頭。鏡頭執行一次緩慢的 [運鏡]。光線:[氛圍]。保留精確的比例、材質與標籤位置。音訊:細微的 [質感],無音樂,無旁白。以乾淨的主視覺影格結束。」
  • 角色對白場景:「[鏡頭大小] 的 [角色] 位於 [場景]。他說:『[簡短台詞]』。自然的空間音、[環境音]、寫實的對嘴。鏡頭:[運鏡]。光線:[氛圍]。」
  • 首格到末格過渡:「從提供的第一格自然移動到提供的最後一格。主體 [動作]。鏡頭以 [步調] 沿著 [路徑] 移動。全程保留身分、服裝與環境。」
  • 多模態參考鎖定:「使用參考圖 1 作為角色身分、參考圖 2 作為服裝、參考影片 1 作為動態節奏。音訊參考 1 設定人聲與步調。主體在 [場景] 執行 [動作]。」

MiniMax H3 提示詞範本與起手範例庫

MiniMax H3 最佳使用情境

H3 適用的場景,是當原生 2K 畫質、同步音訊或多模態參考控制的重要性,高於壓到最低的每秒成本時。

電影級橫向靜態畫面,黃昏時分的未來霓虹城市,呈現 MiniMax H3 的輸出品質與景深感

  • 電視廣告與主視覺產品短片。 原生 2K 加立體聲意味著單次 H3 生成就能交付接近成片的鏡頭,省去獨立的後期音訊階段。
  • 以對白為主的場景。 在同一輪推理中結合嘴部動作、人聲與環境音,使 H3 非常適合短篇敘事與角色導向作品。
  • 以參考資源維繫活動一致性。 12 個參考資源的額度讓你能在多顆活動鏡頭之間,延續同一個角色、同一項產品、同一套服裝與同一套動態語彙。
  • 大量多版本素材。 在約前沿定價三分之一的條件下,H3 是為某個創意方向產出大量變體、進行 A/B 測試與平台客製交付的合適工具。
  • 視覺預覽與 previz 流程。 開源權重加上低廉的 API 成本,使 H3 適合需要產出大量預覽、卻不想被每顆鏡頭預算壓力綁住的工作室。

限制與注意事項

一份可信的指南,也要點出 H3 做得不好的地方。

  • 音訊仍須審核。 生成的對白、人聲與音效,在正式發布前都需要人工審核用詞、發音、節奏與瑕疵。
  • 複雜物理互動可能漂移。 手部、接觸、快速旋轉、遮擋與複雜的物件互動,對整個模型類別(而不只是 H3)來說仍然是挑戰。
  • 身分與品牌細節需要審核。 臉孔、標誌、產品幾何形狀、螢幕上的文字與授權角色,都需要最終的版權與正確性審核。
  • 權重可用性因地區而異。 開源權重分階段釋出,在承諾自行架設計畫之前,請向官方 MiniMax 管道確認目前狀態。
  • 能力與定價會變動。 模型卡與費率卡變化快速。實際產出前,請在你使用的路徑上確認當下有效的參數與價格。

MiniMax H3 常見問題

MiniMax H3 是開源權重嗎?
是的。MiniMax 已宣布 H3 為開源權重模型。權重依各地區分階段釋出,並受當地法規規範,因此在規劃自行架設部署前,請透過官方 MiniMax 管道確認你所在地區的目前可用性。(MiniMax 官方部落格

MiniMax H3 的費用是多少?
在主要第三方閘道(OpenRouter、Vercel AI Gateway、EvoLink)與 MiniMax 平台上,H3 的定價約為原生 2K 輸出每秒 $0.13、768p 輸出每秒 $0.09。15 秒 2K 短片約 $1.95;15 秒 768p 短片約 $1.35。MiniMax 將此定位在約同等級前沿影片模型定價的三分之一。(OpenRouterVercel AI GatewayEvoLinkMiniMax 平台

H3 支援哪些解析度、影格率與片長?
H3 輸出原生 2K 影片,解析度為 2560×1440,影格率 24 FPS,片長 5 至 15 秒。支援 21:9、16:9、4:3、1:1、3:4 與 9:16 長寬比。(MiniMax 官方部落格MiniMax 平台文件

MiniMax H3 會生成音訊嗎?
會。H3 在與畫面同一輪推理中生成原生同步立體聲音訊(對白、音效與環境音),因此不需要額外的配音或擬音步驟。不過對白在正式發布前仍應審核用詞、節奏與瑕疵。

MiniMax H3 接受哪些輸入?
單次生成可接受一段文字提示詞,加上最多 9 張參考圖片、3 支參考影片與 3 段參考音訊,合計 12 個參考資源。首格與末格控制透過圖片位置支援。(MiniMax 平台文件

我可以自行架設 MiniMax H3 嗎?
可以,只要開源權重在你的所在地區已開放。自行架設能免除每秒鐘的 API 費用,但需要 GPU 運算資源、推理基礎設施與營運責任。對多數團隊而言,代管 API 或如 PixMind 這類閘道才是合適的起點。

H3 與 Seedance 2.5、Veo 3.1 相比如何?
Reddit 上獨立評測者的共識將 H3 評為約 Seedance 等級品質的 98%,具備強烈的時間一致性與準確的畫面內文字呈現。剩餘差距出現在頂端擬真度與複雜物理互動。H3 的優勢在於價格:其 2K 費率約為同等級前沿模型的三分之一,這使它成為高產量工作的預設選擇。

我可以在哪裡生成 MiniMax H3 影片?
最快的無程式路徑是 PixMind MiniMax H3 生成器。開發者也可直接呼叫 platform.minimax.io 的 MiniMax 平台 API,或透過 OpenRouter、Vercel AI Gateway、EvoLink 進行整合。開啟 H3 生成器

我應該如何為 MiniMax H3 撰寫提示詞?
請把每次生成當作一顆只承載一個主要動作與一次運鏡的鏡頭。先錨定不可變動的元素(身分、產品、服裝、配色、構圖),為 12 個參考位置各自分配單一任務,並且把聲音(對白、環境音、留白)寫進提示詞中、附在產生聲音的動作旁。入門範本請見上方的提示詞操作手冊。

我可以將 H3 生成的短片用於商業用途嗎?
多數商業專案都適用,但臉孔、品牌標誌、產品幾何形狀、螢幕上的文字與授權角色,都需要最終的版權與正確性審核。請確保你擁有輸入模型中任何真實人物或第三方參考資源的相關權利。

結論:H3 在你的技術堆疊中的位置

MiniMax H3 是當你需要原生 2K 畫質、同步音訊或多模態參考控制,且預算又能支撐高產量時,值得設為預設的模型。它不是唯一值得使用的模型:Seedance 2.5 與 Veo 3.1 在電影級寫實度的最頂端仍佔優勢,而 Kling 3.0 Turbo 等更快的路徑在社群短片快速迭代方面依然實用。但對於主流的中間市場,在品質門檻高、預算有限的情況下,H3 結合了開源權重、12 個參考資源的多模態輸入、原生 2K、流程內立體聲音訊,以及約前沿定價三分之一的費率,使它成為務實的預設選擇。

下一步,就用你自己的提示詞跑跑看。打開 PixMind MiniMax H3 生成器,上傳一兩個能錨定身分與產品的參考資源,寫一顆只含一次運鏡的鏡頭,並將輸出與你目前使用的模型比較。MiniMax H3 生成器 瀏覽所有已串接的 AI 影片模型


本指南中的規格、定價與能力資訊已於 2026-08-01 經過驗證,來源包括 MiniMax 官方部落格MiniMax 平台文件OpenRouterVercel AI GatewayEvoLink。模型卡與費率卡變動快速,產出前請務必在你使用的路徑上確認即時數值。

继续浏览中,生成器即将加载...