MiniMax H3: o guia completo do modelo de vídeo open-weight em 2K
O MiniMax H3 é o modelo de vídeo multimodal open-weight de propósito geral da MiniMax. Ele gera vídeo nativo em 2K a 2560×1440 com áudio estéreo sincronizado em uma única passagem, aceita até 12 referências multimodais (texto, imagens, vídeo e áudio) e é distribuído com pesos abertos para auto-hospedagem. A MiniMax o comercializa por aproximadamente um terço do preço de modelos de vídeo de fronteira comparáveis: US$ 0,09 por segundo em 768p e US$ 0,13 por segundo em 2K nativo nos gateways padrão (OpenRouter, Vercel AI Gateway, EvoLink).
Esta página pilar consolida a ficha técnica verificada, os preços, os caminhos de acesso à API, o guia de redação de prompts e as limitações, para que os produtores possam decidir onde o H3 se encaixa em um fluxo de trabalho real. Para o gerador operacional, use a rota PixMind MiniMax H3. Gerador online de MiniMax H3
Pontos principais
- Produz 2K nativo (2560×1440) a 24 FPS em clipes de 5 a 15 segundos, com áudio estéreo nativo sincronizado gerado na mesma passagem da imagem.
- Uma única geração aceita texto mais até 9 imagens de referência, 3 vídeos de referência e 3 clipes de áudio de referência, totalizando 12 referências.
- O preço em gateways de terceiros é de aproximadamente US$ 0,13 por segundo em 2K e US$ 0,09 por segundo em 768p, cerca de um terço dos modelos de fronteira comparáveis, segundo as tabelas de tarifas da OpenRouter, Vercel AI Gateway e EvoLink.
- Os pesos são abertos para auto-hospedagem, lançados por etapas conforme a região.
- O consenso de revisores independentes no Reddit descreve o H3 como alcançando aproximadamente 98% da qualidade da classe Seedance, com forte consistência temporal e renderização precisa de texto integrado à imagem.
O que é o MiniMax H3?
O MiniMax H3 é um modelo de vídeo multimodal open-weight baseado em transformadores, da MiniMax, o laboratório de IA fundado em Pequim. É a terceira geração dos modelos de vídeo de fronteira da empresa.
O traço definidor do modelo é a unificação. Em vez de modelos separados de texto para vídeo, imagem para vídeo, áudio e edição, o H3 ingere texto, imagens, vídeo de referência e áudio de referência em uma única janela de contexto, gera a imagem e produz som estéreo sincronizado na mesma passagem. Diálogos, efeitos sonoros e áudio ambiente são todos gerados com os quadros em vez de dublados depois. (Blog oficial da MiniMax, "MiniMax H3"; documentação da plataforma MiniMax)
O MiniMax H3 em ação: exemplos reais de geração
Antes da ficha técnica, veja o que o modelo realmente produz. O vídeo abaixo é um passo a passo completo do MiniMax H3 que leva um único prompt pelo pipeline até um clipe finalizado, o que é a maneira mais rápida de ver o que o 2K nativo e as referências multimodais do H3 entregam na prática.
A MiniMax lançou o H3 como uma versão open-weight com 2K nativo, áudio estéreo no pipeline e o orçamento de 12 referências multimodais, que é o conjunto de capacidades que o tutorial acima exercita de ponta a ponta.
Anúncio oficial de lançamento do MiniMax H3
Especificações técnicas principais
A ficha técnica do H3 é construída em torno da fidelidade nativa em vez de uma saída redimensionada. Os números principais abaixo vêm do blog oficial e da documentação da API da MiniMax, e são corroborados pelas fichas de modelo publicadas pela OpenRouter, Vercel AI Gateway e EvoLink.
| Especificação | Valor |
|---|---|
| Resolução nativa | 2560×1440 (2K) |
| Taxa de quadros | 24 FPS |
| Duração do clipe | 5 a 15 segundos |
| Áudio | Estéreo nativo sincronizado, gerado no pipeline |
| Imagens de referência | Até 9 |
| Vídeos de referência | Até 3 |
| Áudios de referência | Até 3 |
| Total de referências por geração | Até 12, combinadas com o texto |
| Proporções de aspecto | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 |
| Pesos | Open-weight, lançamento regional por etapas |
| Edição | Revisões conversacionais, baseadas em instruções, sobre um clipe gerado |
A saída 2K nativa é a distinção significativa. Muitos modelos de vídeo que anunciam "2K" ou "4K" o fazem por meio de um redimensionamento posterior, que afia as bordas mas não consegue sintetizar detalhes que o modelo nunca produziu. O H3 renderiza a 2560×1440 dentro do modelo, de modo que texturas finas, cabelos, tecidos e textos pequenos sobrevivem no tamanho de entrega sem uma etapa extra de upscaling. (Blog oficial da MiniMax)
Lançamento open-weight e auto-hospedagem
O H3 é lançado como um modelo open-weight, o que o separa das linhas de fronteira fechadas do Google (Veo) e da maioria das ferramentas fechadas de vídeo para consumidores. Pesos abertos significam que uma organização com capacidade de GPU suficiente pode hospedar o modelo em sua própria infraestrutura, auditá-lo, fazer ajuste fino e evitar taxas de API por segundo.
O lançamento é por etapas. A MiniMax confirmou a disponibilidade open-weight, mas distribui os pesos por região, sujeitos às regulamentações locais e às condições de licenciamento. Quem planeja fazer auto-hospedagem deve tratar os canais oficiais da MiniMax como a fonte de verdade para a disponibilidade atual em sua jurisdição, em vez de depender de mirrors de terceiros. (Blog oficial da MiniMax)
A conclusão prática: equipes que precisam de latência garantida, residência de dados ou previsibilidade de custo a longo prazo podem se planejar para auto-hospedagem assim que os pesos estiverem disponíveis em sua região. Equipes que só precisam produzir vídeo hoje devem usar a API hospedada ou um gateway como PixMind, OpenRouter, Vercel AI Gateway ou EvoLink.
Entrada multimodal: como funciona o sistema de 12 referências
O sistema de entrada do H3 é a parte que mais vale a pena entender antes de escrever um prompt. Uma única geração pode combinar:
- Um prompt de texto com direção de cena.
- Até 9 imagens de referência (incluindo primeiro quadro, último quadro, identidade de personagem, produto, guarda-roupa ou referências de estilo).
- Até 3 vídeos de referência (para linguagem de movimento, ritmo ou performance).
- Até 3 clipes de áudio de referência (para voz, clima musical ou ritmo do design de som).
São 12 referências além do prompt de texto em um único contexto. (Documentação da plataforma MiniMax)
Cada referência deve ter uma única função. O modo de falha mais comum com modelos multimodais é fornecer referências conflitantes: duas imagens de personagem com identidades diferentes, ou um vídeo de referência de movimento que contradiz o primeiro e o último quadro. Trate cada um dos 12 slots como um controle de propósito único. Uma imagem fixa a identidade do personagem, outra fixa o guarda-roupa, outra fixa a geometria do produto, um vídeo de referência fornece o ritmo de movimento, um áudio de referência fornece o pacing.
Este também é o lugar certo para usar a edição conversacional do H3. Depois que um clipe é gerado, você pode instruir revisões de personagens, objetos, cenários, som ou ritmo sem reconstruir toda a cena do zero.
Saída 2K nativa e áudio estéreo sincronizado
A combinação de imagem 2K nativa e áudio estéreo no pipeline é o maior motivo para considerar o H3 em relação à geração anterior da MiniMax.
Do lado da imagem, 2K nativo significa que o modelo renderiza 2560×1440 pixels de detalhe real. Fios de cabelo, textura de pele, letras pequenas em embalagens e pequenos elementos de interface em planos do tipo screencast se sustentam no tamanho completo de entrega. A taxa de 24 quadros por segundo corresponde a trabalhos de cinema e comerciais de alto padrão, em vez dos 30 FPS que servem para entrega apenas social.

Do lado do áudio, o H3 gera diálogos, efeitos sonoros e som ambiente na mesma passagem da imagem, e os sincroniza com os quadros. Isso elimina a etapa de locução e foley em pós-produção que os pipelines fechados sem áudio exigem. Um personagem falando na câmera tem movimento labial e voz gerados juntos; um copo batendo em uma mesa tem o som de impacto gerado com o contato visual. (Blog oficial da MiniMax)
A limitação a ter em mente: qualquer áudio gerado, especialmente diálogos, ainda precisa de revisão humana para redação, pronúncia, ritmo e artefatos antes da publicação.
Preços do MiniMax H3 entre provedores
O preço do H3 é uma de suas maiores vantagens competitivas. Entre os principais gateways de terceiros, as tabelas de tarifas se agrupam em US$ 0,13 por segundo para saída 2K nativa e US$ 0,09 por segundo para saída 768p. Os totais abaixo são calculados diretamente dessas taxas por segundo.
| Saída | Taxa | Clipe de 5 segundos | Clipe de 10 segundos | Clipe de 15 segundos |
|---|---|---|---|---|
| 2K nativo (2560×1440) | ~US$ 0,13/seg | ~US$ 0,65 | ~US$ 1,30 | ~US$ 1,95 |
| 768p | ~US$ 0,09/seg | ~US$ 0,45 | ~US$ 0,90 | ~US$ 1,35 |
Essas taxas são publicadas na OpenRouter, Vercel AI Gateway e EvoLink, e são consistentes com a superfície de preços da própria plataforma da MiniMax. (OpenRouter; Vercel AI Gateway; EvoLink; Plataforma MiniMax)
A MiniMax posiciona a tabela de tarifas em aproximadamente um terço dos modelos de vídeo de fronteira comparáveis. Para fluxos de trabalho de produção de alto volume (campanhas sociais, criativos multivariados de anúncios, pré-visualização), essa diferença de preço se acumula rapidamente. Um estúdio que renderiza 1.000 clipes 2K de 15 segundos paga da ordem de US$ 1.950 no H3, contra materialmente mais em uma rota de fronteira de preço mais alto no mesmo volume.
API MiniMax e caminhos de integração
Existem quatro maneiras práticas de acessar o H3, cada uma adequada a um tipo diferente de usuário.
1. Gerador PixMind (sem código). O caminho mais rápido para produtores que querem uma interface funcional sem escrever código. Abra o gerador PixMind MiniMax H3, carregue referências, escreva um prompt, escolha duração e proporção de aspecto, e renderize. Gerador online de MiniMax H3
2. API da plataforma MiniMax (direta). Desenvolvedores que querem a superfície canônica de API podem chamar a MiniMax diretamente por meio de platform.minimax.io. Esta é a fonte de verdade para novos recursos, suporte a parâmetros e mudanças de preço, mas exige configuração de conta MiniMax, KYC quando aplicável e trabalho de integração. (Documentação da plataforma MiniMax)
3. Gateways agregadores (OpenRouter, Vercel AI Gateway, EvoLink). Eles expõem o H3 por meio de uma superfície unificada de cobrança e SDK ao lado de outras famílias de modelos. São a escolha certa quando você quer uma única integração para vários modelos de vídeo, ou quando seu aplicativo já fala o protocolo do gateway. As taxas podem incluir uma pequena margem do gateway. (OpenRouter; Vercel AI Gateway; EvoLink)
4. Pesos auto-hospedados. Assim que os pesos abertos estiverem disponíveis em sua região, você pode executar o H3 em suas próprias GPUs. Isso elimina as taxas por segundo, mas transfere o custo para hardware, operações e infraestrutura de inferência. É a escolha certa apenas para equipes com volume sustentado ou requisitos rigorosos de residência de dados.
Para a maioria dos leitores, o ponto de partida certo é o gerador sem código da PixMind ou uma integração por gateway. Mude para acesso direto à API da MiniMax quando precisar de parâmetros que os gateways não expõem, e mude para auto-hospedagem apenas quando a matemática do volume justificar a sobrecarga operacional.
Como o H3 se compara à geração anterior da MiniMax e a outros modelos de vídeo
O H3 é um salto geracional em relação à geração anterior da MiniMax e uma alternativa significativa a outros modelos de vídeo de fronteira em preço. Os pontos de comparação abaixo usam as declarações oficiais de capacidade da MiniMax para o H3, a geração anterior da MiniMax documentada publicamente e as tabelas de tarifas publicadas citadas antes.
MiniMax H3 vs. a geração anterior da MiniMax
A geração anterior da MiniMax produzia vídeo em 768p ou 1080p sem áudio nativo e com uma superfície de entrada de texto mais imagem. O H3 adiciona 2K nativo, áudio estéreo sincronizado, referência multimodal completa (imagem mais vídeo mais áudio), edição conversacional durante a geração e pesos abertos. Para quem já está no produto oficial, o H3 é um superconjunto estrito no papel e o padrão certo assim que estiver disponível em sua rota.
MiniMax H3 vs. Seedance 2.5 e Veo 3.1
O consenso de revisores independentes no Reddit descreve o H3 como alcançando aproximadamente 98% da qualidade da classe Seedance, com consistência temporal particularmente forte e renderização de texto integrado à imagem efetivamente perfeita. A lacuna restante aparece mais no nível superior de realismo cinematográfico e em interações físicas complexas.
O compromisso é o preço. A tabela de tarifas 2K do H3 fica em aproximadamente um terço dos modelos de fronteira comparáveis, o que o torna a escolha padrão para trabalhos de alto volume em que a diferença marginal de qualidade não justifica um gasto de 3x. Para planos hero de campanha em que o pico de realismo é o briefing inteiro, Seedance 2.5 ou Veo 3.1 ainda podem ser a melhor escolha.
MiniMax H3 vs. Kling 3.0 Turbo e PixVerse V6
Kling 3.0 Turbo e PixVerse V6 competem em velocidade e amplitude de formatos sociais em vez de fidelidade 2K nativa. O H3 é a escolha mais forte para trabalhos cinematográficos e de campanha; Kling Turbo e PixVerse V6 continuam relevantes para iteração rápida em clipes curtos para redes sociais, especialmente quando áudio nativo não é necessário.
Comparar todos os modelos de vídeo conectados
Consenso no Reddit e na comunidade
O consenso inicial de revisores independentes sobre o H3, extraído de threads no Reddit em r/LocalLLaMA, r/aivideo e comunidades adjacentes, pode ser resumido em três pontos:
- A qualidade está perto da fronteira. Revisores colocam o H3 em aproximadamente 98% da qualidade da classe Seedance, com a lacuna concentrada no topo do fotorrealismo e na física complexa.
- A consistência temporal é um diferencial real. Personagens, objetos e cenários se mantêm coesos entre os quadros melhor do que na geração anterior da MiniMax.
- A renderização de texto está efetivamente resolvida. Texto integrado à imagem, que tem sido um modo de falha persistente de modelos de vídeo, é renderizado de forma limpa na maioria das saídas do H3.
Os comentários no Reddit não substituem o benchmarking com seus próprios prompts de teste, mas são uma leitura direcional útil. Trate o número de "98% da qualidade do Seedance" como uma abreviação da comunidade, não como uma medição.
Um guia de redação de prompts para o MiniMax H3
O H3 recompensa diretores em vez de descritores. Trate cada geração como um plano com uma única função e use os 12 slots de referência como controles precisos.
Ancore as invariantes primeiro
Antes de escrever prosa, decida quais elementos não devem mudar ao longo do clipe. Chame-os explicitamente no prompt: identidade do personagem, geometria do produto, paleta de cores, guarda-roupa, posicionamento de rótulo, composição. As referências que codificam essas invariantes devem ter cada uma uma única função.
Uma ação principal, um movimento de câmera
Clipes curtos ficam mais claros quando uma ação do sujeito e um movimento de câmera carregam a ideia visual. Empilhar três transformações em um clipe de 5 segundos obriga o modelo a passar rápido por cada uma, o que é a principal causa de flicker.
Escreva o áudio no plano
Como o H3 gera áudio na mesma passagem, descreva o som junto à ação que o produz. Especifique diálogos (entre aspas), a textura do ambiente e onde o silêncio intencional se encontra. Não deixe o áudio implícito.
Quatro pontos de partida de prompt
- Filme cinematográfico de produto: "Plano hero premium do [produto] sobre a [superfície]. A câmera executa um [movimento] lento. Iluminação: [clima]. Preserve proporções, materiais e posicionamento de rótulo exatos. Áudio: [textura] sutil, sem música, sem locução. Termine em um quadro hero limpo."
- Cena de diálogo com personagem: "Um [tamanho de plano] do [personagem] em [local]. Ele diz: '[fala curta]'. Tom de ambiente natural, [som ambiente], sincronização labial realista. Câmera: [movimento]. Iluminação: [clima]."
- Transição do primeiro ao último quadro: "Mova naturalmente do primeiro quadro fornecido para o último quadro fornecido. O sujeito [ação]. A câmera segue [trajetória] em [ritmo]. Preserve identidade, guarda-roupa e ambiente do início ao fim."
- Bloqueio por referência multimodal: "Use a imagem de referência 1 para identidade do personagem, a imagem de referência 2 para guarda-roupa e o vídeo de referência 1 para o ritmo de movimento. O áudio de referência 1 define voz e pacing. O sujeito executa [ação] em [cenário]."
Modelos de prompt e galeria de pontos de partida do MiniMax H3
Melhores casos de uso para o MiniMax H3
O H3 se encaixa de forma limpa em fluxos de trabalho em que fidelidade 2K nativa, áudio sincronizado ou controle por referência multimodal importam mais do que o custo por segundo mais baixo possível.

- Comerciais cinematográficos e filmes hero de produto. 2K nativo mais áudio estéreo significa que uma única geração do H3 pode entregar um plano quase finalizado sem uma etapa separada de pós-produção de áudio.
- Cenas conduzidas por diálogo. A combinação de movimento labial gerado, voz e som ambiente em uma única passagem torna o H3 adequado para trabalhos narrativos curtos e conduzidos por personagens.
- Continuidade de campanha conduzida por referência. O orçamento de 12 referências permite carregar um personagem, um produto, um guarda-roupa e uma linguagem de movimento por vários planos de campanha.
- Criativo multivariado de alto volume. A aproximadamente um terço do preço de fronteira, o H3 é a ferramenta certa para produzir muitas variantes de uma direção criativa para testes A/B e entrega por plataforma.
- Pipelines de pré-visualização e previz. Pesos abertos e baixo custo de API tornam o H3 viável para estúdios que querem gerar grandes volumes de previz sem pressão de orçamento por plano.
Limitações e ressalvas
Um guia crível nomeia as coisas que o H3 não faz bem.
- O áudio ainda precisa de revisão. Diálogos, vozes e efeitos gerados exigem revisão humana para redação, pronúncia, ritmo e artefatos antes da publicação.
- A interação física complexa pode se desviar. Mãos, contato, rotações rápidas, oclusão e interações intrincadas de objetos continuam difíceis para a classe de modelos como um todo, não apenas para o H3.
- Identidade e detalhes de marca precisam de verificação. Rostos, logotipos, geometria de produto, texto na tela e personagens licenciados exigem revisão final de direitos e precisão.
- A disponibilidade de pesos é regional. Os pesos abertos são lançados em etapas; confirme o status atual com os canais oficiais da MiniMax antes de se comprometer com um plano de auto-hospedagem.
- A capacidade e o preço mudam. Fichas de modelo e tabelas de tarifas mudam rápido. Verifique o gerador ativo em sua rota para os parâmetros e preços em vigor quando você for produzir.
Perguntas frequentes sobre o MiniMax H3
O MiniMax H3 é open-weight?
Sim. A MiniMax anunciou o H3 como um modelo open-weight. Os pesos são lançados por etapas por região e estão sujeitos à regulamentação local, então confirme a disponibilidade atual em sua jurisdição pelos canais oficiais da MiniMax antes de planejar uma implantação auto-hospedada. (Blog oficial da MiniMax)
Quanto custa o MiniMax H3?
Nos principais gateways de terceiros (OpenRouter, Vercel AI Gateway, EvoLink) e na plataforma MiniMax, o H3 tem preço de aproximadamente US$ 0,13 por segundo para saída 2K nativa e US$ 0,09 por segundo para saída 768p. Um clipe 2K de 15 segundos custa cerca de US$ 1,95; um clipe 768p de 15 segundos custa cerca de US$ 1,35. A MiniMax posiciona isso em aproximadamente um terço do preço de modelos de vídeo de fronteira comparáveis. (OpenRouter; Vercel AI Gateway; EvoLink; Plataforma MiniMax)
Qual resolução, taxa de quadros e duração o H3 suporta?
O H3 produz vídeo nativo em 2K a 2560×1440 e 24 FPS, em clipes de 5 a 15 segundos. Suporta as proporções de aspecto 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16. (Blog oficial da MiniMax; Documentação da plataforma MiniMax)
O MiniMax H3 gera áudio?
Sim. O H3 gera áudio estéreo nativo sincronizado (diálogos, efeitos sonoros e som ambiente) na mesma passagem da imagem, então não há etapa separada de locução ou foley. Os diálogos ainda devem ser revisados quanto a redação, ritmo e artefatos antes da publicação.
Quais entradas o MiniMax H3 aceita?
Uma única geração aceita um prompt de texto mais até 9 imagens de referência, 3 vídeos de referência e 3 clipes de áudio de referência, totalizando 12 referências. O controle de primeiro e último quadro é suportado por meio dos slots de imagem. (Documentação da plataforma MiniMax)
Posso auto-hospedar o MiniMax H3?
Sim, assim que os pesos abertos estiverem disponíveis em sua região. A auto-hospedagem elimina as taxas de API por segundo, mas exige capacidade de GPU, infraestrutura de inferência e propriedade operacional. Para a maioria das equipes, a API hospedada ou um gateway como a PixMind é o ponto de partida certo.
Como o H3 se compara ao Seedance 2.5 e ao Veo 3.1?
O consenso de revisores independentes no Reddit coloca o H3 em aproximadamente 98% da qualidade da classe Seedance, com forte consistência temporal e renderização precisa de texto integrado à imagem. A lacuna restante aparece no topo do fotorrealismo e na interação física complexa. A vantagem do H3 é o preço: sua tabela de tarifas 2K fica em aproximadamente um terço dos modelos de fronteira comparáveis, o que o torna o padrão para trabalhos de alto volume.
Onde posso gerar vídeos do MiniMax H3?
O caminho sem código mais rápido é o gerador PixMind MiniMax H3. Desenvolvedores também podem chamar a API da plataforma MiniMax diretamente em platform.minimax.io, ou integrar por meio da OpenRouter, Vercel AI Gateway ou EvoLink. Abra o gerador do H3
Como devo escrever prompts para o MiniMax H3?
Trate cada geração como um plano com uma ação principal e um movimento de câmera. Ancore as invariantes (identidade, produto, guarda-roupa, paleta, composição) primeiro, atribua a cada um dos 12 slots de referência uma única função, e escreva o som (diálogo, ambiente, silêncio) no prompt junto à ação que o produz. Veja o guia de redação de prompts acima para modelos de ponto de partida.
Posso usar clipes gerados pelo H3 comercialmente?
Eles são adequados para a maioria dos projetos comerciais, mas rostos, logotipos de marca, geometria de produto, texto na tela e personagens licenciados exigem revisão final de direitos e precisão. Garanta que você detenha os direitos de quaisquer pessoas reais ou ativos de referência de terceiros que você forneça ao modelo.
Conclusão: onde o H3 se encaixa na sua pilha
O MiniMax H3 é o modelo a ser usado por padrão quando você precisa de fidelidade 2K nativa, áudio sincronizado ou controle por referência multimodal em um preço que sobrevive a alto volume de produção. Não é o único modelo que vale a pena usar: Seedance 2.5 e Veo 3.1 ainda vencem no topo do realismo cinematográfico, e rotas mais rápidas como Kling 3.0 Turbo continuam úteis para iteração rápida em redes sociais. Mas para o meio amplo do mercado, onde o padrão de qualidade é alto e o orçamento é real, a combinação do H3 de pesos abertos, entrada multimodal de 12 referências, 2K nativo, áudio estéreo no pipeline e preço aproximadamente de um terço da fronteira o torna o padrão prático.
O próximo passo é executá-lo em seus próprios prompts. Abra o gerador PixMind MiniMax H3, carregue uma ou duas referências que ancoram identidade e produto, escreva um plano com um movimento de câmera, e compare a saída com seu modelo atual. Gerador MiniMax H3 Navegue por todos os modelos de vídeo IA conectados
Especificações, preços e capacidades neste guia foram verificados em 2026-08-01 junto ao blog oficial da MiniMax, à documentação da plataforma MiniMax, à OpenRouter, ao Vercel AI Gateway e à EvoLink. Fichas de modelo e tabelas de tarifas mudam rápido; sempre confirme os valores ativos em sua rota antes de produzir.


