Alternativas ao FLUX 3: 8 modelos que dá para comprar hoje
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edição August 4, 2026

Por que isso é uma pergunta de compra
Passo meu tempo estudando como a intenção de busca se traduz em uma decisão de compra real, e "FLUX 3 alternatives" é um dos exemplos mais claros que vi este ano. Ninguém digita isso porque acha o FLUX 3 ruim. As pessoas digitam porque leram o anúncio, foram procurar o endpoint e encontraram um formulário.
Aqui está a escada de lançamento como a Black Forest Labs a descreveu, e onde cada degrau realmente está.

Quatro capacidades anunciadas, zero preços publicados. O vídeo está em acesso antecipado atrás de um formulário de solicitação. A previsão de ação está limitada a parceiros selecionados. A geração de imagens foi descrita como algo que chegaria nas semanas seguintes. O backbone de pesos abertos não tem data alguma.
Isso não é uma crítica à pesquisa em si. É um fato de cronograma, e se você vai lançar algo neste trimestre, é ele quem decide a questão por você. A mesma distinção aparece quando equipes avaliam modelos de IA personalizados de forma geral: a demo e o SKU são artefatos diferentes, e só um deles tem data de lançamento.
A lista curta, lado a lado
Cada preço abaixo vem da tabela do próprio fornecedor, conferida em 4 de agosto de 2026. A coluna de vídeo é um clipe de dez segundos em 720p, porque essa é a especificação nos testes de preferência publicados do FLUX 3.
| Modelo | Melhor para | 10s a 720p | Áudio nativo | Preço da imagem | Res. máx. de vídeo | Pesos abertos | Como comprar | Preço publicado |
|---|---|---|---|---|---|---|---|---|
| Veo 3.1 Lite | Vídeo com áudio nativo mais barato | $0.50 | Sim | $0.067 (Nano Banana 2, 1K) | 1080p | Não | API do Gemini, pague conforme o uso | Sim |
| Sora 2 | Volume em lote | $1.00 ($0.50 em lote) | Sim | $30/1M tokens de saída | 1080p (Pro) | Não | API da OpenAI | Sim |
| Luma Ray 3.2 | Controle por keyframes, HDR e EXR | $0.90 | Não informado | Uni-1.1, tarifa não publicada | 1080p | Não | Por clipe, sem compromisso | Sim |
| Kling 3.0 Omni | Edição com vídeo de entrada e áudio | $1.12 | Sim | $0.0035/pacote de unidades | 4K | Não | Unidades pré-pagas, piso de $700 | Sim |
| Grok Imagine 1.5 | Vídeo guiado por áudio | $1.40 | Entrada de áudio | $0.02/img | 1080p | Não | API da xAI | Sim |
| Seedance 2.0 | Estética cinematográfica, 4K | $1.50 | Não informado | Não aplicável | 4K | Não | BytePlus ModelArk | Sim |
| Runway Gen-4.5 | Uma API, vários modelos | Baseado em créditos | Depende do modelo | Gen-4 Image em créditos | 1080p | Não | Planos de crédito a partir de $15/mês | Parcialmente |
| FLUX.2 [pro] | Continuar na Black Forest Labs | Só imagens | Não aplicável | $0.03 no primeiro MP | Não aplicável | Sim (dev, klein) | Pague conforme o uso | Sim |
| FLUX 3 | Nada ainda | Não publicado | Sim | Não publicado | Não publicado | Anunciado, sem data | Formulário de solicitação | Não |
Duas coisas saltam dessa tabela. Primeiro, todo o setor tem um número, exceto o modelo pelo qual você veio até aqui. Segundo, a diferença entre o vídeo com áudio nativo mais barato e o mais caro é de oito vezes, o que significa que a escolha é uma decisão de orçamento muito antes de ser uma decisão de gosto.

O que um clipe realmente custa
Tarifas por segundo são como os fornecedores cotam, e os totais por clipe são como o financeiro lê. Escolha uma especificação e o número real aparece.
Custo de um clipe gerado
Preços de tabela dos fornecedores, conferidos em 4 de agosto de 2026. Escolha a especificação que você realmente vai usar.
| Modelo | 5s a 720p | Áudio |
|---|---|---|
| Veo 3.1 Lite | $0.25 | Nativo |
| Luma Ray 3.2 | $0.30 | Não informado |
| Sora 2 | $0.50 | Nativo |
| Veo 3.1 Fast | $0.50 | Nativo |
| Kling 3.0 Omni | $0.56 | Nativo |
| Grok Imagine 1.5 | $0.70 | Entrada de áudio |
| Seedance 2.0 | $0.76 | Não informado |
| Veo 3.1 Standard | $2.00 | Nativo |
| FLUX 3 Video | Não publicado | Nativo |
| Modelo | 10s a 720p | Áudio |
|---|---|---|
| Veo 3.1 Lite | $0.50 | Nativo |
| Luma Ray 3.2 | $0.90 | Não informado |
| Sora 2 | $1.00 | Nativo |
| Veo 3.1 Fast | $1.00 | Nativo |
| Kling 3.0 Omni | $1.12 | Nativo |
| Grok Imagine 1.5 | $1.40 | Entrada de áudio |
| Seedance 2.0 | $1.50 | Não informado |
| Veo 3.1 Standard | $4.00 | Nativo |
| FLUX 3 Video | Não publicado | Nativo |
| Modelo | 5s a 1080p | Áudio |
|---|---|---|
| Veo 3.1 Lite | $0.40 | Nativo |
| Veo 3.1 Fast | $0.60 | Nativo |
| Kling 3.0 Omni | $0.70 | Nativo |
| Luma Ray 3.2 | $1.20 | Não informado |
| Grok Imagine 1.5 | $1.25 | Entrada de áudio |
| Seedance 2.0 | $1.87 | Não informado |
| Veo 3.1 Standard | $2.00 | Nativo |
| Sora 2 Pro | $3.50 | Nativo |
| FLUX 3 Video | Não publicado | Nativo |
| Modelo | 10s a 1080p | Áudio |
|---|---|---|
| Veo 3.1 Lite | $0.80 | Nativo |
| Veo 3.1 Fast | $1.20 | Nativo |
| Kling 3.0 Omni | $1.40 | Nativo |
| Grok Imagine 1.5 | $2.50 | Entrada de áudio |
| Luma Ray 3.2 | $3.60 | Não informado |
| Seedance 2.0 | $3.70 | Não informado |
| Veo 3.1 Standard | $4.00 | Nativo |
| Sora 2 Pro | $7.00 | Nativo |
| FLUX 3 Video | Não publicado | Nativo |
Os números do Luma Ray 3.2 são os preços próprios por clipe para saída SDR, e o HDR os dobra. Os números de cinco segundos do Seedance 2.0 são os exemplos publicados pela BytePlus; os de dez segundos aplicam a mesma tarifa por segundo. O Sora 2 não tem nível 1080p, então o Sora 2 Pro entra no lugar. Todo o resto é a tarifa por segundo do fornecedor multiplicada pela duração.
Google Veo 3.1 e Nano Banana 2
Melhor para equipes que querem vídeo com áudio nativo pela tarifa publicada mais baixa.
Este é o caso desconfortável para o FLUX 3, porque o Gemini Omni Flash é justamente onde o próprio teste de preferência do fornecedor cai em 52%. Um empate de moeda contra a família de modelos cujo nível de áudio mais barato roda a cinco centavos por segundo não é um lugar confortável para se lançar.
A tabela de preços do Veo 3.1 tem três níveis, todos cotados por segundo e todos com áudio por padrão. O Lite custa $0,05 em 720p e $0,08 em 1080p. O Fast custa $0,10 e $0,12. O Standard é fixo em $0,40 para os dois, e $0,60 em 4K.
O lado de imagem da mesma API é cobrado por token e sai em $0,067 por uma imagem Nano Banana 2 em 1K. A variante Lite fica em $0,0336, e o Nano Banana Pro em $0,134 para o mesmo tamanho.
Onde tem limitações. O Veo 3.1 é um modelo em preview, algo que o Google admite abertamente que pode mudar antes de estabilizar, e vem com limites de taxa mais rígidos. Não há nível gratuito para nenhuma geração do Veo. A busca com grounding é cobrada separadamente a $14 por 1.000 solicitações após a cota mensal compartilhada.
O que custa. $0,50 pelo clipe de dez segundos em 720p no Lite, $4,00 no Standard. Essa diferença interna de oito vezes é a decisão real dentro da família Veo, não a escolha entre Veo e qualquer outra coisa.
Veredito. Se o preço por segundo utilizável é sua restrição, comece aqui e pare de procurar. A análise do Nano Banana 2 aprofunda mais no lado de imagem.
OpenAI Sora 2
Melhor para trabalho de alto volume que tolera fila de espera.
O Sora 2 custa $0,10 por segundo em 720p, e este é o único lugar no setor onde um desconto por lote é publicado: a mesma geração cai para $0,05 por segundo no modo batch, empatando com o Veo 3.1 Lite como o clipe de dez segundos mais barato do quadro. O Sora 2 Pro adiciona resolução, a $0,30 por segundo em 720p, $0,50 em 1024p e $0,70 em 1080p.
Onde tem limitações. O Sora 2 padrão vai até 720p, então qualquer trabalho em 1080p obriga a migrar para o Pro e mais ou menos triplica a tarifa. O modo batch troca latência pelo desconto, o que o exclui de qualquer uso interativo.
O que custa. $1,00 pelo clipe de dez segundos em 720p padrão, $0,50 em batch, $7,00 no Pro em 1080p.
Veredito. A opção com melhor custo-benefício para trabalho de pipeline onde nada está esperando a renderização. O Sora também tem a maior superfície de integrações do grupo, o que explica por que existem tantas páginas de integração com o Sora 2.
Luma Ray 3.2 e Uni-1.1
Melhor para cenas que precisam de direção em vez de um único prompt.
A Luma levou a maior surra nas avaliações do FLUX 3, com 93% dos avaliadores preferindo o FLUX 3. Também é o único fornecedor aqui que vende controle em nível de quadro como seu diferencial principal: o Multi-Keyframe permite até 16 keyframes dentro de um único clipe, o video-to-video vai até 20 segundos, e o modelo traz geração HDR nativa mais exportação EXR de 16 bits, para que a saída componha ao lado de tomadas reais.
Onde tem limitações. A Luma cobra por clipe em vez de por segundo, e a curva é íngreme. Um clipe de cinco segundos em 720p custa $0,30, mas dez segundos custam $0,90, então a segunda metade do clipe custa o dobro da primeira. O HDR dobra o preço e o HDR com EXR o triplica. O pagamento por uso vem com limites de taxa e nenhum SLA de latência, e as tarifas de imagem do Uni-1.1 nem aparecem na página pública.
O que custa. $0,30 por cinco segundos em 720p, $0,90 por dez. Em 1080p isso vira $1,20 e $3,60.
Veredito. A melhor escolha quando você precisa dirigir uma cena em vez de apostar na sorte, e a pior escolha se seus clipes forem longos. A página de preços da Luma tem a tabela completa, e o especial de alternativas à Luma cobre o resto.
Kling 3.0 Omni
Melhor para editar vídeo já existente com áudio em uma única passagem.
A Kling já ultrapassou a versão que a Black Forest Labs usou no benchmark. A tabela do FLUX 3 cita o Kling v3 Pro em 60%, enquanto a documentação atual da API oferece Kling 3.0, 3.0 Turbo e 3.0 Omni. O Omni é o interessante, porque cobra o vídeo de entrada como um modo de primeira classe, não como um extra.
Onde tem limitações. Este é o único fornecedor do grupo com uma barreira de entrada real. Você compra pacotes de unidades pré-pagas, o menor pacote de vídeo custa $700 por 5.000 unidades, e todo pacote tem validade de 180 dias, sem acúmulo e sem extensão. A concorrência é limitada a 20 nos pacotes padrão. Não há como gastar $5 para testar.
O que custa. Uma unidade custa $0,14 na tabela. O Omni com áudio nativo e sem vídeo de entrada custa 0,8 unidade por segundo em 720p, ou seja, $1,12 por dez segundos. Adicionar vídeo de entrada sobe para 0,9 unidade por segundo. O 4K custa 3,0 unidades por segundo, ou $0,42, em qualquer modo.
Veredito. Modelo forte, formato comercial complicado para um primeiro teste. Se o piso de $700 é o obstáculo, os preços da Kling têm pacotes de imagem menores a $350, e a página de análises da Kling cobre como ela se sai na prática.
Runway Gen-4.5 e Aleph 2.0
Melhor para uma única integração que alcança vários modelos.
A Runway perdeu seu confronto direto com o FLUX 3 em 77%, e responde a isso da forma mais prática possível: revende a concorrência. A lista de modelos da API da Runway agora serve gen4.5, aleph2, seedance2 em três tamanhos e gpt-image-2 a partir de uma única superfície, e os planos de crédito incluem imagens do Nano Banana Pro. Uma chave, quatro laboratórios.
Onde tem limitações. A Runway é o único fornecedor aqui que não publica uma tarifa direta de API por segundo. Tudo passa por créditos, então você precifica por equivalência: o plano de $15 são 625 créditos, que a Runway afirma equivalerem a 52 segundos de Gen-4.5, e o plano de $95 são 9.500 créditos, ou 791 segundos. Os créditos acumulam por um mês nos planos intermediários e não acumulam de jeito nenhum no plano de entrada. As gerações do Seedance via Runway têm limite de 15 segundos.
O que custa. $15/mês por 52 segundos de Gen-4.5, ou $95/mês por 791 segundos. A tarifa efetiva por segundo melhora cerca de 2,4 vezes entre esses dois planos, o que torna a escolha do plano a maior alavanca de custo.
Veredito. A escolha pragmática se você prefere integrar uma vez em vez de cinco. O Runway Gen-4.5 tem os detalhes do modelo, e os preços da Runway detalham ainda mais a conta dos créditos.
Seedance 2.0 na BytePlus
Melhor para estética cinematográfica e um caminho publicado até 4K.
O Seedance é o segundo empate de 52% nas avaliações do FLUX 3, e cobra de um jeito diferente de tudo mais aqui. A BytePlus cobra por token, onde a contagem de tokens é uma função da duração, das dimensões de saída e da taxa de quadros. A tarifa por milhão então cai conforme a resolução sobe, de $7,00 em 720p para $4,00 em 4K, o que é o oposto de qualquer outra tabela deste artigo. O clipe ainda custa mais em 4K, porque a contagem de tokens cresce mais rápido do que a tarifa cai.
Onde tem limitações. A cobrança por token é a mais difícil de prever entre todos os fornecedores aqui. Quando a entrada inclui vídeo, limites de consumo mínimo de tokens se aplicam, então edições curtas podem custar mais do que a fórmula sugere. A BytePlus direciona para uma calculadora tipo planilha em vez de uma tabela de tarifas, e a cobrança real só se fecha quando a API retorna sua contagem de tokens.
O que custa. A BytePlus publica exemplos trabalhados, que é a forma honesta de ler isso: um clipe de cinco segundos em 720p custa $0,76, ou $0,15 por segundo. O Fast custa $0,60 e o Mini $0,38 na mesma especificação. Em 1080p, cinco segundos custam $1,87. Adicionar vídeo de entrada amplia um trabalho de dez segundos em 720p para uma faixa de $0,84 a $1,86, dependendo do comprimento da entrada.
Veredito. Estética excelente, com sobrecarga real de previsão. Se você quer o Seedance sem a matemática de tokens, a Runway o revende por créditos.
Grok Imagine 1.5
Melhor para guiar vídeo a partir de áudio que você já tem.
O Grok Imagine perdeu seu confronto direto em 69%, mas tem uma capacidade que ninguém mais nesta tabela anuncia: a ficha do modelo da xAI lista o grok-imagine-video-1.5 indo de texto, imagem e áudio para vídeo. Todos os outros geram o áudio. Este pode usar o seu.
Onde tem limitações. É a opção por segundo em 720p mais cara aqui, a $0,14, cerca do triplo do Veo 3.1 Lite na mesma resolução. A entrada de mídia é cobrada separadamente a $0,01 por imagem. Não há nível de batch.
O que custa. $0,08 por segundo em 480p, $0,14 em 720p, $0,25 em 1080p. As imagens são a pechincha da linha a $0,02, ou $0,05 no modelo de qualidade.
Veredito. Vale o adicional só se a geração guiada por áudio for o objetivo. Fora isso, a página do Grok Imagine cobre onde ele se encaixa, e imagens a $0,02 são difíceis de superar.
FLUX.2, se você quiser continuar com a Black Forest Labs
Melhor para entregar imagens no mesmo fornecedor enquanto o FLUX 3 abre caminho.
A tabela de preços do FLUX.2 é totalmente pública e cobra por megapixel, onde 1 MP equivale a 1024x1024. O [max] custa $0,07 pelo primeiro megapixel e $0,03 por cada adicional. O [pro] custa $0,03 e $0,015. O [klein] 9B custa $0,015 e $0,002, e o [klein] 4B custa $0,014 e $0,001. O [flex] cobra $0,05 fixo por megapixel, sem mínimo por imagem. Imagens de referência contam cada uma como um megapixel completo, e qualquer coisa acima de 4 MP é redimensionada para baixo. A documentação ainda descreve o FLUX.2 como a família recomendada para todos os casos de uso.
Onde tem limitações. Só imagens, então substitui apenas uma das quatro capacidades anunciadas do FLUX 3 e nenhuma parte do vídeo. Em aderência a prompt também fica atrás. Um profissional que mantém um site de benchmark colocou números nisso:
"Flux.2 scored 5, Ideogram4 scored 8, and gpt-image-2 scored 12 out of 15."
O que custa. $0,03 por uma única imagem 1024x1024 no [pro], ou $0,014 no [klein] 4B, que é a imagem mais barata de todo este apanhado.
Veredito. A escolha certa se continuidade com o fornecedor importa mais do que vencer um teste de aderência a prompt. Se não, compare com GPT Image 2 e Midjourney antes de padronizar, e confira os preços do Midjourney ou os preços do Ideogram para o caminho de assinatura.
O que a turma de pesos abertos está realmente dizendo
O FLUX 3 Dev é o degrau com que a maioria das pessoas na thread de lançamento mais se importava, e é o único sem data. Isso deixa a prateleira atual de pesos abertos: FLUX.2 [dev] e [klein], mais as famílias Qwen e Z-Image. Os níveis de licenciamento que existem cobrem apenas [klein] e [dev], começando com um plano Builder limitado a 10.000 imagens por mês em um domínio.
Dois problemas surgiram repetidamente entre quem roda isso localmente. O primeiro é a destilação:
"dev variants are usually cfg distilled which means that directly finetuning isn't as effective."
O segundo é hardware e termos de licença, segundo o mesmo operador que publicou a tabela de pontuações acima, sobre por que o lançamento aberto anterior decepcionou. Os dois motivos citados foram VRAM e velocidade em relação a alternativas lançadas na mesma época, e uma licença que pareceu excessivamente restritiva.
Nem tudo é ceticismo. Um comentarista roda o FLUX.2 dev localmente em uma única RTX 5090 com um upsampler de prompt e prefere usá-lo em vez de modelos proprietários, o que é o contraponto honesto: um modelo que você consegue rodar no seu próprio hardware vence em eixos que um benchmark não mede. Se esse é o seu caminho, a edição de imagem com Qwen é a comparação ao vivo mais próxima, e treinar um modelo de IA cobre o lado do fine-tuning.
Como fazer você mesmo o teste comparativo
Aqui está a parte que mais me importa, porque é o mesmo erro que vejo compradores cometerem com IA de suporte. Uma taxa de preferência do fornecedor é medida com os prompts do próprio fornecedor. "Até 93%" e "52%" vêm da mesma avaliação; o marketing cita o primeiro número e suas renderizações vão cair mais perto do segundo.

- Fixe a especificação antes de tocar em qualquer API. Mesmo prompt, mesma duração, mesma resolução, mesma configuração de áudio em todos os modelos. Metade das comparações que vejo por aí julgam um clipe de 5 segundos em 720p contra um de 10 segundos em 1080p.
- Use seu próprio material e seu próprio briefing. Os carretéis dos fornecedores são tomadas selecionadas. A lista real de planos da sua marca é onde os modelos realmente divergem.
- Precifique o clipe finalizado, não o primeiro. Se um modelo barato precisa de quatro tentativas e um caro precisa de apenas uma, o modelo barato perdeu. Esse é o número que decide.
Já vi exatamente essa disciplina decidir um negócio do nosso próprio lado. Um cliente em potencial fez uma avaliação metódica de 67 testes na nossa IA. As respostas de conhecimento voltaram sólidas e ele visitou a página de cobrança três vezes, o que é um sinal de compra tão forte quanto existe. Depois foi embora, porque o widget de chat estava lento e travava. O que matou o negócio nunca esteve na tabela comparativa de recursos. Nenhuma tabela de taxa de preferência teria revelado isso, e nenhuma demo de fornecedor também. Só os próprios 67 testes deles fizeram isso.
Esse é todo o argumento para fazer seu próprio teste comparativo, e é por isso que eu não escolheria um modelo de vídeo pela tabela de avaliação de um post de lançamento, incluindo o meu. A mesma lógica percorre como pensamos sobre alucinações de IA e limiares de confiança: a falha que você não mediu com seus próprios dados é a que vai para produção.
Para o mecanismo que todos esses modelos compartilham, modelos de difusão explicados é a leitura de fundo. O panorama mais amplo está em as melhores ferramentas de IA generativa.
Se seu motivo para gerar clipes é conteúdo, não cinema, o ponto de entrada prático é automação de blog com IA, e o gerador de roteiro de vídeo com IA cobre a etapa antes da renderização. O que acontece depois está em como adicionar vídeos a posts de blog.
Try eesel
Escolher um modelo de vídeo e escolher uma IA de suporte acabam sendo o mesmo exercício: os dois parecem decididos por um benchmark e, na verdade, são decididos pelo que acontece com seus próprios dados. Essa é a parte que a eesel se recusa a pular.
A eesel reproduz um agente de IA proposto sobre seus tickets reais do passado antes de responder a um único cliente ao vivo, então você vê a taxa de resolução real, as lacunas reais e o custo real por ticket resolvido no seu próprio volume, em vez do conjunto de demonstração de um fornecedor. Ela se conecta ao helpdesk que você já usa, aprende com seu histórico em vez de uma lista de cenários roteirizados, e mostra o número antes de você se comprometer com ele. O mesmo motivo pelo qual o quadro acima está ordenado por preço publicado e não por taxa de preferência: números que você pode conferir vencem números que só te mostram.

Se você já está se perguntando qual modelo pagar, esse é o instinto certo. Faça a mesma pergunta sobre sua pilha de suporte, e comece pela simulação em vez da troca. Experimente a eesel de graça.
O mesmo raciocínio percorre IA generativa para atendimento ao cliente e qual LLM é melhor para suporte. E para um lançamento que realmente publicou sua tabela de preços no primeiro dia, os preços do DeepSeek V4 Flash são o caso contrastante, ao lado do GPT-5.6.
Perguntas frequentes
Quais são as melhores alternativas ao FLUX 3 agora?
Por que eu preciso de uma alternativa ao FLUX 3?
Qual é a alternativa mais barata ao FLUX 3 para vídeo?
O FLUX.2 é uma boa alternativa ao FLUX 3?
Quanto custa uma alternativa ao FLUX 3 por clipe?
Existem alternativas de pesos abertos ao FLUX 3?
Como testar as alternativas ao FLUX 3 antes de decidir?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








