
O que o FLUX 3 realmente é

FLUX 1 e FLUX 2 faziam imagens. O FLUX 3 é um tipo de coisa diferente, e o nome subestima isso.
Ele é treinado conjuntamente em imagem, vídeo e áudio dentro de uma única arquitetura, construída sobre uma abordagem que a Black Forest Labs chama de Self-Flow. O posicionamento da empresa é que cada modalidade é uma projeção com perdas de uma única realidade, então aprender todas juntas impõe restrições que um modelo de modalidade única nunca vê. A frase do post de anúncio que fica na minha cabeça: "o som tem que combinar com o impacto, o movimento tem que obedecer à massa."
Isso é uma afirmação sobre representação, não sobre pixels. É também a mesma afirmação por trás do Gemini Robotics 2, só que abordada pelo outro lado. A DeepMind construiu um modelo de robô e deu a ele conhecimento de mundo. A Black Forest Labs construiu um modelo de vídeo e descobriu que o conhecimento de mundo já estava ali dentro.
Concretamente, em uma única geração, o FLUX 3 faz:
- Texto para vídeo e imagem para vídeo, com áudio, até 20 segundos.
- Vídeo para vídeo, levando um personagem de um clipe de referência para uma cena nova.
- Keyframe para vídeo para transições controladas.
- Diálogo multilíngue com fala sincronizada labialmente.
- Encadeamento agêntico de clipes em sequências de múltiplos planos.
- Síntese e edição de imagem, com renderização de texto multilíngue.

Para quem vinha alternando entre o Midjourney para imagens fixas, outra ferramenta para clipes e uma terceira para narração, a consolidação é o argumento de venda. Um modelo, uma fatura, uma linguagem de prompt. A linhagem de difusão da qual ele veio nunca ia parar nas imagens fixas.
Essa pressão já está aparecendo em outros lugares. Todo fluxo de trabalho de roteiro de vídeo com IA que hoje termina em um arquivo de texto é candidato a um modelo capaz de renderizar o clipe e a narração a partir do mesmo prompt.
O vídeo é a parte difícil, e a divisão de computação prova isso

O detalhe de engenharia mais útil de todo o lançamento é uma composição de custos, enterrada no post complementar de robótica.
A previsão de vídeo responde por mais de 95% da computação total de treinamento do FLUX 3. O áudio é menos de 0,5% dos tokens em um vídeo 720p com som. A Black Forest Labs chama o áudio de "a modalidade fácil", de baixa dimensão e fortemente acoplada ao que o vídeo já mostra, então, uma vez que o modelo aprendeu vídeo, ele adquire sincronização labial e sons de impacto quase como efeito colateral.
As ações acabam tendo o mesmo formato: um sinal de baixa dimensão, fortemente acoplado à observação visual. Esse é o argumento central de todo o lançamento. Se você aceita isso, então um modelo de vídeo é um modelo de mundo que por acaso produz pixels, e o controle de robôs é apenas mais uma cabeça de decodificação.
Eles também testaram isso da forma honesta. Adicionar previsão de ações a um treinamento em andamento derrubou as avaliações humanas de texto para vídeo e imagem para vídeo em até 10%. Depois, após 3.500 passos, a qualidade de vídeo voltou ao nível inicial, com a previsão de ações já em cima. Uma queda temporária, não um imposto permanente. Eles fizeram uma previsão falseável e publicaram o resultado, o que é mais do que a maioria dos lançamentos se dá ao trabalho de fazer.
Os números que a Black Forest Labs publicou

Essas são taxas de preferência sobre clipes de texto para vídeo de 10 segundos, 720p, com áudio. Leia com a ressalva do próprio fornecedor: o modelo e o esquema de avaliação ainda estavam em desenvolvimento, e 50% significa que o voto se dividiu igualmente.
| Comparado com | Parcela que prefere o FLUX 3 | Leitura |
|---|---|---|
| Luma Ray 3.2 | 93% | Sem disputa |
| Runway Gen-4.5 | 77% | Claro |
| Grok Imagine Video | 69% | Claro |
| Kling v3 Pro | 60% | Real mas modesto |
| Happy Horse v1 | 59% | Real mas modesto |
| Happy Horse 1.1 | 57% | Marginal |
| Seedance 2.0 | 52% | Cara ou coroa |
| Gemini Omni Flash | 52% | Cara ou coroa |
A dispersão é o que torna essa tabela mais interessante de ler do que a manchete. Contra os dois modelos de vídeo mais fortes atualmente, o FLUX 3 está em cara ou coroa. Contra o Luma Ray 3.2, é uma goleada. Um comunicado de imprensa poderia dizer, com verdade, "preferido em até 93% das comparações" e não te contar quase nada, exatamente o mesmo truque que um único número agregado de deflexão faz na minha própria indústria.
A Black Forest Labs merece crédito por publicar o lado perdedor do próprio intervalo. No lado da imagem ainda não há números comparativos, só amostras, e a empresa diz apenas que o tratamento de prompts complexos e a renderização de texto melhoraram "significativamente" em relação a versões anteriores do FLUX.

Se você quer uma comparação equivalente sobre imagens fixas hoje, GPT Image 2 contra Midjourney é a comparação que de fato tem os dois modelos disponíveis.
Para edição em vez de geração, o Qwen Image Edit é o equivalente atual mais próximo. Na ponta barata e rápida, o Nano Banana 2 Lite é o que a maioria das equipes usa em vez disso.
O que você consegue de fato hoje

Aqui está a escada, na ordem em que a Black Forest Labs a publicou.

| Capacidade | Como conseguir | Status em 4 ago 2026 |
|---|---|---|
| FLUX 3 Video | Acesso via API e pesos privados | Acesso antecipado, formulário de solicitação |
| FLUX-mimic e FLUX 3 Action | Parceiros de pesquisa e comerciais selecionados | Fechado, mimic robotics primeiro |
| FLUX 3 Image | Acesso via API e pesos privados | "Nas próximas semanas" |
| FLUX 3 Dev | Backbone multimodal de pesos abertos | Anunciado, sem data |
Agora a página de preços, onde a história pousa.

O FLUX 3 não aparece nela. Três abas, nenhuma delas FLUX 3. A documentação vai além e diz claramente que o FLUX.2 "é nossa família de modelos recomendada para todos os casos de uso". Então, se você precisa lançar algo neste mês, as opções reais são as que têm tabela de preços:
| Modelo | 1º MP | MP adicional | Imagem de referência | Uso ideal |
|---|---|---|---|---|
| FLUX.2 [max] | $0,07 | $0,03 | $0,03/MP | Fidelidade máxima, até 4 MP |
| FLUX.2 [pro] | $0,03 | $0,015 | $0,015/MP | Equilíbrio entre qualidade e velocidade |
| FLUX.2 [flex] | $0,05 | $0,05 | $0,05/MP | Cobrança pura por megapixel |
| FLUX.2 [klein] 9B | $0,015 | $0,002 | $0,002/MP | Alto throughput, baixa latência |
| FLUX.2 [klein] 4B | $0,014 | $0,001 | $0,001/MP | Mais barato por imagem |
A resolução é arredondada para cima até o próximo megapixel, separadamente para a saída e para cada imagem de referência, e um megapixel é 1024×1024. Qualquer coisa acima de 4 MP é redimensionada para baixo. O que significa que o preço de tabela e sua fatura real divergem rápido assim que você começa a passar referências, então aqui está a conta:
Duas referências em um job [pro] de 1080p colocam um terço da sua fatura nas entradas. Esse é o tipo de detalhe que só aparece no segundo mês, e é a mesma lição de toda tabela de preços de LLM que já calculei: o preço unitário da manchete raramente é a unidade que você realmente compra.
A parte de robótica não é um desvio

Uma empresa de geração de imagens lançar um modelo de robótica parece uma guinada. A Black Forest Labs argumenta o contrário. Se a criação de conteúdo e o controle físico rodam no mesmo modelo de mundo, a robótica é só um segundo decodificador acoplado a um trabalho que já havia sido pago.
A evidência é um decodificador de ações leve, treinado sobre características intermediárias do caminho de vídeo do FLUX 3, construído junto com a mimic robotics como FLUX-mimic. Em uma tarefa de kitting de corpos flexíveis, com 20 tentativas autônomas cada:
| Modelo | Sucesso mediano |
|---|---|
| FLUX-mimic | 95% |
| Flow matching de tarefa única | 70% |
| FLUX-mimic, backbone congelado | 65% |
| π0.5 | 55% |
| π0.5, backbone congelado | 0% |
A linha do backbone congelado é a que importa. Congele o FLUX 3 inteiramente, treine só o decodificador, e você ainda obtém 65%. Faça o mesmo com a linha de base π0.5 e você obtém zero. O conhecimento de mundo não está só presente, é legível o suficiente para se ler ações diretamente das características. Dois outros números reforçam isso: o backbone processa entrada até representação em menos de 80ms em uma única RTX 5090, e o loop robótico completo da mimic reage em 101ms.
A implantação é real, não uma demo de laboratório. A Audi tem rodado isso em tarefas de produção e logística que a automação convencional nunca alcançou, como vedações e cabos.
"We have seen these robots solve complex soft-body manipulation work that would have been simply impossible with conventional robotics."
Christoph Schneider, Audi Production Lab, quoted in Black Forest Labs' announcement
A afirmação sobre eficiência de amostragem é a estrategicamente interessante. A Black Forest Labs relata que representações melhores reduziram pela metade os passos de treinamento necessários para atingir uma dada taxa de sucesso, e cita a eficiência de amostragem de até 10x do paper mimic-video para modelos de vídeo-ação. Se ensinar um robô a fazer uma nova tarefa deixa de ser um projeto de coleta de dados, a economia da automação de fábricas muda. Isso é mais importante do que qualquer clipe de 20 segundos, e é a mesma tese que a DeepMind está testando do lado da robótica.
O que o Hacker News achou disso
O tópico de lançamento chegou a 571 pontos e 133 comentários, e a reação se dividiu claramente. O público técnico quer uma coisa só, e não é a duração do vídeo.
"Flux 2 Dev Klein has practically been the best you could use on most commercial hardware so I really hope Flux 3 has a comparable updated open-weights model to it. if not it'd be a great loss to most hobbyists."
Pesos abertos voltaram comentário após comentário, geralmente com a mesma preocupação anexada: a linha de pesos abertos fica no fundo do plano de lançamento sem data. Várias pessoas apontaram a VRAM como o fator decisivo para saber se o FLUX 3 Dev será utilizável em casa.
Os céticos foram mais barulhentos do que o lançamento merecia, e uma crítica foi certeira:
"Showed close to zero examples of people. Frivolous use of the term World Model. Claims 20 seconds of video, shows only jumpcuts."
Essa é uma leitura justa de uma página cujas afirmações mais fortes são sobre pessoas e continuidade. A contra-argumentação também recebeu votos:
"It's incredible how negative and dismissive the comments in here are while here I am thinking the model actually looks impressively capable."
As duas coisas podem ser verdade ao mesmo tempo. O resultado parece forte, o material de divulgação exagera, e a coisa em si está atrás de um formulário. Pessoalmente, eu prefiro a composição de computação e o gráfico do backbone congelado a mais um reel de destaques qualquer dia, e a Black Forest Labs publicou os dois.
O que isso significa se você compra IA para viver

Eu não gero vídeo para viver. Eu construo agentes de IA que respondem tickets de suporte, e mesmo assim o FLUX 3 mudou como vou ler os próximos três lançamentos na minha própria categoria.
Leia a escada de acesso antes do vídeo de demonstração. Um lançamento tem uma lista de capacidades e uma lista de disponibilidade, e raramente são a mesma lista. A página do FLUX 3 é incomumente honesta quanto a isso, já que publica a escada bem ali. A maioria dos fornecedores de IA de suporte não faz isso, por isso a pergunta útil é sempre "qual dessas está no meu plano, hoje?" em vez de "isso consegue fazer isso?". É a mesma lacuna que aponto ao comparar um agente de IA a um chatbot: a demo mostra o teto, o plano mostra o piso.
Faixa vence manchete. "Preferido em até 93% das comparações" e "cara ou coroa contra os dois melhores rivais" descrevem a mesma tabela. Quando um fornecedor te dá um único número de qualidade de IA, peça a distribuição por trás dele. Esse é todo o argumento a favor de métricas por intenção em vez de uma única cifra combinada de deflexão de nível 1, e eu aplico isso ao meu próprio produto também. É também por isso que limiares de confiança superam uma única pontuação de precisão.
Um backbone, muitos trabalhos, essa é a tendência real. O FLUX 3 faz imagem, vídeo, áudio e ações a partir de um único modelo. No lado da linguagem, a mesma consolidação explica por que o GPT-5.6 e o DeepSeek V4 Flash agora lidam com trabalho que antes precisava de três modelos especializados. O Claude Opus 4.6 está na mesma curva.
Comprar uma ferramenta com um único modelo estreito por dentro é uma decisão com vida mais curta do que costumava ser. Seja qual for o que você escolher, confira contra controles de alucinação antes de deixá-lo perto de um cliente.
Pesos abertos são uma bifurcação real no caminho. O FLUX 3 Dev eventualmente vai permitir que equipes hospedem por conta própria um backbone multimodal. Isso é atraente até o momento em que você assume o fine-tuning, as GPUs e a escala de plantão. Um cliente nosso que tinha todas as habilidades necessárias para construir internamente colocou isso claramente.
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Essa é a troca, dita melhor do que eu conseguiria. O trabalho de treinamento e modelo personalizado é a parte que ninguém mostra na demo.
Quer uma IA que realmente responda seus tickets, não uma lista de espera? a eesel se conecta ao seu helpdesk em poucos minutos, aprende com seus tickets antigos e sua central de ajuda, e roda uma simulação sobre seu histórico real para que você veja a taxa de resolução antes de um cliente. Sem formulário, sem fila de acesso antecipado. Experimente a eesel de graça.
Onde o FLUX 3 está agora
O FLUX 3 é o lançamento de modelo mais interessante do verão e o menos comprável. O caso técnico é forte: um backbone abrangendo quatro modalidades, uma composição de computação publicada, uma faixa de preferência honesta que inclui as derrotas, e um resultado de robótica com backbone congelado que seria difícil de forjar. A implantação na Audi dá a isso um piso de realidade que a maioria dos anúncios de IA física não tem.
O que falta é preço, endpoint e data. O FLUX.2 é o que a própria Black Forest Labs recomenda para todos os casos de uso atuais, e a $0,014-$0,07 pelo primeiro megapixel é a versão com tabela de preços. Se o FLUX 3 está no seu roadmap, solicite acesso antecipado, e planeje em torno do FLUX.2 enquanto isso.
Se você está escolhendo ferramentas generativas de forma mais ampla, meu apanhado de ferramentas de IA generativa cobre o que é comprável hoje. Para a metade de escrita do mesmo trabalho, comece pelo modelo de IA para blogging.
No lado do conteúdo, a automação de blog com IA é onde esses modelos de imagem são realmente usados no dia a dia. Um redator de artigos com IA é a peça que os chama, e as ferramentas de SEO com IA generativa é onde a saída termina.
No lado do suporte, IA generativa para equipes de suporte é o melhor ponto de partida. Se você está mais atrás do que isso, IA generativa para atendimento ao cliente cobre a categoria, e qual LLM é melhor para suporte entra na escolha do modelo em si.
Sources
- FLUX 3 - Real World Models, Black Forest Labs, 24 July 2026
- FLUX 3 x mimic: The Next Generation of Video-Action Models, Black Forest Labs
- Self-Flow, Black Forest Labs research
- FLUX 3 model page, captured 4 August 2026
- Black Forest Labs pricing, captured 4 August 2026
- Black Forest Labs docs introduction, captured 4 August 2026
- Flux 3 launch discussion, Hacker News, 571 points
- Flux 3 x mimic discussion, Hacker News, 318 points
Perguntas frequentes
O que é o FLUX 3?
Quanto custa o FLUX 3?
[max], $0,03 no [pro] e $0,014 no [klein] 4B. Quem orçamenta gastos com IA por resultado, e não por unidade, vai achar o modelo de custo por resolução mais útil.O FLUX 3 já está disponível?
O FLUX 3 é melhor que Kling, Runway ou Grok Imagine?
O FLUX 3 terá pesos abertos?
O que o FLUX 3 tem a ver com robôs?
Posso usar o FLUX 3 para imagens de blog e conteúdo de suporte?
O que as equipes de suporte devem tirar do lançamento do FLUX 3?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







