
Ce qu'est vraiment FLUX 3

FLUX 1 et FLUX 2 produisaient des images. FLUX 3 est une chose d'un autre ordre, et son nom en minimise la portée.
Il est entraîné conjointement sur l'image, la vidéo et l'audio au sein d'une seule architecture, construite sur une approche que Black Forest Labs appelle Self-Flow. L'idée de l'entreprise est que chaque modalité est une projection avec perte d'une seule réalité, si bien que les apprendre toutes ensemble impose des contraintes qu'un modèle mono-modalité ne voit jamais. La phrase du billet d'annonce qui me reste en tête : « le son doit correspondre à l'impact, le mouvement doit obéir à la masse. »
C'est une affirmation sur la représentation, pas sur les pixels. C'est aussi la même affirmation que celle derrière Gemini Robotics 2, abordée depuis l'autre bout. DeepMind a construit un modèle de robot et lui a donné une connaissance du monde. Black Forest Labs a construit un modèle vidéo et a découvert que cette connaissance du monde y était déjà.
Concrètement, en une seule génération, FLUX 3 fait :
- Texte-vers-vidéo et image-vers-vidéo, avec audio, jusqu'à 20 secondes.
- Vidéo-vers-vidéo, en transposant un personnage d'un clip de référence dans une nouvelle scène.
- Keyframe-vers-vidéo pour des transitions contrôlées.
- Dialogue multilingue avec synchronisation labiale.
- Enchaînement agentique de clips en séquences à plusieurs plans.
- Synthèse et édition d'image, avec rendu de texte multilingue.

Pour quiconque jongle avec Midjourney pour les images fixes, un outil séparé pour les clips et un troisième pour la voix off, la consolidation est l'argument de vente. Un modèle, une facture, un langage de prompt unique. La lignée de diffusion dont il est issu n'allait de toute façon jamais s'arrêter aux images fixes.
Cette pression se fait déjà sentir ailleurs. Chaque flux de travail de script vidéo IA qui se termine aujourd'hui par un fichier texte est candidat à un modèle capable de rendre le clip et la voix off à partir du même prompt.
La vidéo est la partie difficile, et la répartition du calcul le prouve

Le détail technique le plus utile de tout le lancement est une répartition des coûts, enfouie dans le billet compagnon sur la robotique.
La prédiction vidéo représente plus de 95% du calcul total d'entraînement de FLUX 3. L'audio pèse moins de 0,5% des tokens dans une vidéo 720p avec son. Black Forest Labs qualifie l'audio de « modalité facile », de faible dimension et étroitement couplée à ce que la vidéo montre déjà, si bien qu'une fois le modèle entraîné sur la vidéo, il acquiert la synchronisation labiale et les bruits d'impact presque comme un effet secondaire.
Les actions s'avèrent avoir la même forme : un signal de faible dimension, étroitement couplé à l'observation visuelle. C'est l'argument central de toute la publication. Si on l'accepte, un modèle vidéo est un modèle du monde qui produit des pixels par hasard, et le contrôle robotique n'est qu'une tête de décodage supplémentaire.
Ils l'ont aussi testé honnêtement. Ajouter la prédiction d'actions à un entraînement en cours a fait chuter les évaluations humaines sur le texte-vers-vidéo et l'image-vers-vidéo jusqu'à 10%. Puis, après 3 500 étapes, la qualité vidéo est revenue à son niveau initial, avec la prédiction d'actions en prime. Une baisse temporaire, pas une taxe permanente. Ils ont fait une prédiction falsifiable et publié le résultat, ce qui est plus que ce que la plupart des lancements prennent la peine de faire.
Les chiffres publiés par Black Forest Labs

Ce sont des taux de préférence sur des clips texte-vers-vidéo de 10 secondes, en 720p, avec audio. À lire avec la mise en garde du fournisseur lui-même : le modèle et le dispositif d'évaluation étaient encore en développement, et 50% signifie que le vote s'est réparti à égalité.
| Comparé à | Part préférant FLUX 3 | Lecture |
|---|---|---|
| Luma Ray 3.2 | 93% | Pas de suspense |
| Runway Gen-4.5 | 77% | Net |
| Grok Imagine Video | 69% | Net |
| Kling v3 Pro | 60% | Réel mais modeste |
| Happy Horse v1 | 59% | Réel mais modeste |
| Happy Horse 1.1 | 57% | Marginal |
| Seedance 2.0 | 52% | Pile ou face |
| Gemini Omni Flash | 52% | Pile ou face |
C'est cet étalement qui rend ce tableau plus intéressant à lire que le titre. Face aux deux modèles vidéo actuels les plus forts, FLUX 3 est à pile ou face. Face à Luma Ray 3.2, c'est une déroute. Un communiqué de presse pourrait dire, sans mentir, « préféré dans jusqu'à 93% des comparaisons » et ne rien vous apprendre du tout, exactement le même tour de passe-passe qu'un chiffre de déflection unique et agrégé joue dans ma propre industrie.
Black Forest Labs mérite d'être crédité d'avoir publié le côté perdant de sa propre fourchette. Côté image, il n'y a pas encore de chiffres comparatifs, seulement des échantillons, et l'entreprise se contente de dire que la gestion de prompts complexes et le rendu de texte se sont « significativement » améliorés par rapport aux précédentes versions de FLUX.

Pour une comparaison équitable sur les images fixes aujourd'hui, GPT Image 2 face à Midjourney est la comparaison qui a réellement les deux modèles disponibles.
Pour l'édition plutôt que la génération, Qwen Image Edit est l'équivalent actuel le plus proche. Côté rapide et bon marché, Nano Banana 2 Lite est ce que la plupart des équipes utilisent à la place.
Ce que vous pouvez réellement obtenir aujourd'hui

Voici l'échelle, dans l'ordre où Black Forest Labs l'a publiée.

| Fonctionnalité | Comment l'obtenir | Statut au 4 août 2026 |
|---|---|---|
| FLUX 3 Video | Accès API et poids privés | Accès anticipé, formulaire de demande |
| FLUX-mimic et FLUX 3 Action | Partenaires de recherche et commerciaux sélectionnés | Fermé, mimic robotics en premier |
| FLUX 3 Image | Accès API et poids privés | « Dans les prochaines semaines » |
| FLUX 3 Dev | Backbone multimodal à poids ouverts | Annoncé, pas de date |
Voici maintenant la page de tarification, où l'histoire atterrit.

FLUX 3 n'y apparaît pas. Trois onglets, aucun d'entre eux n'est FLUX 3. La documentation va plus loin et dit clairement que FLUX.2 « est notre famille de modèles recommandée pour tous les cas d'usage ». Donc si vous devez livrer quelque chose ce mois-ci, les vraies options sont celles qui ont une grille tarifaire :
| Modèle | 1er MP | MP suppl. | Image de référence | Adapté pour |
|---|---|---|---|---|
| FLUX.2 [max] | 0,07 $ | 0,03 $ | 0,03 $/MP | Fidélité maximale, jusqu'à 4 MP |
| FLUX.2 [pro] | 0,03 $ | 0,015 $ | 0,015 $/MP | Équilibre qualité et vitesse |
| FLUX.2 [flex] | 0,05 $ | 0,05 $ | 0,05 $/MP | Facturation pure au mégapixel |
| FLUX.2 [klein] 9B | 0,015 $ | 0,002 $ | 0,002 $/MP | Haut débit, faible latence |
| FLUX.2 [klein] 4B | 0,014 $ | 0,001 $ | 0,001 $/MP | Le moins cher par image |
La résolution est arrondie au mégapixel supérieur, séparément pour la sortie et pour chaque image de référence, et un mégapixel équivaut à 1024×1024. Tout ce qui dépasse 4 MP est redimensionné à la baisse. Ce qui signifie que le prix affiché et votre facture réelle divergent vite dès que vous ajoutez des références, d'où le calcul suivant :
Deux références sur un job [pro] en 1080p mettent un tiers de votre facture dans les entrées. C'est le genre de détail qui n'apparaît qu'au deuxième mois, et c'est la même leçon que pour chaque grille tarifaire de LLM que j'ai chiffrée : le prix unitaire affiché est rarement l'unité que vous achetez vraiment.
La partie robotique n'est pas une digression

Une entreprise de génération d'images qui sort un modèle de robotique, ça ressemble à un virage. Black Forest Labs soutient le contraire. Si la création de contenu et le contrôle physique tournent sur le même modèle du monde, la robotique n'est qu'un second décodeur greffé sur un travail déjà payé.
La preuve est un décodeur d'actions léger, entraîné sur des caractéristiques intermédiaires issues du flux vidéo de FLUX 3, construit avec mimic robotics sous le nom de FLUX-mimic. Sur une tâche de kitting d'objets souples, avec 20 essais autonomes chacune :
| Modèle | Succès médian |
|---|---|
| FLUX-mimic | 95% |
| Flow matching mono-tâche | 70% |
| FLUX-mimic, backbone gelé | 65% |
| π0.5 | 55% |
| π0.5, backbone gelé | 0% |
La ligne du backbone gelé est celle qui compte. Gelez FLUX 3 entièrement, entraînez uniquement le décodeur, et vous obtenez quand même 65%. Faites la même chose avec la référence π0.5 et vous obtenez zéro. La connaissance du monde n'est pas seulement présente, elle est lisible au point de pouvoir en extraire directement les actions à partir des caractéristiques. Deux autres chiffres le confirment : le backbone traite l'entrée en représentation en moins de 80 ms sur une seule RTX 5090, et la boucle robotique complète de mimic réagit en 101 ms.
Le déploiement est réel, pas une démo de laboratoire. Audi l'utilise sur des tâches de production et de logistique que l'automatisation classique n'a jamais atteintes, comme les joints et les câbles.
"We have seen these robots solve complex soft-body manipulation work that would have been simply impossible with conventional robotics."
Christoph Schneider, Audi Production Lab, quoted in Black Forest Labs' announcement
L'affirmation sur l'efficacité d'échantillonnage est celle qui est stratégiquement intéressante. Black Forest Labs rapporte que de meilleures représentations ont divisé par deux le nombre d'étapes d'entraînement nécessaires pour atteindre un taux de réussite donné, et cite l'efficacité d'échantillonnage jusqu'à 10 fois supérieure du papier mimic-video pour les modèles vidéo-action. Si apprendre une nouvelle tâche à un robot cesse d'être un projet de collecte de données, l'économie de l'automatisation d'usine change. C'est plus important que n'importe quel clip de 20 secondes, et c'est la même thèse que DeepMind teste du côté robotique.
Ce qu'en a pensé Hacker News
Le fil de lancement a atteint 571 points et 133 commentaires, et la réaction s'est nettement divisée. Le public technique veut une seule chose, et ce n'est pas la durée de la vidéo.
"Flux 2 Dev Klein has practically been the best you could use on most commercial hardware so I really hope Flux 3 has a comparable updated open-weights model to it. if not it'd be a great loss to most hobbyists."
Les poids ouverts sont revenus commentaire après commentaire, généralement accompagnés de la même inquiétude : la ligne des poids ouverts se trouve tout en bas du plan de lancement, sans date. Plusieurs personnes ont signalé la VRAM comme le facteur décisif pour savoir si FLUX 3 Dev sera utilisable à la maison.
Les sceptiques ont été plus bruyants que ce que méritait le lancement, et une critique a fait mouche :
"Showed close to zero examples of people. Frivolous use of the term World Model. Claims 20 seconds of video, shows only jumpcuts."
C'est une lecture juste d'une page dont les affirmations les plus fortes portent sur les personnes et la continuité. La contre-attaque a aussi récolté des votes :
"It's incredible how negative and dismissive the comments in here are while here I am thinking the model actually looks impressively capable."
Les deux peuvent être vrais en même temps. Le résultat paraît solide, la présentation en fait trop, et la chose elle-même est derrière un formulaire. Personnellement, je préfère toujours la répartition du calcul et le graphique du backbone gelé à une énième bande-annonce, et Black Forest Labs a publié les deux.
Ce que cela signifie si vous achetez de l'IA pour vivre

Je ne génère pas de vidéo pour vivre. Je construis des agents IA qui répondent aux tickets de support, et FLUX 3 a quand même changé la manière dont je vais lire les trois prochains lancements dans ma propre catégorie.
Lisez l'échelle d'accès avant la bande-annonce. Un lancement a une liste de fonctionnalités et une liste de disponibilité, et ce sont rarement les mêmes listes. La page FLUX 3 est étonnamment honnête à ce sujet, puisqu'elle publie l'échelle directement. La plupart des fournisseurs d'IA support ne le font pas, c'est pourquoi la bonne question est toujours « laquelle de ces fonctionnalités est sur mon plan, aujourd'hui ? » plutôt que « peut-elle faire ça ? ». C'est le même écart que je pointe en comparant un agent IA à un chatbot : la démo montre le plafond, le plan montre le plancher.
L'écart bat le titre. « Préféré dans jusqu'à 93% des comparaisons » et « à égalité contre les deux meilleurs rivaux » décrivent le même tableau. Quand un fournisseur vous donne un seul chiffre de qualité IA, demandez la distribution qui se cache derrière. C'est tout l'argument en faveur des métriques par intention plutôt qu'un unique chiffre agrégé de déflection tier-1, et je l'applique aussi à mon propre produit. C'est aussi pourquoi les seuils de confiance valent mieux qu'un score de précision unique.
Un backbone, plusieurs métiers, c'est la vraie tendance. FLUX 3 fait de l'image, de la vidéo, de l'audio et des actions à partir d'un seul modèle. Côté langage, la même consolidation explique pourquoi GPT-5.6 et DeepSeek V4 Flash gèrent maintenant un travail qui nécessitait autrefois trois modèles spécialisés. Claude Opus 4.6 se situe sur la même courbe.
Acheter un outil avec un seul modèle étroit à l'intérieur est une décision à durée de vie plus courte qu'avant. Quel que soit celui que vous choisissez, vérifiez-le face aux contrôles d'hallucination avant de le laisser approcher un client.
Les poids ouverts sont une vraie bifurcation. FLUX 3 Dev permettra un jour à des équipes d'auto-héberger un backbone multimodal. C'est séduisant jusqu'au moment où vous héritez du fine-tuning, des GPU et de l'astreinte. Un de nos clients qui avait toutes les compétences nécessaires pour le construire en interne l'a dit clairement.
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
C'est le compromis, mieux formulé que je ne pourrais le faire. Le travail de formation et de modèle sur mesure est la partie que personne ne démontre.
Envie d'une IA qui répond vraiment à vos tickets, pas d'une liste d'attente ? eesel se connecte à votre helpdesk en quelques minutes, apprend de vos tickets passés et de votre centre d'aide, et exécute une simulation sur votre historique réel pour que vous voyiez le taux de résolution avant un client. Pas de formulaire, pas de file d'accès anticipé. Essayez eesel gratuitement.
Où en est FLUX 3 en ce moment
FLUX 3 est le lancement de modèle le plus intéressant de l'été et le moins achetable. Le dossier technique est solide : un backbone couvrant quatre modalités, une répartition du calcul publiée, une fourchette de préférence honnête incluant les défaites, et un résultat de robotique à backbone gelé difficile à simuler. Le déploiement chez Audi lui donne un ancrage réel que la plupart des annonces d'IA physique n'ont pas.
Ce qui manque, c'est un prix, un endpoint et une date. FLUX.2 est ce que Black Forest Labs recommande elle-même pour tous les cas d'usage actuels, et à 0,014-0,07 $ pour le premier mégapixel, c'est la version dotée d'une grille tarifaire. Si FLUX 3 figure sur votre feuille de route, demandez l'accès anticipé, et prévoyez FLUX.2 en attendant.
Si vous choisissez plus largement des outils génératifs, mon panorama des outils d'IA générative couvre ce qui est achetable aujourd'hui. Pour le versant rédaction du même métier, commencez par le modèle IA pour le blogging.
Côté contenu, l'automatisation de blog par IA est l'endroit où ces modèles d'image sont réellement utilisés au quotidien. Un rédacteur d'articles IA est la pièce qui les appelle, et les outils SEO d'IA générative sont là où atterrit le résultat.
Côté support, l'IA générative pour les équipes support est un meilleur point de départ. Si vous partez de plus loin, l'IA générative pour le service client couvre la catégorie, et quel LLM convient au support entre dans le choix du modèle lui-même.
Sources
- FLUX 3 - Real World Models, Black Forest Labs, 24 July 2026
- FLUX 3 x mimic: The Next Generation of Video-Action Models, Black Forest Labs
- Self-Flow, Black Forest Labs research
- FLUX 3 model page, captured 4 August 2026
- Black Forest Labs pricing, captured 4 August 2026
- Black Forest Labs docs introduction, captured 4 August 2026
- Flux 3 launch discussion, Hacker News, 571 points
- Flux 3 x mimic discussion, Hacker News, 318 points
Questions fréquentes
Qu'est-ce que FLUX 3 ?
Combien coûte FLUX 3 ?
[max], 0,03 $ sur [pro], et 0,014 $ sur [klein] 4B. Pour qui budgète ses dépenses IA en fonction des résultats plutôt que des unités, le repère coût par résolution est plus utile.FLUX 3 est-il déjà disponible ?
FLUX 3 est-il meilleur que Kling, Runway ou Grok Imagine ?
FLUX 3 aura-t-il des poids ouverts ?
Quel est le rapport entre FLUX 3 et les robots ?
Puis-je utiliser FLUX 3 pour des images de blog et du contenu de support ?
Que doivent retenir les équipes support du lancement de FLUX 3 ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







