
Comment teste-t-on un modèle qu'on ne peut pas exécuter ?
Honnêtement, et en exposant la méthodologie dès le départ. Sinon, le test d'un modèle en accès anticipé n'est qu'une réécriture de l'annonce avec des adjectifs en plus.
Voici ce que j'ai pu vérifier. L'annonce de lancement et sa liste de fonctionnalités. La thèse de FLUX-mimic et ses graphiques de taux de réussite. La page de recherche Self-Flow, où vit réellement la méthode, publiée comme prépublication arXiv 2603.06507. La page du modèle, et la page de tarifs, qui s'est révélée être la plus informative de toutes. Et deux fils Hacker News où des personnes qui font tourner ces modèles en local ont réagi en temps réel. Chacun d'eux est lié intégralement en bas de page.
Voici ce que je n'ai pas pu vérifier : une seule génération. Je n'ai fait passer aucun prompt dans FLUX 3, et personne qui en parlait cette semaine ne l'a fait non plus, à moins d'être dans le programme d'accès anticipé.

Cette capture d'écran, c'est toute la surface du produit. Un formulaire de demande, en gros. La chose juste à évaluer ici, c'est donc le dossier documentaire, et il se révèle meilleur que ce que l'annonce de lancement laissait présager.
L'affirmation en question
FLUX 3 est un modèle de fondation multimodal qui s'entraîne sur des images, de la vidéo et de l'audio au sein d'une seule architecture, ce même backbone prédisant ensuite aussi des actions robotiques. Black Forest Labs présente cela comme l'apprentissage d'une représentation du monde plutôt que de trois compétences séparées. Comment les objets tiennent ensemble, comment les choses bougent, comment les événements sonnent.

La version concrète : de la vidéo avec audio natif jusqu'à 20 secondes en une seule génération, texte vers vidéo, image vers vidéo à partir d'une image de départ ou d'une référence visuelle, vidéo vers vidéo qui transporte un personnage dans une nouvelle scène, keyframe vers vidéo pour des transitions contrôlées, dialogue multilingue, et chaînage agentique de clips en séquences multi-plans. Chaque sortie arrive avec l'audio intégré plutôt que doublé après coup.
Ce dernier détail est celui que je testerais en premier si j'y avais accès. Un son qui tombe exactement sur l'image où l'impact se produit est un problème bien plus difficile qu'un son qui se contente de jouer par-dessus un clip, et c'est le genre de chose qui soit fonctionne, soit se ridiculise immédiatement.
Pour ceux qui planifient autour de cela : un plafond de 20 secondes avec audio intégré change ce que coûte un court clip explicatif, mais ne change pas la partie qui décide réellement si le clip est bon. Écrire le script de la vidéo reste l'étape que la plupart des équipes sautent.
Le papier vaut mieux que le billet de blog
C'est la partie du test dont je ne m'attendais pas à ce qu'elle en devienne le point fort. FLUX 3 est construit sur Self-Flow, et c'est sur la page de recherche, pas dans l'annonce, que Black Forest Labs montre vraiment son travail.
Le mécanisme s'appelle Dual-Timestep Scheduling, une variante du schéma standard de débruitage sur lequel repose tout modèle de diffusion. À partir d'une entrée propre, la méthode tire deux pas de temps et un masque aléatoire, puis bruite chaque token selon le pas de temps qui lui est assigné, de sorte que différentes parties de la même entrée arrivent à différents niveaux de corruption. La vue enseignante reçoit le niveau de bruit le plus bas, ce qui crée une asymétrie d'information délibérée, et l'élève est entraîné à débruiter l'entrée tout en reconstruisant les caractéristiques de l'enseignant. Tout ce mécanisme vise à ce que le modèle apprenne des représentations solides sans modèle enseignant externe rapporté.

Cela vaut la peine d'expliquer pourquoi cela compte pour un acheteur et pas seulement pour un chercheur. La voie habituelle vers la qualité sémantique dans un modèle génératif consiste à l'aligner sur un modèle de vision pré-entraîné séparé. Cela fonctionne bien, mais oblige aussi à entretenir deux modèles dont les objectifs ne s'accordent pas tout à fait. L'affirmation de Self-Flow est que la représentation peut sortir de l'entraînement génératif lui-même. Quiconque a déjà pesé le choix entre construire sur un encodeur pré-entraîné ou entraîner quelque chose de bout en bout reconnaîtra ce compromis, et mes notes sur les modèles d'IA sur mesure et l'entraînement d'un modèle d'IA couvrent la même bifurcation côté application.
Les ablations aussi sont réelles. La comparaison sur l'image fait tourner un backbone de 625M de paramètres sur 20M d'images face au flow matching classique, à REPA avec DINOv2, à REPA avec SigLIP2 et à SRA. Pour l'exécution multimodale conjointe, il s'agit d'un unique backbone FLUX.2 de 4B de paramètres entraîné sur 200M d'images et 6M de vidéos, sur 100 000 étapes de fine-tuning haute résolution. Des chiffres suffisamment précis pour être discutés, ce qui en soi dépasse déjà ce que donnent la plupart des lancements de modèles.
Le résultat de mise à l'échelle est l'affirmation la plus prometteuse pour l'avenir de toute cette sortie :

À mesure que la taille du modèle grimpe de 290M à 420M, puis 625M et 1B de paramètres, l'écart entre Self-Flow et REPA se creuse au lieu de se refermer, tandis que REPA montre des rendements décroissants. Une méthode qui s'améliore relativement avec l'échelle vaut bien plus qu'une méthode qui gagne à une seule taille donnée.
Voici maintenant la réserve du testeur, qui est bien réelle. Ces expériences plafonnent à 4B de paramètres sur 200M d'images. FLUX 3 lui-même est décrit comme significativement mis à l'échelle par rapport à cette configuration. Autrement dit, le papier valide la méthode, pas le modèle livré. Une preuve solide que l'architecture est saine, donc, et aucune preuve du tout sur ce qui se trouve derrière le formulaire de demande.
Les chiffres vidéo, lus tels qu'ils ont été écrits
Voici l'ensemble complet des préférences issu de l'annonce de lancement, mesuré sur des clips texte vers vidéo de 10 secondes en 720p avec audio.
| Comparé à | FLUX 3 préféré à | Lecture |
|---|---|---|
| Luma Ray 3.2 | 93% | Victoire nette |
| Runway Gen-4.5 | 77% | Victoire nette |
| Grok Imagine Video | 69% | Victoire |
| Kling v3 Pro | 60% | Courte victoire |
| Happy Horse v1 | 59% | Courte victoire |
| Happy Horse 1.1 | 57% | Courte victoire |
| Seedance 2.0 | 52% | Pile ou face |
| Gemini Omni Flash | 52% | Pile ou face |

Deux choses méritent d'être saluées ici. Black Forest Labs a publié les défaites juste à côté des victoires, et a mis en gras sur sa propre page la réserve : le modèle et le système d'évaluation qui l'entoure sont encore en développement, donc les résultats sont préliminaires et censés s'améliorer.
Deux choses méritent d'être scrutées. L'ensemble de comparaison a été choisi par l'éditeur, sur des prompts écrits par l'éditeur, et Kling a déjà dépassé le v3 Pro qui a été benchmarké pour passer à la famille 3.0. Et le résumé honnête de ce tableau est "compétitif avec la frontière actuelle", pas "en avance sur elle", car les deux concurrents les plus proches se sont retrouvés à pile ou face.
Rien de tout cela ne rend le tableau inutile. Cela en fait une métrique de performance réalisée par l'éditeur, une catégorie de preuve bien réelle avec un biais connu, et on la lit comme on lit tout chiffre auto-déclaré : faire confiance à la forme, minorer l'ampleur, et aller chercher les défaites. Black Forest Labs a au moins imprimé les défaites.
Si vous voulez ces huit modèles chiffrés plutôt que classés, c'est exactement ce que fait mon comparatif des alternatives à FLUX 3, et l'analyse complète du lancement couvre la liste des fonctionnalités plus en profondeur qu'un test n'en a besoin.
Les évaluations d'images ont été menées sur un modèle encore en cours d'entraînement
L'annonce de lancement le dit clairement, et presque personne ne l'a cité : les améliorations d'image proviennent d'évaluations préliminaires réalisées pendant le midtraining. Les échantillons ont effectivement l'air solides, en particulier sur la typographie et le rendu de texte multilingue, ce qui se trouve être justement là où les versions précédentes de FLUX peinaient visiblement.

Cela vaut la peine de mettre cela en regard de la position réelle de la génération actuelle. Un opérateur qui gère un site de benchmark d'adhérence à des prompts complexes a noté FLUX.2 à 5 sur 15, Ideogram 4 à 8, et GPT Image 2 à 12 :
"I run a fairly high-traffic site for generative image models focusing on complex prompt adherence. Flux.2 doesn't score anywhere near SOTA proprietary models."
C'est l'écart que FLUX 3 Image doit combler, et il est large. Un autre commentateur a exprimé la frustration plus directement :
"I have a feeling open-weight models ought to be outperforming proprietary ones by now, but that still hasn't happened."
Pour un travail sur l'image livrable ce mois-ci, la comparaison que je ferais est FLUX.2 face à Nano Banana 2, sa variante Lite et GPT Image 2.
Si vous choisissez sur le coût plutôt que sur la qualité, la comparaison à trois modèles d'images est la page que je garde ouverte. L'édition locale est une compétence à part, et c'est l'édition d'images de Qwen que je benchmarkerais pour cela.
C'est aussi la moitié de FLUX 3 qui intéresse le plus les équipes de contenu, puisqu'une illustration est la partie d'un billet que la plupart des gens génèrent déjà. Si c'est votre cas d'usage, le pipeline compte plus que le modèle : l'automatisation de blog et la rédaction d'articles avec images couvrent comment les deux s'articulent, et la grille tarifaire de Midjourney est la base de coût sur laquelle je me repère.
La section robotique est la meilleure preuve de cette sortie
Si vous ne lisez qu'une seule partie du matériel FLUX 3, lisez le billet mimic. C'est là qu'une affirmation sur les représentations est mise à l'épreuve de la réalité physique, et la réalité physique est bien plus difficile à truquer qu'un sondage de préférence.
Black Forest Labs et mimic robotics ont construit FLUX-mimic en accrochant un décodeur d'action léger au chemin vidéo de FLUX 3, et Audi le teste sur du travail de manipulation d'objets souples en production. Sur une tâche de kitting d'objets souples menée sur 20 essais autonomes, le taux de réussite médian a atteint 95% pour FLUX-mimic contre 55% pour la référence pi-0.5.

Le chiffre que je brandirais réellement dans un débat est celui de la condition de contrôle. Backbone gelé, FLUX-mimic a tout de même atteint 65%, tandis qu'un pi-0.5 gelé est tombé à 0%. Geler le backbone retire le fine-tuning de l'équation, si bien qu'il ne reste que la qualité de la représentation que le modèle vidéo portait déjà. C'est toute la thèse de cette sortie, testée proprement, avec un résultat qui aurait été embarrassant s'il était tombé dans l'autre sens. Le publier quand même est la chose la plus crédible de tout ce lancement.
Ce n'est pas non plus un point de donnée isolé dans le domaine. Gemini Robotics 2 fait un pari structurellement similaire depuis le côté robotique plutôt que génération, ce qui est un assez bon signe que l'idée sous-jacente n'est pas juste le cadrage d'un seul labo.
La page Self-Flow ajoute ensuite une deuxième couche à la même histoire, cette fois depuis la simulation. En affinant les exécutions multimodales pondérées par la vidéo à 675M de paramètres et en évaluant la prédiction d'action dans le simulateur SIMPLER, Self-Flow a battu le flow matching classique sur toutes les tâches tôt dans l'entraînement, à 30 000 étapes, là où le flow matching a totalement échoué sur les tâches Open et Place. À 100 000 étapes, les tâches à objet unique avaient convergé, tandis que Self-Flow conservait son avantage sur les tâches à objets multiples et séquentielles. Le schéma reste constant d'un bout à l'autre : l'avantage apparaît sur les tâches compositionnelles difficiles et pas sur les faciles.
Un lecteur du fil a repéré le détail qui m'a le plus convaincu, et qui n'est même pas un taux de réussite.
"The video at around 3.30min, where the robot arm took 3 attempts to reseat the window trim, was quite unnerving - I have not seen such resolving before."
Réessayer après un échec sans qu'on le lui demande est une capacité différente de réussir du premier coup, et c'est celle qui compte vraiment une fois qu'un système tourne sans supervision. Cela m'importe pour la même raison que dans l'automatisation du support. Un système qui sait qu'il a échoué peut passer la main ; un système qui ne le sait pas se contente de consigner une réponse fausse avec assurance et de continuer. C'est la thèse derrière la passation d'agent IA et derrière la prévention des hallucinations IA.
Un autre commentateur a résumé le pari d'architecture en une seule phrase, mieux que ne l'a fait l'annonce de lancement :
"Upshot: a well trained multimodal video generation model has a world representation model trained inside it."
L'audit des preuves
Six affirmations, notées selon ce qui a réellement été publié plutôt que ce qui a été démontré. Ouvrez chacune d'elles.
Un seul modèle pour l'image, la vidéo, l'audio et l'action
Une vidéo meilleure que la concurrence
Un bond significatif de la qualité d'image
Le backbone se transfère au contrôle robotique
La méthode passe à l'échelle
On peut l'utiliser
Là où le test arrive au bout de la route
Tout test doit finir par répondre à "donc, dois-je l'acheter", et voici le point où je dois m'arrêter.

La page de tarifs a des onglets pour FLUX.2, FLUX Tools et FLUX.1. FLUX 3 n'y figure pas. La feuille de route de lancement fait d'abord passer la vidéo et l'audio via des API et un accès à des poids privés, puis la prédiction d'action via des partenaires sélectionnés en commençant par mimic robotics, puis la synthèse d'image, puis enfin l'accès à des poids ouverts pour le backbone multimodal sous le nom de FLUX 3 Dev. Seul le premier échelon a démarré, et l'échelon des poids ouverts n'a aucune date attachée.
Les chiffres réels les plus proches sont les tarifs de FLUX.2, et il vaut la peine de les connaître car ils préfigurent probablement ce que facturera FLUX 3 :
| Modèle FLUX.2 | Premier mégapixel | Mégapixel additionnel | Image de référence par MP |
|---|---|---|---|
[max] | $0.07 | $0.03 | $0.03 |
[pro] | $0.03 | $0.015 | $0.015 |
[flex] | $0.05 forfaitaire | $0.05 forfaitaire | $0.05 forfaitaire |
[klein] 9B | $0.015 | $0.002 | $0.002 |
[klein] 4B | $0.014 | $0.001 | $0.001 |
Ici, un mégapixel signifie une sortie en 1024x1024. La facturation arrondit au supérieur séparément pour la sortie puis à nouveau pour chaque image de référence, et tout ce qui dépasse 4 MP est redimensionné à la baisse. Le piège qui coince le plus de monde est cette ligne d'image de référence, car un flux d'édition utilisant trois références coûte sensiblement plus que ne le suggère le tarif affiché.

Ce qu'en disent les personnes qui font tourner ces modèles
Le fil de lancement a atteint 571 points sur 133 commentaires, le fil mimic 318. Et la réaction la plus intéressante là-dedans ne portait pas du tout sur la qualité. Elle portait sur la question de savoir pour qui FLUX est fait désormais.
"Given that Martin Scorsese is now an 'advisor', I suspect BFL will continue to position itself as the research lab for filmmakers."
Cette lecture colle mieux aux preuves que l'alternative. Un modèle tarifé pour des pipelines VFX est un produit différent d'un modèle tarifé pour de la génération de contenu en masse, et le matériel de lancement penche vers le premier. Si votre plan était du volume bon marché, c'est dans le palier [klein] de FLUX.2 que vit ce volume bon marché, pas ici.
C'est une chose utile à clarifier tôt, car cela détermine si FLUX 3 a même sa place dans votre budget. Une équipe qui produit une vidéo phare par trimestre et une équipe qui produit quarante clips sociaux par semaine veulent des choses opposées d'un fournisseur, et une seule de ces équipes devrait vraiment surveiller ce lancement. Le volet SEO de ce pipeline s'avère généralement être la contrainte réelle, plus que le coût de rendu.
Ce que j'en retiens quand acheter de l'IA est mon métier
Je ne vais pas prétendre qu'un modèle vidéo est un helpdesk. Ce qui se transpose, c'est la discipline de test, et cette partie-là se transpose exactement.
Le schéma de ce lancement est le même schéma que dans la plupart des argumentaires IA que je vois de l'autre côté de la table : ce qui impressionne et ce qui s'achète sont deux choses différentes, et le marketing ne les sépare pas pour vous. Black Forest Labs a été plus honnête que la plupart, et il a quand même fallu lire la page de tarifs pour découvrir que le produit n'est pas à vendre. Les éditeurs d'IA générative pour le service client sont rarement aussi transparents.
La version concrète de tout cela qui coûte de l'argent aux équipes de support, c'est la confiance. Un acheteur lors d'un appel commercial eesel a décrit ce mode d'échec mieux que je ne pourrais le faire.
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
une responsable CX gérant 7 000 tickets par mois, lors d'un appel commercial eesel
C'est le même instinct que se soucier du chiffre à backbone gelé plutôt que de la bande démo. Ce que l'on veut savoir, c'est le comportement en limite, pas le meilleur des cas. C'est pourquoi la définition de seuils de confiance est la première décision de configuration que je fais examiner à tout le monde, avant même le ton ou la couverture, et pourquoi agents IA contre chatbots traditionnels se joue exactement sur cette propriété.

Tester un modèle d'IA que l'on ne peut pas exécuter est frustrant. Tester un agent IA avant de s'y engager ne devrait pas l'être. C'est la seule chose que je demanderais à tout fournisseur de ce secteur, eesel y compris : montrez-moi mes propres chiffres avant que je signe quoi que ce soit. Avec eesel, on le pointe vers son helpdesk, il rejoue les tickets historiques, et ce qu'on récupère est le taux de résolution sur son propre arriéré plutôt qu'un score de préférence issu des prompts de quelqu'un d'autre. Chaque action atterrit dans un journal d'activité que l'on peut auditer ligne par ligne. Gratuit à l'essai, et cela prend des minutes plutôt qu'un formulaire de demande. Essayer eesel
Pour la version plus approfondie de cet argument, la déviation IA pour le tier-1 couvre ce qui est réellement automatisé, et l'IA générative pour les équipes de support couvre le déploiement.
Le verdict
| Dimension | Note | Pourquoi |
|---|---|---|
| Qualité de la recherche | A | Bases de comparaison réelles, ablations réelles, défaites publiées |
| Preuve robotique | A | Un contrôle à backbone gelé que personne n'avait à publier |
| Performance vidéo | C | Compétitif avec la frontière, pas en avance sur elle |
| Performance image | C moins | Échantillons du midtraining, aucun chiffre comparatif |
| Transparence | B plus | Réserves formulées, même si la réalité de l'accès reste enfouie |
| Disponibilité | F | Ni prix, ni API, ni poids, ni dates |
FLUX 3 est le lancement de modèle le mieux documenté que j'aie lu cette année, et aussi l'un des moins utilisables. Si vous construisez des robots ou travaillez dans un pipeline VFX, inscrivez-vous sur la liste d'accès anticipé, car ce résultat à backbone gelé indique que la représentation est réelle. S'il vous faut livrer des images ou des clips ce trimestre, utilisez plutôt quelque chose avec une grille tarifaire, et revenez voir une fois qu'il y aura un prix. Et si vous êtes ici parce qu'évaluer des fournisseurs d'IA est littéralement votre métier, ce qui vaut la peine d'être volé à ce lancement n'est pas le modèle lui-même. C'est l'habitude de publier la condition de contrôle.
Pour ce que vous pouvez acheter dès aujourd'hui à la place, mon comparatif des alternatives à FLUX 3 chiffre huit d'entre elles sur le même clip de dix secondes, et les meilleurs outils d'IA générative couvrent le champ plus large.
Si vous choisissez des modèles de texte dans la même foulée, les trois options de débit économique sur lesquelles je m'appuie sont DeepSeek V4 Flash, Gemini 3.5 Flash-Lite et Qwen 3.7 Flash.
Côté frontière, on trouve GPT-5.6 et Claude Opus 4.6, et quel LLM convient au support couvre la lecture spécifique au support de tous ces modèles.
Sources
- FLUX 3 launch announcement, Black Forest Labs
- FLUX 3 x mimic, the video-action thesis
- Self-Flow research page, arXiv preprint 2603.06507
- FLUX 3 model page
- Black Forest Labs pricing
- FLUX.2 overview docs
- Launch thread, Hacker News, 571 points
- mimic thread, Hacker News, 318 points
Questions fréquentes
FLUX 3 vaut-il le coup d'après ce test ?
Quelle est la qualité vidéo de FLUX 3 ?
Qu'est-ce que Self-Flow, et pourquoi compte-t-il dans un test de FLUX 3 ?
Puis-je déjà utiliser FLUX 3 pour des images ?
Combien coûtera FLUX 3 ?
[max], 0,03 $ sur [pro], 0,015 $ sur [klein] 9B et 0,014 $ sur [klein] 4B, un mégapixel correspondant à une sortie en 1024x1024, chaque image de référence étant arrondie séparément. Pour qui budgète par résultat plutôt que par unité, le coût par résolution est le cadre le plus pertinent.L'affirmation de FLUX 3 sur la robotique est-elle crédible ?
Les équipes de contenu devraient-elles attendre FLUX 3 ?
Quel est le plus gros point faible du lancement de FLUX 3 ?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








