Test de FLUX 3 : des preuves solides, rien à acheter pour l'instant

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification August 4, 2026

Vérifié par un expert
Illustration de deux évaluateurs pesant des panneaux d'images générées sur une balance, symbolisant un test de FLUX 3

Comment teste-t-on un modèle qu'on ne peut pas exécuter ?

Honnêtement, et en exposant la méthodologie dès le départ. Sinon, le test d'un modèle en accès anticipé n'est qu'une réécriture de l'annonce avec des adjectifs en plus.

Voici ce que j'ai pu vérifier. L'annonce de lancement et sa liste de fonctionnalités. La thèse de FLUX-mimic et ses graphiques de taux de réussite. La page de recherche Self-Flow, où vit réellement la méthode, publiée comme prépublication arXiv 2603.06507. La page du modèle, et la page de tarifs, qui s'est révélée être la plus informative de toutes. Et deux fils Hacker News où des personnes qui font tourner ces modèles en local ont réagi en temps réel. Chacun d'eux est lié intégralement en bas de page.

Voici ce que je n'ai pas pu vérifier : une seule génération. Je n'ai fait passer aucun prompt dans FLUX 3, et personne qui en parlait cette semaine ne l'a fait non plus, à moins d'être dans le programme d'accès anticipé.

La page du modèle FLUX 3 affichant une étiquette Coming Soon et un bouton Request early access, capturée le 4 août 2026 chez Black Forest Labs
La page du modèle FLUX 3 affichant une étiquette Coming Soon et un bouton Request early access, capturée le 4 août 2026 chez Black Forest Labs

Cette capture d'écran, c'est toute la surface du produit. Un formulaire de demande, en gros. La chose juste à évaluer ici, c'est donc le dossier documentaire, et il se révèle meilleur que ce que l'annonce de lancement laissait présager.

L'affirmation en question

FLUX 3 est un modèle de fondation multimodal qui s'entraîne sur des images, de la vidéo et de l'audio au sein d'une seule architecture, ce même backbone prédisant ensuite aussi des actions robotiques. Black Forest Labs présente cela comme l'apprentissage d'une représentation du monde plutôt que de trois compétences séparées. Comment les objets tiennent ensemble, comment les choses bougent, comment les événements sonnent.

La vue d'ensemble des capacités de FLUX 3 montrant un seul modèle couvrant image, vidéo, audio et action, publiée par Black Forest Labs
La vue d'ensemble des capacités de FLUX 3 montrant un seul modèle couvrant image, vidéo, audio et action, publiée par Black Forest Labs

La version concrète : de la vidéo avec audio natif jusqu'à 20 secondes en une seule génération, texte vers vidéo, image vers vidéo à partir d'une image de départ ou d'une référence visuelle, vidéo vers vidéo qui transporte un personnage dans une nouvelle scène, keyframe vers vidéo pour des transitions contrôlées, dialogue multilingue, et chaînage agentique de clips en séquences multi-plans. Chaque sortie arrive avec l'audio intégré plutôt que doublé après coup.

Ce dernier détail est celui que je testerais en premier si j'y avais accès. Un son qui tombe exactement sur l'image où l'impact se produit est un problème bien plus difficile qu'un son qui se contente de jouer par-dessus un clip, et c'est le genre de chose qui soit fonctionne, soit se ridiculise immédiatement.

Pour ceux qui planifient autour de cela : un plafond de 20 secondes avec audio intégré change ce que coûte un court clip explicatif, mais ne change pas la partie qui décide réellement si le clip est bon. Écrire le script de la vidéo reste l'étape que la plupart des équipes sautent.

Le papier vaut mieux que le billet de blog

C'est la partie du test dont je ne m'attendais pas à ce qu'elle en devienne le point fort. FLUX 3 est construit sur Self-Flow, et c'est sur la page de recherche, pas dans l'annonce, que Black Forest Labs montre vraiment son travail.

Le mécanisme s'appelle Dual-Timestep Scheduling, une variante du schéma standard de débruitage sur lequel repose tout modèle de diffusion. À partir d'une entrée propre, la méthode tire deux pas de temps et un masque aléatoire, puis bruite chaque token selon le pas de temps qui lui est assigné, de sorte que différentes parties de la même entrée arrivent à différents niveaux de corruption. La vue enseignante reçoit le niveau de bruit le plus bas, ce qui crée une asymétrie d'information délibérée, et l'élève est entraîné à débruiter l'entrée tout en reconstruisant les caractéristiques de l'enseignant. Tout ce mécanisme vise à ce que le modèle apprenne des représentations solides sans modèle enseignant externe rapporté.

Diagramme du Dual-Timestep Scheduling : une entrée propre devient une grille avec un bruit inégal par token, créant une asymétrie d'information, ce qui entraîne représentation et génération ensemble sans modèle enseignant externe
Diagramme du Dual-Timestep Scheduling : une entrée propre devient une grille avec un bruit inégal par token, créant une asymétrie d'information, ce qui entraîne représentation et génération ensemble sans modèle enseignant externe

Cela vaut la peine d'expliquer pourquoi cela compte pour un acheteur et pas seulement pour un chercheur. La voie habituelle vers la qualité sémantique dans un modèle génératif consiste à l'aligner sur un modèle de vision pré-entraîné séparé. Cela fonctionne bien, mais oblige aussi à entretenir deux modèles dont les objectifs ne s'accordent pas tout à fait. L'affirmation de Self-Flow est que la représentation peut sortir de l'entraînement génératif lui-même. Quiconque a déjà pesé le choix entre construire sur un encodeur pré-entraîné ou entraîner quelque chose de bout en bout reconnaîtra ce compromis, et mes notes sur les modèles d'IA sur mesure et l'entraînement d'un modèle d'IA couvrent la même bifurcation côté application.

Les ablations aussi sont réelles. La comparaison sur l'image fait tourner un backbone de 625M de paramètres sur 20M d'images face au flow matching classique, à REPA avec DINOv2, à REPA avec SigLIP2 et à SRA. Pour l'exécution multimodale conjointe, il s'agit d'un unique backbone FLUX.2 de 4B de paramètres entraîné sur 200M d'images et 6M de vidéos, sur 100 000 étapes de fine-tuning haute résolution. Des chiffres suffisamment précis pour être discutés, ce qui en soi dépasse déjà ce que donnent la plupart des lancements de modèles.

Le résultat de mise à l'échelle est l'affirmation la plus prometteuse pour l'avenir de toute cette sortie :

Graphique montrant l'écart de qualité entre Self-Flow et REPA qui se creuse à mesure que la taille du backbone passe de 290M à 1B de paramètres, tandis que REPA plafonne
Graphique montrant l'écart de qualité entre Self-Flow et REPA qui se creuse à mesure que la taille du backbone passe de 290M à 1B de paramètres, tandis que REPA plafonne

À mesure que la taille du modèle grimpe de 290M à 420M, puis 625M et 1B de paramètres, l'écart entre Self-Flow et REPA se creuse au lieu de se refermer, tandis que REPA montre des rendements décroissants. Une méthode qui s'améliore relativement avec l'échelle vaut bien plus qu'une méthode qui gagne à une seule taille donnée.

Voici maintenant la réserve du testeur, qui est bien réelle. Ces expériences plafonnent à 4B de paramètres sur 200M d'images. FLUX 3 lui-même est décrit comme significativement mis à l'échelle par rapport à cette configuration. Autrement dit, le papier valide la méthode, pas le modèle livré. Une preuve solide que l'architecture est saine, donc, et aucune preuve du tout sur ce qui se trouve derrière le formulaire de demande.

Les chiffres vidéo, lus tels qu'ils ont été écrits

Voici l'ensemble complet des préférences issu de l'annonce de lancement, mesuré sur des clips texte vers vidéo de 10 secondes en 720p avec audio.

Comparé àFLUX 3 préféré àLecture
Luma Ray 3.293%Victoire nette
Runway Gen-4.577%Victoire nette
Grok Imagine Video69%Victoire
Kling v3 Pro60%Courte victoire
Happy Horse v159%Courte victoire
Happy Horse 1.157%Courte victoire
Seedance 2.052%Pile ou face
Gemini Omni Flash52%Pile ou face
Graphique de la fréquence à laquelle les évaluateurs humains ont préféré FLUX 3 face à des modèles vidéo rivaux, de 52% face à Gemini Omni Flash à 93% face à Luma Ray 3.2, d'après Black Forest Labs
Graphique de la fréquence à laquelle les évaluateurs humains ont préféré FLUX 3 face à des modèles vidéo rivaux, de 52% face à Gemini Omni Flash à 93% face à Luma Ray 3.2, d'après Black Forest Labs

Deux choses méritent d'être saluées ici. Black Forest Labs a publié les défaites juste à côté des victoires, et a mis en gras sur sa propre page la réserve : le modèle et le système d'évaluation qui l'entoure sont encore en développement, donc les résultats sont préliminaires et censés s'améliorer.

Deux choses méritent d'être scrutées. L'ensemble de comparaison a été choisi par l'éditeur, sur des prompts écrits par l'éditeur, et Kling a déjà dépassé le v3 Pro qui a été benchmarké pour passer à la famille 3.0. Et le résumé honnête de ce tableau est "compétitif avec la frontière actuelle", pas "en avance sur elle", car les deux concurrents les plus proches se sont retrouvés à pile ou face.

Rien de tout cela ne rend le tableau inutile. Cela en fait une métrique de performance réalisée par l'éditeur, une catégorie de preuve bien réelle avec un biais connu, et on la lit comme on lit tout chiffre auto-déclaré : faire confiance à la forme, minorer l'ampleur, et aller chercher les défaites. Black Forest Labs a au moins imprimé les défaites.

Si vous voulez ces huit modèles chiffrés plutôt que classés, c'est exactement ce que fait mon comparatif des alternatives à FLUX 3, et l'analyse complète du lancement couvre la liste des fonctionnalités plus en profondeur qu'un test n'en a besoin.

Les évaluations d'images ont été menées sur un modèle encore en cours d'entraînement

L'annonce de lancement le dit clairement, et presque personne ne l'a cité : les améliorations d'image proviennent d'évaluations préliminaires réalisées pendant le midtraining. Les échantillons ont effectivement l'air solides, en particulier sur la typographie et le rendu de texte multilingue, ce qui se trouve être justement là où les versions précédentes de FLUX peinaient visiblement.

Grille d'échantillons d'images FLUX 3 dans des styles illustratif, photographique et typographique, publiée par Black Forest Labs
Grille d'échantillons d'images FLUX 3 dans des styles illustratif, photographique et typographique, publiée par Black Forest Labs

Cela vaut la peine de mettre cela en regard de la position réelle de la génération actuelle. Un opérateur qui gère un site de benchmark d'adhérence à des prompts complexes a noté FLUX.2 à 5 sur 15, Ideogram 4 à 8, et GPT Image 2 à 12 :

Hacker News

"I run a fairly high-traffic site for generative image models focusing on complex prompt adherence. Flux.2 doesn't score anywhere near SOTA proprietary models."

C'est l'écart que FLUX 3 Image doit combler, et il est large. Un autre commentateur a exprimé la frustration plus directement :

Hacker News

"I have a feeling open-weight models ought to be outperforming proprietary ones by now, but that still hasn't happened."

Pour un travail sur l'image livrable ce mois-ci, la comparaison que je ferais est FLUX.2 face à Nano Banana 2, sa variante Lite et GPT Image 2.

Si vous choisissez sur le coût plutôt que sur la qualité, la comparaison à trois modèles d'images est la page que je garde ouverte. L'édition locale est une compétence à part, et c'est l'édition d'images de Qwen que je benchmarkerais pour cela.

C'est aussi la moitié de FLUX 3 qui intéresse le plus les équipes de contenu, puisqu'une illustration est la partie d'un billet que la plupart des gens génèrent déjà. Si c'est votre cas d'usage, le pipeline compte plus que le modèle : l'automatisation de blog et la rédaction d'articles avec images couvrent comment les deux s'articulent, et la grille tarifaire de Midjourney est la base de coût sur laquelle je me repère.

La section robotique est la meilleure preuve de cette sortie

Si vous ne lisez qu'une seule partie du matériel FLUX 3, lisez le billet mimic. C'est là qu'une affirmation sur les représentations est mise à l'épreuve de la réalité physique, et la réalité physique est bien plus difficile à truquer qu'un sondage de préférence.

Black Forest Labs et mimic robotics ont construit FLUX-mimic en accrochant un décodeur d'action léger au chemin vidéo de FLUX 3, et Audi le teste sur du travail de manipulation d'objets souples en production. Sur une tâche de kitting d'objets souples menée sur 20 essais autonomes, le taux de réussite médian a atteint 95% pour FLUX-mimic contre 55% pour la référence pi-0.5.

Graphique des taux de réussite autonomes sur une tâche de kitting d'objets souples, avec FLUX-mimic à une médiane de 95% contre 55% pour la référence pi-0.5, d'après Black Forest Labs
Graphique des taux de réussite autonomes sur une tâche de kitting d'objets souples, avec FLUX-mimic à une médiane de 95% contre 55% pour la référence pi-0.5, d'après Black Forest Labs

Le chiffre que je brandirais réellement dans un débat est celui de la condition de contrôle. Backbone gelé, FLUX-mimic a tout de même atteint 65%, tandis qu'un pi-0.5 gelé est tombé à 0%. Geler le backbone retire le fine-tuning de l'équation, si bien qu'il ne reste que la qualité de la représentation que le modèle vidéo portait déjà. C'est toute la thèse de cette sortie, testée proprement, avec un résultat qui aurait été embarrassant s'il était tombé dans l'autre sens. Le publier quand même est la chose la plus crédible de tout ce lancement.

Ce n'est pas non plus un point de donnée isolé dans le domaine. Gemini Robotics 2 fait un pari structurellement similaire depuis le côté robotique plutôt que génération, ce qui est un assez bon signe que l'idée sous-jacente n'est pas juste le cadrage d'un seul labo.

La page Self-Flow ajoute ensuite une deuxième couche à la même histoire, cette fois depuis la simulation. En affinant les exécutions multimodales pondérées par la vidéo à 675M de paramètres et en évaluant la prédiction d'action dans le simulateur SIMPLER, Self-Flow a battu le flow matching classique sur toutes les tâches tôt dans l'entraînement, à 30 000 étapes, là où le flow matching a totalement échoué sur les tâches Open et Place. À 100 000 étapes, les tâches à objet unique avaient convergé, tandis que Self-Flow conservait son avantage sur les tâches à objets multiples et séquentielles. Le schéma reste constant d'un bout à l'autre : l'avantage apparaît sur les tâches compositionnelles difficiles et pas sur les faciles.

Un lecteur du fil a repéré le détail qui m'a le plus convaincu, et qui n'est même pas un taux de réussite.

Hacker News

"The video at around 3.30min, where the robot arm took 3 attempts to reseat the window trim, was quite unnerving - I have not seen such resolving before."

Réessayer après un échec sans qu'on le lui demande est une capacité différente de réussir du premier coup, et c'est celle qui compte vraiment une fois qu'un système tourne sans supervision. Cela m'importe pour la même raison que dans l'automatisation du support. Un système qui sait qu'il a échoué peut passer la main ; un système qui ne le sait pas se contente de consigner une réponse fausse avec assurance et de continuer. C'est la thèse derrière la passation d'agent IA et derrière la prévention des hallucinations IA.

Un autre commentateur a résumé le pari d'architecture en une seule phrase, mieux que ne l'a fait l'annonce de lancement :

Hacker News

"Upshot: a well trained multimodal video generation model has a world representation model trained inside it."

L'audit des preuves

Six affirmations, notées selon ce qui a réellement été publié plutôt que ce qui a été démontré. Ouvrez chacune d'elles.

Audit des preuves FLUX 3
Chaque note repose sur ce que Black Forest Labs avait publié au 4 août 2026. Cliquez sur une affirmation pour voir la preuve.
Un seul modèle pour l'image, la vidéo, l'audio et l'action
Publié : Une exécution conjointe à 4B de paramètres sur 200M d'images et 6M de vidéos, plus un décodeur d'action sur le même backbone, plus le contrôle à backbone gelé.
Note : A. Démontré architecturalement, à l'échelle de la recherche.
Une vidéo meilleure que la concurrence
Publié : Des taux de préférence réalisés par l'éditeur sur des prompts de l'éditeur, de 93% à 52%, signalés comme préliminaires sur un modèle encore en développement.
Note : C. Compétitif avec la frontière, pas en avance sur elle.
Un bond significatif de la qualité d'image
Publié : Des grilles d'échantillons et une amélioration affirmée sur les prompts complexes et le rendu de texte, issues d'évaluations menées pendant le midtraining.
Note : C moins. Des échantillons prometteurs, mais aucun chiffre comparatif.
Le backbone se transfère au contrôle robotique
Publié : 95% contre 55% de réussite médiane sur 20 essais, 65% contre 0% avec backbone gelé, un passage de backbone en moins de 80ms, et un déploiement Audi nommé.
Note : A. Le résultat le plus solide et le mieux contrôlé de toute la sortie.
La méthode passe à l'échelle
Publié : Un écart croissant avec REPA sur des backbones de 290M, 420M, 625M et 1B de paramètres, REPA plafonnant.
Note : A moins. Courbe réelle, bases de comparaison réelles, mais qui s'arrête bien en deçà de la taille de FLUX 3 lui-même.
On peut l'utiliser
Publié : Un formulaire de demande, une feuille de route de lancement en prose, et une page de tarifs sans ligne FLUX 3.
Note : F. Ce n'est pas un chemin d'achat. C'est celui-ci qui décide de votre trimestre.

Là où le test arrive au bout de la route

Tout test doit finir par répondre à "donc, dois-je l'acheter", et voici le point où je dois m'arrêter.

La page de tarifs de Black Forest Labs affichant des onglets pour FLUX.2, FLUX Tools et FLUX.1 seulement, sans ligne FLUX 3, d'après Black Forest Labs
La page de tarifs de Black Forest Labs affichant des onglets pour FLUX.2, FLUX Tools et FLUX.1 seulement, sans ligne FLUX 3, d'après Black Forest Labs

La page de tarifs a des onglets pour FLUX.2, FLUX Tools et FLUX.1. FLUX 3 n'y figure pas. La feuille de route de lancement fait d'abord passer la vidéo et l'audio via des API et un accès à des poids privés, puis la prédiction d'action via des partenaires sélectionnés en commençant par mimic robotics, puis la synthèse d'image, puis enfin l'accès à des poids ouverts pour le backbone multimodal sous le nom de FLUX 3 Dev. Seul le premier échelon a démarré, et l'échelon des poids ouverts n'a aucune date attachée.

Les chiffres réels les plus proches sont les tarifs de FLUX.2, et il vaut la peine de les connaître car ils préfigurent probablement ce que facturera FLUX 3 :

Modèle FLUX.2Premier mégapixelMégapixel additionnelImage de référence par MP
[max]$0.07$0.03$0.03
[pro]$0.03$0.015$0.015
[flex]$0.05 forfaitaire$0.05 forfaitaire$0.05 forfaitaire
[klein] 9B$0.015$0.002$0.002
[klein] 4B$0.014$0.001$0.001

Ici, un mégapixel signifie une sortie en 1024x1024. La facturation arrondit au supérieur séparément pour la sortie puis à nouveau pour chaque image de référence, et tout ce qui dépasse 4 MP est redimensionné à la baisse. Le piège qui coince le plus de monde est cette ligne d'image de référence, car un flux d'édition utilisant trois références coûte sensiblement plus que ne le suggère le tarif affiché.

Tableau de score du test réparti entre ce qui est prouvé, incluant la répartition du calcul publiée et le résultat à backbone gelé, face à ce qui est achetable, où prix, API et poids ouverts sont tous absents
Tableau de score du test réparti entre ce qui est prouvé, incluant la répartition du calcul publiée et le résultat à backbone gelé, face à ce qui est achetable, où prix, API et poids ouverts sont tous absents

Ce qu'en disent les personnes qui font tourner ces modèles

Le fil de lancement a atteint 571 points sur 133 commentaires, le fil mimic 318. Et la réaction la plus intéressante là-dedans ne portait pas du tout sur la qualité. Elle portait sur la question de savoir pour qui FLUX est fait désormais.

Hacker News

"Given that Martin Scorsese is now an 'advisor', I suspect BFL will continue to position itself as the research lab for filmmakers."

Cette lecture colle mieux aux preuves que l'alternative. Un modèle tarifé pour des pipelines VFX est un produit différent d'un modèle tarifé pour de la génération de contenu en masse, et le matériel de lancement penche vers le premier. Si votre plan était du volume bon marché, c'est dans le palier [klein] de FLUX.2 que vit ce volume bon marché, pas ici.

C'est une chose utile à clarifier tôt, car cela détermine si FLUX 3 a même sa place dans votre budget. Une équipe qui produit une vidéo phare par trimestre et une équipe qui produit quarante clips sociaux par semaine veulent des choses opposées d'un fournisseur, et une seule de ces équipes devrait vraiment surveiller ce lancement. Le volet SEO de ce pipeline s'avère généralement être la contrainte réelle, plus que le coût de rendu.

Ce que j'en retiens quand acheter de l'IA est mon métier

Je ne vais pas prétendre qu'un modèle vidéo est un helpdesk. Ce qui se transpose, c'est la discipline de test, et cette partie-là se transpose exactement.

Le schéma de ce lancement est le même schéma que dans la plupart des argumentaires IA que je vois de l'autre côté de la table : ce qui impressionne et ce qui s'achète sont deux choses différentes, et le marketing ne les sépare pas pour vous. Black Forest Labs a été plus honnête que la plupart, et il a quand même fallu lire la page de tarifs pour découvrir que le produit n'est pas à vendre. Les éditeurs d'IA générative pour le service client sont rarement aussi transparents.

La version concrète de tout cela qui coûte de l'argent aux équipes de support, c'est la confiance. Un acheteur lors d'un appel commercial eesel a décrit ce mode d'échec mieux que je ne pourrais le faire.

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

une responsable CX gérant 7 000 tickets par mois, lors d'un appel commercial eesel

C'est le même instinct que se soucier du chiffre à backbone gelé plutôt que de la bande démo. Ce que l'on veut savoir, c'est le comportement en limite, pas le meilleur des cas. C'est pourquoi la définition de seuils de confiance est la première décision de configuration que je fais examiner à tout le monde, avant même le ton ou la couverture, et pourquoi agents IA contre chatbots traditionnels se joue exactement sur cette propriété.

La vue d'activité eesel montrant chaque action IA effectuée à travers les conversations de helpdesk connectées, chacune avec son propre statut de résolution
La vue d'activité eesel montrant chaque action IA effectuée à travers les conversations de helpdesk connectées, chacune avec son propre statut de résolution

Tester un modèle d'IA que l'on ne peut pas exécuter est frustrant. Tester un agent IA avant de s'y engager ne devrait pas l'être. C'est la seule chose que je demanderais à tout fournisseur de ce secteur, eesel y compris : montrez-moi mes propres chiffres avant que je signe quoi que ce soit. Avec eesel, on le pointe vers son helpdesk, il rejoue les tickets historiques, et ce qu'on récupère est le taux de résolution sur son propre arriéré plutôt qu'un score de préférence issu des prompts de quelqu'un d'autre. Chaque action atterrit dans un journal d'activité que l'on peut auditer ligne par ligne. Gratuit à l'essai, et cela prend des minutes plutôt qu'un formulaire de demande. Essayer eesel

Pour la version plus approfondie de cet argument, la déviation IA pour le tier-1 couvre ce qui est réellement automatisé, et l'IA générative pour les équipes de support couvre le déploiement.

Le verdict

DimensionNotePourquoi
Qualité de la rechercheABases de comparaison réelles, ablations réelles, défaites publiées
Preuve robotiqueAUn contrôle à backbone gelé que personne n'avait à publier
Performance vidéoCCompétitif avec la frontière, pas en avance sur elle
Performance imageC moinsÉchantillons du midtraining, aucun chiffre comparatif
TransparenceB plusRéserves formulées, même si la réalité de l'accès reste enfouie
DisponibilitéFNi prix, ni API, ni poids, ni dates

FLUX 3 est le lancement de modèle le mieux documenté que j'aie lu cette année, et aussi l'un des moins utilisables. Si vous construisez des robots ou travaillez dans un pipeline VFX, inscrivez-vous sur la liste d'accès anticipé, car ce résultat à backbone gelé indique que la représentation est réelle. S'il vous faut livrer des images ou des clips ce trimestre, utilisez plutôt quelque chose avec une grille tarifaire, et revenez voir une fois qu'il y aura un prix. Et si vous êtes ici parce qu'évaluer des fournisseurs d'IA est littéralement votre métier, ce qui vaut la peine d'être volé à ce lancement n'est pas le modèle lui-même. C'est l'habitude de publier la condition de contrôle.

Pour ce que vous pouvez acheter dès aujourd'hui à la place, mon comparatif des alternatives à FLUX 3 chiffre huit d'entre elles sur le même clip de dix secondes, et les meilleurs outils d'IA générative couvrent le champ plus large.

Si vous choisissez des modèles de texte dans la même foulée, les trois options de débit économique sur lesquelles je m'appuie sont DeepSeek V4 Flash, Gemini 3.5 Flash-Lite et Qwen 3.7 Flash.

Côté frontière, on trouve GPT-5.6 et Claude Opus 4.6, et quel LLM convient au support couvre la lecture spécifique au support de tous ces modèles.

Sources

Questions fréquentes

FLUX 3 vaut-il le coup d'après ce test ?
Il n'y a encore rien qui vaille le coup. Au 4 août 2026, FLUX 3 n'a ni prix publié, ni API en libre-service, ni poids ouverts, et la page du modèle affiche toujours "Coming Soon" derrière un formulaire de demande. Ce que ce test de FLUX 3 peut vous dire, c'est que la recherche sous-jacente est documentée de façon inhabituellement complète, et que les chiffres de l'annonce de lancement sont préliminaires de l'aveu même de Black Forest Labs. Si vous avez besoin de résultats ce trimestre, mon comparatif des alternatives à FLUX 3 chiffre huit modèles que vous pouvez réellement acheter.
Quelle est la qualité vidéo de FLUX 3 ?
Dans les premières évaluations réalisées par Black Forest Labs elle-même sur des clips de 10 secondes en 720p avec audio, les évaluateurs humains ont préféré FLUX 3 à Luma Ray 3.2 dans 93% des comparaisons et à Runway Gen-4.5 dans 77%, mais seulement à 52% face à Seedance 2.0 comme face à Gemini Omni Flash. Ce 52% équivaut à un pile ou face. Black Forest Labs indique clairement que le modèle et le système d'évaluation sont encore en développement, la même prudence que j'applique à toute métrique de performance IA qu'un éditeur publie sur lui-même.
Qu'est-ce que Self-Flow, et pourquoi compte-t-il dans un test de FLUX 3 ?
Self-Flow est la méthode d'entraînement sur laquelle FLUX 3 est bâti, publiée sur le site de recherche de Black Forest Labs sous forme de prépublication. Elle utilise le Dual-Timestep Scheduling, qui bruite différents tokens d'une même entrée à des niveaux différents pour forcer le modèle à inférer ce qui manque, et apprend représentation et génération en même temps sans modèle enseignant externe. C'est important car c'est la partie la plus vérifiable de cette sortie : de vraies bases de comparaison, de vrais nombres de paramètres, de vraies ablations. Mon explicatif sur les modèles de diffusion couvre la famille à laquelle il appartient.
Puis-je déjà utiliser FLUX 3 pour des images ?
Non. FLUX 3 Image a été décrit comme arrivant "dans les semaines suivantes" et n'apparaît pas sur la page de tarifs. La documentation de Black Forest Labs elle-même continue de désigner FLUX.2 comme la famille recommandée pour tous les usages, donc FLUX.2 reste la réponse pratique pour le travail sur l'image aujourd'hui. Des tests indépendants d'adhérence aux prompts placent FLUX.2 largement derrière GPT Image 2, ce qui vaut la peine d'être su avant de s'y fier par défaut. Comparez-le d'abord à Nano Banana 2 et à la génération d'images d'OpenAI.
Combien coûtera FLUX 3 ?
Inconnu. La ligne tarifaire de FLUX 3 n'existe tout simplement pas. Les seuls vrais chiffres de Black Forest Labs sont les tarifs de FLUX.2 : 0,07 $ pour le premier mégapixel sur [max], 0,03 $ sur [pro], 0,015 $ sur [klein] 9B et 0,014 $ sur [klein] 4B, un mégapixel correspondant à une sortie en 1024x1024, chaque image de référence étant arrondie séparément. Pour qui budgète par résultat plutôt que par unité, le coût par résolution est le cadre le plus pertinent.
L'affirmation de FLUX 3 sur la robotique est-elle crédible ?
C'est la preuve la plus solide de toute la sortie. Sur une tâche de kitting d'objets souples menée sur 20 essais autonomes, FLUX-mimic a atteint un taux de réussite médian de 95% contre 55% pour la référence pi-0.5. Le chiffre que je citerais réellement est celui de la paire à backbone gelé : FLUX-mimic a tout de même atteint 65% avec son backbone gelé, tandis que pi-0.5 est tombé à 0%. C'est une affirmation sur la représentation elle-même, pas sur le fine-tuning. Cela rejoint ce que fait Gemini Robotics 2 dans l'autre sens.
Les équipes de contenu devraient-elles attendre FLUX 3 ?
Pas si vous livrez du contenu maintenant. Le signal sur lequel il vaut la peine de planifier, c'est qu'un seul modèle finira par couvrir une illustration, un court clip explicatif et sa voix off, au lieu de trois fournisseurs et trois factures. Tant qu'il n'y a pas de prix, construisez votre pipeline sur des modèles ayant une grille tarifaire réelle. C'est l'approche que j'adopterais pour toute décision autour d'un rédacteur de blog IA avec images, et le meilleur modèle d'IA pour le blogging couvre le volet texte.
Quel est le plus gros point faible du lancement de FLUX 3 ?
L'écart entre ce qui est démontré et ce qui est achetable, ainsi que le fait que les évaluations d'images aient été menées pendant le midtraining. Aucun des deux n'est malhonnête, et Black Forest Labs signale les deux, mais un lecteur qui survole juste la bande démo ne remarquerait ni l'un ni l'autre. Cet écart a exactement la même forme que la plupart des argumentaires IA pour le support, c'est pourquoi je teste les logiciels de service client agentiques sur l'historique réel avant qu'ils ne touchent un client, et je fais des tests adversariaux avant le lancement, pas après.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration d'un modèle produisant des panneaux d'image, de vidéo et d'audio, représentant FLUX 3 de Black Forest Labs
Trending

FLUX 3 : ce que Black Forest Labs a réellement livré

FLUX 3 est un seul modèle pour l'image, la vidéo, l'audio et les actions robotiques. Il n'a pourtant ni API, ni prix, ni poids ouverts pour l'instant. Voici ce que vous pouvez obtenir et ce que vous ne pouvez pas.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration de Google NotebookLM transformant des documents en un court aperçu vidéo vertical
Trending

NotebookLM Short Video Overviews : le format 60 secondes expliqué

Les nouveaux Short Video Overviews de NotebookLM transforment vos sources en un clip vertical de 60 secondes. Voici ce que fait ce format, comment il est construit, et où il montre ses limites.

Alicia Kirana UtomoAlicia Kirana UtomoJul 11, 2026
Illustration d'un modèle de contrôle de robot humanoïde, représentant Gemini Robotics 2
Trending

Gemini Robotics 2 : ce que montrent les chiffres de DeepMind

Gemini Robotics 2 lance trois modèles et un tableau de réussite par tâche où la plupart des scores restent sous 80%. Ce tableau est ce qu'il y a de plus utile dans toute cette sortie.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Un établi de développeur où un modèle d'IA termine une tâche proprement et cale sur celle d'à côté, dans le bleu de marque de Meta
Trending

Meta Muse Spark 1.1 à l'épreuve : un plafond haut et un plancher bas

Muse Spark 1.1 est le modèle le plus rapide du tableau et l'un des plus faibles en tâches agentiques. Un test pour savoir sur quels travaux ces tokens bon marché tiennent vraiment la route.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Illustration d'une puce de modèle compacte routant un token vers deux chemins d'experts allumés parmi beaucoup d'éteints, pour un explicatif Inkling-Small
Trending

Inkling-Small expliqué : un modèle de 276B dont 12B font le travail

Ce qu'est vraiment Inkling-Small : un MoE à poids ouverts de 276B/12B signé Thinking Machines, la fenêtre de contexte sur laquelle la documentation et les fournisseurs ne s'accordent pas, ce que coûte réellement un million de tokens, et sa place dans une pile de support.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Illustration comparant un petit noyau de modèle bien ordonné à un autre, bien plus grand et emmêlé, pour un avis sur Inkling-Small
Trending

Inkling-Small à l'essai : un quart de la taille, presque aussi malin

Un test concret d'Inkling-Small : il surpasse son propre modèle parent de 975B en code, avec un quart de la taille et un quart du prix, avant de s'effondrer sur la factualité. Voici ce que ce compromis coûte réellement.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Bannière illustrée pour un guide sur les tarifs et les coûts d'API de Google Gemini 3.5 Pro
Trending

Tarifs de Gemini 3.5 Pro : ce qu'il coûte (et ce qui manque encore)

Une réponse honnête sur les tarifs de Gemini 3.5 Pro : ce n'est pas encore disponible. Voici ce que coûte le palier Pro actuel, les offres grand public et le vrai calcul de l'API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement