
Ce qu'est vraiment Qwen 3.7 Flash
Je construis des intégrations et des API dans mon métier. Donc mon premier réflexe face à tout lancement est d'ignorer l'annonce et d'aller directement lire la fiche du modèle, et avec Qwen 3.7 Flash, c'était facile, car il n'y avait aucune annonce à ignorer.
Il n'existe aucun billet de blog Qwen pour ce modèle. Le fil d'articles de qwen.ai contient des billets de lancement pour Qwen 3.7 Max et Qwen 3.7 Plus, et rien du tout pour Flash. Une seule ligne dans le journal des modifications de QwenCloud, datée du 25 juillet 2026, est le seul avis officiel qui existe.
Il est apparu sur OpenRouter le 27 juillet 2026, sous le slug canonique qwen/qwen3.7-flash-20260727, avec un instantané épinglé nommé qwen3.7-flash-2026-07-15.
Voici la déclaration de positionnement dans son intégralité, reprise mot pour mot de la fiche modèle d'Alibaba Cloud :
"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."
C'est tout le discours. Pas de tableau de benchmarks, pas de nom d'évaluation, pas de pourcentage, pas d'architecture. Qwen n'a pas publié le nombre de paramètres. Ni si le modèle est dense ou un mélange d'experts, ni combien de tokens il a vus. Pour une entreprise qui a bâti sa réputation sur des sorties ouvertes, c'est une posture différente, et la communauté l'a remarqué.
Les faits mécaniques sont plus utiles. Texte, image et vidéo en entrée, texte en sortie. Le contexte est de 1 000 000 tokens, avec une entrée utilisable plafonnée à 991 808 et une sortie à 65 536, soit la moitié de ce que Plus et Max autorisent. Le budget de chaîne de raisonnement va jusqu'à 262 144 tokens et le raisonnement est activé par défaut. L'appel de fonctions fonctionne. Il existe aussi des outils intégrés pour l'interprétation de code et l'extraction web, ainsi que la recherche d'images et de texte.

La carte de la gamme réserve une vraie surprise. Flash est le moins cher des trois et le plus rapide des trois, 59 tokens par seconde contre 12 pour Plus, et c'est aussi le seul qui accepte la vidéo. Qwen 3.7 Max, le porte-drapeau, est uniquement textuel. Normalement, c'est le niveau économique qui est bridé ; ici, c'est le niveau économique qui voit le plus.
Le prix, et la partie que l'étiquette ne dit pas
Si je ne devais lire qu'une seule section de cet article, ce serait celle-ci. Le chiffre de $0,03 que tout le monde cite est réel. C'est aussi le meilleur des trois cas de figure.
| Taille du prompt | Entrée / 1M | Sortie / 1M | Lecture cache / 1M | Écriture cache / 1M |
|---|---|---|---|---|
| Moins de 32K tokens | $0,03 | $0,13 | $0,006 | $0,038 |
| 32K à 256K | $0,10 | $0,40 | $0,02 | $0,125 |
| 256K à 1M | $0,20 | $0,80 | $0,04 | $0,25 |
Ces tarifs proviennent de l'API des modèles d'OpenRouter, et la même structure à trois paliers apparaît en yuans sur la fiche d'Alibaba elle-même : 0,2, 0,6 et 1,2 CNY par million de tokens en entrée à Pékin, Francfort et Tokyo. Ce sont deux vues d'un même barème tarifaire, il n'y a donc aucune contradiction à résoudre.

Le marketing associe donc « modèle de vision le moins cher » et « contexte de 1M » et vous laisse penser que vous obtenez les deux à la fois. Ce n'est pas le cas. Le contexte de 1M et le prix de $0,03 s'excluent mutuellement. Tout ce qui a réellement besoin d'une fenêtre longue atterrit dans le palier supérieur, à 6,7 fois le tarif que vous aviez budgété, qu'il s'agisse d'une grosse base de code, d'une vidéo ou d'une pile de documents.
Rien de tout cela n'est théorique. OpenRouter publie ce que paient réellement ses clients après mise en cache, sous forme de moyenne glissante sur 30 jours, et pour ce modèle c'est $0,044 en entrée et $0,149 en sortie avec un taux de succès de cache de 51,0 %. Que cette moyenne se situe au-dessus du tarif de liste n'est possible que si une part significative du trafic réel paie déjà les paliers 32K et 256K. La réduction liée à la mise en cache ne vous sauve pas non plus.
Faites le calcul avec vos propres chiffres.
Quelques particularités régionales méritent d'être connues avant de choisir un point d'accès. Sur le même modèle, Singapour coûte environ 22 % de plus que Pékin, Francfort et Tokyo. La recherche web ne fonctionne qu'à Pékin et à Singapour. L'inférence par lots ne fonctionne qu'à Pékin, et le fine-tuning n'est disponible nulle part.
Comment il se compare au reste du segment économique
Même en tenant compte des paliers, le prix reste l'histoire centrale. Voici le paysage actuel des modèles économiques capables de vision, avec tous les chiffres tirés des pages tarifaires propres à chaque fournisseur. Les sorties au tarif frontière comme Kimi K3 sont hors périmètre ici.
| Modèle | Entrée $/1M | Sortie $/1M | Contexte | Vision | Sortie |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0,03 | $0,13 | 1M | Texte, image, vidéo | 27 juil. 2026 |
| Mistral Small 4 | $0,15 | $0,60 | 256K | Texte, image | 16 mars 2026 |
| GPT-5.6 Luna | $0,20 | $1,20 | 1,05M | Texte, image | 9 juil. 2026 |
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 | Non publié | Texte, image | Non publié |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 | 1 048 576 | Texte, image, vidéo | 21 juil. 2026 |
| Claude Haiku 4.5 | $1,00 | $5,00 | 200K | Texte, image | 15 oct. 2025 |
| Gemini 3.6 Flash | $1,50 | $7,50 | 1 048 576 | Texte, image, vidéo | 21 juil. 2026 |
Plusieurs choses sautent aux yeux. Qwen est ici un ordre de grandeur moins cher, 5 fois moins que Mistral Small 4 et 10 fois moins que Gemini 3.5 Flash-Lite en entrée. C'est aussi le seul modèle de l'ensemble à accepter la vidéo à un tarif d'entrée inférieur à $0,10, là où GPT-5.6 Luna et Mistral Small 4 se limitent à l'image.
Il y a un piège à éviter si vous comparez par vous-même. Gemini 3.1 Flash-Lite reste moins cher que 3.5 Flash-Lite, à $0,25/$1,50 contre $0,30/$2,50. Plus récent ne veut pas automatiquement dire moins cher dans la gamme Google, où Gemini 3.6 Flash se situe en haut de gamme. Et GPT-5.6 Luna a baissé son prix de 80 % le 30 juillet 2026, un jour avant que j'écrive ceci, ce qui en fait un concurrent bien plus proche qu'il ne l'était il y a une semaine.
Le modèle qu'il bat vraiment, cependant, c'est son propre prédécesseur. Face à Qwen 3.6-Flash à $0,1875/$1,125, le nouveau niveau de base est 6,25 fois moins cher en entrée et 8,65 fois moins cher en sortie. Alibaba vient de réduire son propre plancher tarifaire en vision d'un ordre de grandeur en une seule sortie, quoi qu'il en soit par ailleurs de ce lancement.
Ici, « Flash » signifie bon marché, pas rapide
C'est là que le nom induit en erreur. Chez Google, Flash signifie faible latence. Ici, cela signifie prix bas. Ce sont des produits très différents.
OpenRouter mesure l'unique fournisseur à 59 tokens de sortie par seconde en P50, avec 1,20 s de délai jusqu'au premier token. Artificial Analysis mesure Gemini 3.5 Flash-Lite à 382 tokens par seconde et GPT-5.4 mini à 177. Les bancs de test et les conditions diffèrent, il faut donc prendre ce ratio avec prudence. Un écart de 6 fois reste tout de même bien trop large pour être du bruit de mesure, et le raisonnement activé par défaut fait encore chuter ce chiffre.
Il existe un point de données dissonant. Un développeur qui l'a testé dans un outil de codage a rapporté un débit bien meilleur que ce que montre la télémétrie d'OpenRouter :
"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."
Ses 150 TPS représentent environ 2,5 fois le P50 mesuré par OpenRouter, et des prompts courts avec un cache chaud peuvent produire cela. Je continuerais quand même à planifier sur la base de 59 plutôt que de 150, car c'est le trafic de production qu'échantillonne OpenRouter.
La traîne est la partie qui m'empêcherait de dormir. La latence de bout en bout est de 3,56 s en P50 et de 8,54 s en P75, ce qui est correct. Puis elle passe à 17,96 s en P90, 29,03 s en P95, et 90,19 s en P99.

Pour un traitement par lots, cette traîne est invisible. Pour tout ce qu'une personne attend, une requête sur cent qui met une minute et demie cesse d'être un simple indicateur pour devenir une décision produit. Et cela s'aggrave dans une boucle d'agent IA, où un seul appel d'outil lent bloque chaque étape derrière lui.
Deux autres chiffres du même panneau. Le taux d'erreur des appels d'outils est de 8,88 %, contre 6,45 % pour Plus, ce qui signifie qu'environ un appel d'outil sur onze échoue sur un modèle explicitement vendu pour le travail d'agent. Et exactement un fournisseur le sert. Pas de routage de secours, donc, si Alibaba Cloud connaît un mauvais après-midi.
Il y a également un petit conflit de documentation que je n'ai pas pu résoudre. La fiche modèle d'Alibaba indique que les sorties structurées sont prises en charge. La liste des paramètres d'OpenRouter n'expose pas le drapeau des sorties structurées pour Flash, seulement response_format, alors qu'elle l'expose pour Plus et Max. Si l'application stricte de schéma compte pour votre pipeline, testez-la avant de vous engager plutôt que de faire confiance à l'une ou l'autre page.
L'unique benchmark indépendant qui existe
Qwen n'a rien publié, je suis donc allé chercher quelqu'un qui l'avait réellement noté. Il en existe exactement un.
Artificial Analysis ne référence pas ce modèle. La page du modèle renvoie une 404, et un grep du plan du site confirme que les seules pages Qwen 3.7 sont Max et Plus. LMArena n'a pas non plus d'entrée Flash. Aucun indice d'intelligence des sources habituelles, donc, pas d'Elo, et aucun score de qualité publié, de quelque nature que ce soit.
Les évaluations de vision de Roboflow font exception, et elles ne sont pas flatteuses :
| Tâche | Score | Classement |
|---|---|---|
| Global | 61,7 % | #22 sur 23 |
| Identification | 84,4 % | #10 sur 23 |
| Transcription OCR | 84,1 % | #23 sur 23 |
| Extraction de données | 78,4 % | Non classé |
| Détection d'objets | 42,8 % mAP@50 | #16 sur 23 |
| Comptage d'objets | 46 % correspondance exacte | Non classé |
| Coût par échantillon | ~$0,0001 | #1 sur 23 |
Il termine 22e sur 23 au global avec 61,7 %, juste derrière GPT-5.4 mini à 63,5 %, et premier sur 23 côté coût. Pour être juste : le résultat OCR est la dernière place d'un peloton très serré et ce n'est pas un échec, puisqu'un taux de correspondance moyen de 84,1 % reste respectable en valeur absolue. Et Qwen n'a jamais revendiqué l'OCR ou le contrôle GUI comme des points forts de Flash. Cela appartient à Plus. Donc « dernier en OCR » est cohérent avec ce qu'a annoncé Alibaba, plutôt qu'une promesse non tenue.
Mais cela clarifie bien ce que l'on achète. L'identification est son point fort à 84,4 % ; la localisation est son point faible à 42,8 %. Il peut vous dire ce qu'il y a sur l'image bien mieux qu'il ne peut vous dire où. Si votre charge de travail est « étiqueter dix millions d'images par catégorie », c'est un excellent choix pour un dixième de centime par millier d'échantillons. Si c'est « lire cette facture et extraire les lignes », tournez-vous vers autre chose.
Ce que dit la communauté, et pourquoi il y en a si peu
C'est la chose la plus étrange de cette sortie, et je pense que c'est la plus révélatrice.
Un modèle de vision à $0,03 par million de tokens a été lancé il y a quatre jours et il n'y a pas un seul commentaire à son sujet sur Hacker News. Une recherche en texte intégral sur HN pour qwen3.7-flash renvoie zéro résultat, sur les articles comme sur les commentaires, sur toute la période. Aucun fil de lancement n'a jamais été soumis. Le seul article intitulé Qwen sur cette période, « Qwen 3.7 or 3.8 30B – 100B. QWhen? », n'a récolté aucun commentaire.
Et ça continue. La conversation Qwen bien vivante sur HN la semaine du lancement se déroulait dans un fil DeepSeek, où les gens se demandaient si Qwen sortirait un jour un modèle de vision, quatre jours après que Qwen a effectivement sorti un modèle de vision.
"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."
"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."
Ce deuxième commentaire pointe directement la raison. Le public qui suivait autrefois les sorties de Qwen, c'est la communauté des poids locaux, et Qwen a cessé de la servir. Le même point est ressorti dans un fil sur GLM 5.2 :
"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."
Flash est fermé lui aussi. Hugging Face renvoie un tableau vide pour ce modèle, et Roboflow indique une licence propriétaire. Quelqu'un espérait encore le contraire le jour du lancement :
"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"
Cela traduit l'espoir que Qwen 3.7 devienne bientôt disponible pour l'IA locale. Ça ne sera pas le cas.
Je dois être franc sur ce qu'est cette section. Aucune de ces citations ne porte sur Flash, car de telles citations n'existent pas encore. Elles portent sur la famille 3.7 et le vide que Flash a été conçu pour combler. Les verdicts sur la famille vont dans les deux sens, d'un commentateur de HN qui rapporte un mois d'usage quotidien et qualifie 3.7 Pro de « totalement inutilisable », jusqu'à chewz qui classe 3.7 Max au-dessus du niveau d'Opus en vitesse. Une phrase de ce fil m'est restée en tête, sachant que Qwen n'a publié aucun benchmark pour Flash :
"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."
Il y a une certaine symétrie à sortir un modèle sans aucun score de benchmark pour un public qui avait cessé d'y croire.
Pendant ce temps, des gens l'utilisent discrètement. Le panneau d'activité d'OpenRouter montre Hermes Agent comme le plus gros consommateur, devant Claude Code et une poignée d'outils de codage. L'usage est bien réel ; le discours, lui, n'a tout simplement jamais eu lieu.
Qui devrait vraiment l'utiliser
Mon avis, sans détour.
Tournez-vous vers lui si vous menez un travail de vision à fort volume et faible enjeu, où se tromper occasionnellement coûte peu et où le coût élevé serait fatal. L'étiquetage massif d'images. La classification de contenu en première passe, le tri de miniatures, « y a-t-il une personne dans cette image », le pré-filtrage avant qu'un meilleur modèle ne fasse la passe minutieuse. À environ un centième de centime par échantillon, cela change ce qu'il devient économiquement rentable de traiter, et c'est un vrai changement de donne.
Passez votre chemin si vous avez besoin d'OCR ou d'extraction de documents, d'une localisation précise des objets, d'une latence prévisible, de poids que vous pouvez héberger, ou de tout signal de qualité publié à montrer à un décideur. Passez aussi votre chemin si vos prompts sont habituellement longs, car à ce stade GPT-5.6 Luna, après sa baisse de prix de 80 %, commence à sembler raisonnable, tout comme Gemini 3.5 Flash-Lite. Les deux sont d'ailleurs bien plus rapides.
Si vous voulez spécifiquement la famille Qwen mais avez besoin de plus de capacité, Qwen 3.8 Max est à l'autre bout de la gamme, et notre sélection des alternatives à Qwen couvre le reste.
Le facteur décisif, c'est de savoir si une mauvaise réponse vous coûte quelque chose. C'est une question de produit plutôt que de benchmark, et c'est la question que je réglerais avant d'écrire la moindre ligne de code d'intégration.
Si cela doit s'approcher d'une file de support, lisez ceci d'abord
C'est ici que je dois être franc, car c'est la partie sur laquelle j'ai vraiment des cicatrices.
Je construis des intégrations chez eesel, et nous faisons tourner de l'IA sur des files de support réelles depuis des années, à travers des milliers de tickets réels. Le malentendu le plus coûteux que je vois est précisément celui qu'encourage le tableau tarifaire de cet article : croire que le modèle est le produit. Un modèle à $0,03 donne l'impression que construire son propre bot de support est presque gratuit. Le calcul du coût par ticket a aussi fière allure sur un tableur. Mais le modèle n'a jamais été la partie coûteuse.
Les parties coûteuses, ce sont la recherche sur un centre d'aide qui se contredit lui-même, la classification des tickets qui achemine vers le bon endroit, et savoir quand se taire. L'escalade qui ne lâche pas le client. Un moyen de découvrir que l'on a tort avant que le client ne le découvre. Rien de tout cela n'est inclus dans le prix du token. Nous l'avons appris à nos dépens en voyant des bots au ton assuré donner des réponses fausses avec assurance, c'est pourquoi chaque déploiement que nous faisons est désormais simulé sur des tickets historiques avant de toucher une file en production.
Je ne vais pas prétendre que personne ne fait fonctionner la voie du développement maison. Une partie de notre propre attrition tient exactement à cela : des clients partis pour construire directement sur une API de LLM, dont une entreprise de technologie de construction/RA et une marque de beauté DTC. C'est une option réelle, et parfois la bonne. Mais les équipes qui ont regardé cela de plus près ont généralement atterri ailleurs. Un responsable ingénierie d'une entreprise de matériel de distributeurs automatiques Bitcoin, gérant une base de connaissances de 300 articles répartie entre Confluence et Telegram, l'a formulé ainsi :
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Et ce qui décide vraiment si l'IA de support fonctionne, c'est la retenue, ce qu'aucun score de modèle ne capture. Un responsable expérience client dans une marque traitant 7 000 tickets par mois l'a formulé mieux qu'aucun benchmark ne le pourrait :
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Confrontez maintenant Qwen 3.7 Flash à cette barre. Un taux d'erreur des appels d'outils de 8,88 %, un P99 qui s'étire jusqu'à 90 secondes, et aucun score de qualité publié, sans compter aucune évaluation indépendante hormis celle qui le classe 22e sur 23. Ce sont des chiffres parfaitement acceptables pour étiqueter un million d'images. Ce ne sont pas les chiffres que je voudrais entre ma marque et un client agacé. Le guide de déviation des tickets et nos notes sur le taux de résolution IA approfondissent pourquoi le seuil de confiance compte plus que le modèle brut.
Si vous voulez tout de même emprunter la voie du développement maison, je commencerais par RAG contre fine-tuning, puis je lirais sur l'entraînement d'une IA sur une base de connaissances. Ensuite, consacrez du temps réel à la prévention des hallucinations. Aucun de ces problèmes ne devient moins cher quand les tokens le deviennent.
Essayez eesel
Si ce que vous vouliez vraiment obtenir d'un modèle à $0,03, c'était une automatisation du support moins chère, vous pouvez sauter l'étape d'assemblage. eesel se connecte au helpdesk que vous utilisez déjà et apprend de vos tickets passés et de votre centre d'aide, puis répond aux questions pour lesquelles il est confiant tout en laissant le reste de côté.
Ce qui vaut le coup d'être repris, quel que soit ce sur quoi vous construisez : avant que quoi que ce soit ne passe en production, vous le faites tourner sur votre historique réel de tickets et obtenez un rapport noté de ce qu'il aurait répondu. C'est ainsi que vous découvrez qu'un modèle se trompe sans que ce soit un client qui le découvre en premier. C'est le contrôle qu'aucun prix de token ne peut vous acheter.

Vous pouvez essayer eesel gratuitement, ou réserver une démo si vous préférez d'abord le voir fonctionner sur votre propre file.
Questions fréquentes
Combien coûte Qwen 3.7 Flash ?
Qwen 3.7 Flash est-il bon pour l'OCR ?
Les poids de Qwen 3.7 Flash sont-ils open source ?
Qwen 3.7 Flash contre Gemini 3.5 Flash-Lite : lequel est le plus rapide ?
Puis-je utiliser Qwen 3.7 Flash pour le support client ?
Que se passe-t-il si Qwen 3.7 Flash tombe en panne ?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







