
La grille tarifaire, et les quatre compteurs qui se cachent derrière
Voici le prix publié, dans son intégralité, tel qu'il s'applique réellement.
| Taille du prompt | Entrée / 1M | Sortie / 1M | Lecture cache / 1M | Écriture cache / 1M |
|---|---|---|---|---|
| Moins de 32K tokens | $0.03 | $0.13 | $0.006 | $0.038 |
| 32K à 256K | $0.10 | $0.40 | $0.02 | $0.125 |
| 256K à 1M | $0.20 | $0.80 | $0.04 | $0.25 |
Ces tarifs viennent de l'API de modèles d'OpenRouter, le même flux qui alimente la page du modèle Qwen3.7 Flash. La fiche modèle sur Alibaba Cloud Model Studio affiche la même structure à trois paliers en CNY.
Quatre éléments font varier le montant qui vous est facturé, et un seul figure dans ce tableau.

Entrez votre propre charge de travail dans les quatre :
Le reste de cet article explique ce que chacune de ces quatre variables fait réellement.
Compteur 1 : le palier de taille de prompt, et comment les boucles d'agents finissent par y glisser
La tarification est échelonnée selon la taille du prompt, pas selon le nombre de tokens que vous achetez sur un mois. Un appel avec 32,001 tokens de prompt est facturé à $0.10 par million sur chacun d'entre eux, pas seulement sur ceux qui dépassent la limite. Passez 256K et toute la requête est de nouveau retarifée à $0.20.
Cela rend le palier supérieur 6.7x plus élevé que le tarif d'entrée affiché et 6.2x plus élevé que le tarif de sortie affiché. Cela signifie aussi que les deux chiffres présents dans chaque titre sur ce modèle, « le modèle vision le moins cher » et « 1M de contexte », ne peuvent pas être vrais en même temps dans le même appel. Mon collègue Rama a détaillé ce compromis dans le test de Qwen 3.7 Flash ; la version fiche technique se trouve dans la présentation de Qwen 3.7 Flash.
Ce qui est moins évident, c'est comment on y arrive sans le vouloir. Les boucles d'agents glissent d'un palier à l'autre d'elles-mêmes :
- Un prompt système avec des schémas d'outils représente souvent déjà 3K à 8K tokens avant que l'utilisateur n'ait dit quoi que ce soit.
- Les documents récupérés viennent s'ajouter par-dessus. Quatre articles de centre d'aide de 2K chacun, c'est encore 8K.
- Chaque tour renvoie toute la conversation, si bien que le tour 1 peut faire 12K et le tour 6 déjà 40K.
Le tour 1 est facturé à $0.03. Le tour 6 est facturé à $0.10, rétroactivement sur l'ensemble du prompt. Rien n'a changé dans votre code. C'est le même type de problème que choisir un modèle sur son tarif affiché ailleurs, ce qui explique pourquoi Opus 5 contre Sonnet 5 finit par être un débat sur le coût par tâche accomplie plutôt que sur le coût par token.
La preuve que cela arrive réellement aux utilisateurs se trouve sur la page du fournisseur lui-même. OpenRouter publie une moyenne pondérée mobile sur 30 jours de ce que les clients paient après caching, et pour ce modèle, c'est $0.044 en entrée et $0.149 en sortie avec un taux de succès de cache de 51.0%. Le prix effectif se situe au-dessus du prix catalogue, ce qui n'est arithmétiquement possible que si une part significative du trafic paie les paliers supérieurs.
Si vous comparez des modèles sur leurs grilles tarifaires, le même piège existe ailleurs, sous un autre déguisement. Les tarifs de GPT-5.6 doublent l'entrée et ajoutent 50% à la sortie au-delà de 272K tokens, et les tarifs de Claude facturent une prime pour les écritures de cache. Seul Qwen3.7 Max reste à tarif plat sur toute la fenêtre, ce qui coûte 49x plus par token d'entrée pour y arriver.
Compteur 2 : le caching, où écrire dans le cache coûte plus cher que ne pas cacher
C'est le compteur sur lequel on se trompe le plus souvent, et cela vaut le coup de faire le calcul une bonne fois.
Qwen 3.7 Flash expose deux types de cache. Le caching implicite se lit à 20% du tarif d'entrée standard et ne coûte rien à créer. Le caching explicite est scindé en deux : vous payez un tarif de création puis un tarif de lecture bien plus bas. Sur le listing en USD d'OpenRouter, le cache explicite de cinq minutes se crée à $0.038 et se lit à $0.003, contre un tarif d'entrée standard de $0.03.
Relisez bien. Écrire une entrée de cache coûte 1.27x ce qu'il aurait coûté d'envoyer simplement les tokens.

Le calcul tourne vite en votre faveur. Écrivez une fois et lisez une fois, et vous aurez dépensé $0.041 par million contre $0.060 sans cache, donc le cache est déjà rentable. Chaque lecture suivante est presque gratuite. Tout cela ne tourne mal que dans un cas précis : le cache expire avant que quiconque ne le lise, et vous avez payé une prime de 27% pour rien.
Ce qui est exactement la forme d'une file de support. Les tickets n'arrivent pas en une rafale concentrée contre le même contexte, ils arrivent au compte-gouttes tout au long de la journée. Une durée de vie de cinq minutes est généreuse pour une session de chat et inutile pour une boîte de réception. Le taux de succès de cache de 51% qu'OpenRouter mesure sur l'ensemble du trafic de ce modèle est une hypothèse de planification raisonnable, pas les 90% que vous obtenez dans un script de benchmark.
Deux règles pratiques en découlent. Utilisez le caching implicite par défaut, puisqu'il n'a pas de coût de création et se lit tout de même à 20%. Réservez le caching explicite aux préfixes pour lesquels vous êtes sûr qu'ils seront touchés à répétition dans la fenêtre, comme un long prompt système sur un endpoint à fort débit. Si vous construisez du retrieval par-dessus, le compromis RAG contre LLM compte aussi ici, car un contexte récupéré plus petit est à la fois moins cher par appel et moins susceptible de vous faire basculer dans le palier suivant.
Compteur 3 : la remise batch n'existe que dans exactement une région
La fiche modèle d'Alibaba elle-même tarifie ce modèle en CNY, dans quatre tableaux régionaux distincts, et les différences ne sont pas cosmétiques.
| Poste de facturation (par 1M, palier de base) | Pékin | Singapour | Francfort | Tokyo |
|---|---|---|---|---|
| Entrée | 0.2 CNY | 0.225 CNY | 0.2 CNY | 0.2 CNY |
| Sortie | 0.8 CNY | 0.974 CNY | 0.8 CNY | 0.8 CNY |
| Lecture cache implicite | 0.04 CNY | 0.045 CNY | 0.04 CNY | 0.04 CNY |
| Entrée (Batch File) | 0.1 CNY | — | — | — |
| Sortie (Batch File) | 0.4 CNY | — | — | — |
Trois constats dans ce tableau.
Les tarifs Batch File réduisent de moitié les deux compteurs, et cela n'existe qu'à Pékin. Batch Inference est marqué comme non pris en charge dans les grilles de capacités de Singapour, Francfort et Tokyo, si bien que la remise de 50% que tout autre fournisseur propose mondialement dépend ici de l'endroit où vous déployez. Notez aussi le piège dans le piège : les lignes Batch Chat sont tarifées à 0.2 et 0.8, identiques au standard. Seule la voie batch basée sur fichiers bénéficie de la remise.
Singapour coûte plus cher pour le même modèle. L'entrée est 12.5% au-dessus du tarif de base et la sortie environ 22% au-dessus. Rien dans la grille de capacités ne l'explique ; c'est simplement une grille tarifaire différente.
La recherche web est aussi limitée par région, prise en charge à Pékin et Singapour et non prise en charge à Francfort et Tokyo. C'est une question de fonctionnalité plus que de prix, jusqu'à ce qu'il faille brancher une API de recherche séparée et la payer deux fois.

Encore un mot sur la devise. La fiche modèle affiche du CNY sur chaque onglet et ne montre aucun chiffre en USD nulle part ; les tarifs en dollars que tout le monde cite proviennent du listing de revente d'OpenRouter. Ce sont deux vitrines pour un même schéma tarifaire, pas une contradiction à résoudre, et convertir entre les deux vous donnera un chiffre qui ne correspond à aucune des deux factures. Calculez le prix selon la vitrine par laquelle vous achetez réellement. Toute personne comparant entre fournisseurs se heurtera au même problème, ce qui explique en partie pourquoi la comparaison OpenAI contre Anthropic contre Gemini est plus difficile que de lire trois pages de tarifs.
Compteur 4 : les retentatives, la ligne que personne ne budgétise
OpenRouter mesure un taux d'erreur d'appels d'outils de 8.88% pour ce modèle, contre 6.45% pour Qwen3.7 Plus. Dans une boucle d'agent, un appel d'outil échoué n'est pas gratuit. Vous avez payé pour le prompt qui l'a produit, et vous paierez à nouveau pour la retentative qui inclut l'échec dans son contexte, avec une taille de prompt légèrement plus grande.
Neuf pour cent n'est pas catastrophique, mais cela appartient au modèle, c'est pourquoi le calculateur ci-dessus l'ajoute comme multiplicateur plutôt que de le laisser en note de bas de page.
La traîne de latence raconte la même histoire, mais en temps plutôt qu'en argent. Le P50 de bout en bout est de confortables 3.56 secondes. Le P99 est de 90.19 secondes. Si votre timeout est inférieur à cela, vous annulez et réémettez environ un appel sur cent, et vous payez pour les deux. Et comme exactement un seul fournisseur propose ce modèle, il n'y a aucune route de repli vers laquelle basculer quand cela ralentit.
« Flash » est une promesse sur le prix, pas sur la vitesse. À 59 tokens de sortie par seconde, ce modèle est environ six fois plus lent que Gemini 3.5 Flash-Lite, ce qui compte vraiment si quelque chose attend la réponse. Il est aussi, curieusement, environ cinq fois plus rapide que son propre frère Plus.
Comment il se positionne face au reste du segment vision bon marché
Chaque chiffre ci-dessous provient de la page tarifaire du fournisseur lui-même, au palier synchrone standard.
| Modèle | Entrée $/1M | Sortie $/1M | Contexte | Vision | Le piège dans la grille tarifaire |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0.03 | $0.13 | 1M | Texte, image, vidéo | Trois paliers ; le batch est réservé à Pékin |
| Mistral Small 4 | $0.15 | $0.60 | 256K | Texte, image | Tarif plat, mais la plus petite fenêtre ici |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05M | Texte, image | 2x l'entrée au-delà de 272K ; le batch le réduit de moitié |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | Non publié | Texte, image | Moins cher que le 3.5 Flash-Lite plus récent |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1,048,576 | Texte, image, vidéo | Stockage du cache facturé à l'heure |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200K | Texte, image | Écritures de cache à 1.25x l'entrée |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 | Texte, image, vidéo | Tarifé 5x au-dessus du palier Lite |
Qwen remporte la première ligne avec un écart d'un ordre de grandeur, et c'est le seul modèle ici qui accepte une entrée vidéo pour moins de $0.10. Mais la comparaison est plus serrée que ce que les chiffres bruts suggèrent une fois qu'on applique les remises propres à chaque fournisseur. Les tarifs de Mistral sont plats, donc ce que vous voyez est ce que vous payez. Le mode batch réduit de moitié les deux paliers de Google dans le monde entier sans restriction régionale, comme le détaille le décryptage des tarifs de Gemini 3.5 Flash-Lite.
Et GPT-5.6 a réduit le prix de Luna de 80% le 30 juillet 2026, ce qui a rebattu ce tableau quelques jours avant que je n'écrive ceci. La carte complète des paliers est dans l'article sur les tarifs de GPT-5.6, et le haut de la gamme Google se trouve dans les tarifs de Gemini 3.6 Flash.
Deux lignes méritent qu'on s'y attarde. Plus récent ne veut pas dire moins cher au sein même de la gamme de Google, où 3.1 Flash-Lite reste moins cher que 3.5. Et les poids ouverts ne signifient pas bon marché, ce que démontrent les tarifs de Kimi K3 avec $3 en entrée et $15 en sortie. Si ce sont des poids ouverts que vous recherchez ici, notez que Qwen 3.7 est fermé, et le tour d'horizon des meilleurs agents IA open source est un meilleur point de départ.
Au sein de la famille Qwen, l'échelle de prix est raide :
| Modèle | Entrée $/1M | Sortie $/1M | Surcoût de contexte long | Modalité |
|---|---|---|---|---|
| Qwen3.7 Flash | $0.03 | $0.13 | Oui, à 32K et 256K | Texte, image, vidéo |
| Qwen3.7 Plus | $0.32 | $1.28 | Oui, à 256K | Texte, image |
| Qwen3.7 Max | $1.475 | $4.425 | Aucun publié | Texte uniquement |
Flash est 10.7x moins cher en entrée que Plus et 49x moins cher que Max, et c'est le seul des trois qui accepte la vidéo. Max, le fleuron, n'a aucune vision du tout. Un contexte plus large sur la gamme se trouve dans le décryptage des tarifs de Qwen, et le nouveau palier de prévisualisation est couvert dans les tarifs de Qwen3.8-Max.
Si aucun des trois ne convient, les alternatives à Qwen couvre ce qui est en lice par ailleurs, et la présentation de la famille Qwen est la version simple et accessible de cette échelle.
Ce que dit la communauté, qui est presque rien
Cela vaut la peine de le dire clairement, car cela change le poids que le prix seul devrait avoir : il n'existe aucune donnée indépendante de rapport prix-performance sur ce modèle. Il n'est pas répertorié sur Artificial Analysis, n'a aucune entrée LMArena, et Qwen n'a publié aucun benchmark avec lui. Une recherche sur Hacker News du nom du modèle ne renvoie aucun résultat, ni dans les articles ni dans les commentaires, sur toute la période.
Ce qui s'est le plus rapproché d'une explication est venu d'un fil de discussion sans rapport la même semaine :
« Qwen/Alibaba ont arrêté de faire des sorties en poids ouverts pendant un moment. Aucune rancune ni rien, je ne vais certainement pas regarder les dents d'un cheval offert, mais DeepSeek comme Moonshot ont été très constants avec les poids ouverts ainsi qu'en partageant une recherche vraiment détaillée. »
La communauté qui teste habituellement à fond une sortie Qwen a arrêté de regarder quand la lignée est passée aux poids fermés, si bien qu'un lancement uniquement en API est arrivé sans personne pour le benchmarker. Dans le même fil, un autre commentateur a noté que le modèle bon marché rival « n'a pas de capacités de vision, ce qui est un atout majeur pour les tâches agentiques » — ce qui est précisément l'argument de vente de ce modèle, écrit par quelqu'un qui ne savait pas qu'il était déjà sorti quatre jours plus tôt.
En pratique : vous pouvez faire confiance au prix, car le fournisseur l'a publié. Vous ne pouvez pas encore faire confiance à ce que quiconque affirme sur ce que vous obtenez en échange. Prévoyez votre propre évaluation avant d'engager une charge de travail, comme vous le feriez pour n'importe quel modèle dans le débat sur les meilleurs agents IA.
Ce que cela coûte réellement sur une file de support
C'est ici que je dois sortir de la grille tarifaire, car c'est la question avec laquelle la plupart des gens arrivent.
Faites tourner le calculateur sur une charge de travail de support plausible : 200,000 conversations par mois, 12K tokens de prompt chacune une fois qu'on inclut un prompt système et quelques articles récupérés, 700 tokens en sortie, moitié en succès de cache, avec la marge de retentatives activée. Cela donne environ $67 par mois — sous l'estimation affichée, parce que le cache fait son travail à une taille de prompt qui ne quitte jamais le palier de base. C'est un chiffre suffisamment petit pour ressembler à une erreur d'arrondi, et c'est ce chiffre qui rend la construction en interne visiblement évidente.
Chez eesel, nous observons régulièrement cette décision se jouer, et le schéma est constant. D'après une analyse interne du churn, plusieurs clients techniques — dont une entreprise de construction-tech en RA et une marque de beauté DTC — sont partis pour construire directement sur une API de LLM. Ce qui pousse les équipes dans l'autre sens, c'est ce que les tokens ne couvrent pas. Du côté des acheteurs, un responsable ingénierie d'une entreprise de matériel de distributeurs automatiques de Bitcoin, qui gère une base de connaissances Confluence et Telegram de plus de 300 articles, l'a formulé ainsi :
« Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas investir notre temps dans cela. Nous voulions quelque chose que nous n'aurions pas à maintenir. »
La maintenance est le coût réel. Un appel brut à un modèle n'a aucune idée de quel article de votre centre d'aide est à jour, aucune règle sur quand transférer à un humain, aucun moyen de se tester lui-même face à votre historique avant de répondre à un client réel. Se tromper là-dessus coûte plus cher que n'importe quel palier de tokens : nous avons vu un bot au ton assuré donner tranquillement de mauvaises réponses, c'est pourquoi chaque déploiement eesel est simulé sur des tickets historiques avant de toucher une conversation réelle.
Si vous voulez le chiffre honnête et global plutôt que la ligne API, le décryptage du coût du service client IA et la comparaison du coût par résolution sont de meilleurs points de départ que n'importe quel tableau par token, et coût IA contre agent humain cadre le chiffre que la finance demande réellement.
Le travail d'ingénierie qu'un tarif de $0.03 ne vous achète pas, à peu près dans l'ordre où il vous rattrape :
- Un retrieval qui reste à jour, ce qui est tout l'enjeu de l'entraînement de l'IA sur une base de connaissances.
- Des seuils de confiance et une escalade IA pour que le modèle ne réponde qu'à ce qu'il devrait.
- Le grounding et les guardrails, puisque les hallucinations IA dans le support sont l'échec qui coûte des clients.
- Le triage et la classification des tickets avant même qu'une réponse ne soit tentée.
- La mesure, car le taux de résolution IA est le seul chiffre qui indique si tout cela a fonctionné.
- Le contrôle qualité du support IA permanent, qui ne se termine jamais.
Rien de tout cela n'est un argument contre les modèles bon marché. C'est un argument pour savoir quelle facture on lit réellement. Un modèle aussi peu coûteux est un excellent composant et un produit médiocre, et la différence entre les deux est précisément ce à quoi se résume un agent IA face à un chatbot traditionnel.
Essayer eesel
Si vous êtes arrivé ici en calculant si un modèle à $0.03 peut porter votre file de support, la réponse honnête est que les tokens n'ont jamais été la partie difficile. eesel est la version de ce projet que vous n'avez pas à construire : il se branche sur Zendesk, Freshdesk, Gorgias ou votre boîte de réception en quelques minutes, lit le centre d'aide et les tickets passés que vous avez déjà, et ne répond qu'à ce dont il est sûr, en escaladant tout le reste.
Le point qui compte le plus pour quiconque a déjà été échaudé par une démo : vous pouvez le simuler sur des milliers de vos propres tickets historiques avant qu'un seul client ne le voie, afin de connaître le taux de résolution et le coût par ticket à l'avance plutôt que de découvrir les deux en production. Gratuit à essayer, aucune reconstruction nécessaire.

La version courte
Les tarifs de Qwen 3.7 Flash sont réels et constituent le tarif vision le moins cher disponible, à condition que vos prompts restent sous 32K, que vous déployiez à Pékin, que votre cache soit effectivement lu, et que votre agent ne fasse pas trop de retentatives. Changez l'un de ces éléments et le chiffre bouge, dans un cas jusqu'à 6.7x.
Modélisez-le avant de migrer. Et si la charge de travail de l'autre côté du calcul est une file de support, tarifez le système entier, pas les tokens : le meilleur LLM pour le support est généralement celui que vous n'avez pas à maintenir vous-même.
Sources
- Qwen3.7 Flash sur OpenRouter
- API publique de modèles d'OpenRouter
- Fiche modèle Qwen3.7-Flash, Alibaba Cloud Model Studio
- Qwen3.7-Flash sur QwenCloud
- Changelog des modèles QwenCloud
- Qwen3.7 Plus sur OpenRouter
- Qwen3.7 Max sur OpenRouter
- Tarifs de l'API Gemini
- Page du modèle Gemini 3.5 Flash-Lite
- Page du modèle Gemini 3.6 Flash
- Tarifs de l'API OpenAI
- Page du modèle GPT-5.6 Luna
- Documentation tarifaire de Claude
- Tarifs de l'API Mistral
- Hacker News, fil DeepSeek-V4-Flash Update
Questions fréquentes
Combien coûte Qwen 3.7 Flash par 1M de tokens ?
Pourquoi ma facture Qwen 3.7 Flash est-elle plus élevée que le prix annoncé ?
Qwen 3.7 Flash est-il moins cher que Gemini 3.5 Flash-Lite ?
Qwen 3.7 Flash propose-t-il un niveau gratuit ?
Qwen 3.7 Flash est-il assez peu coûteux pour faire fonctionner une file de support ?
Qwen 3.7 Flash offre-t-il une remise batch ?
Dans quelle devise Qwen 3.7 Flash est-il tarifé ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.









Comment les tarifs de Qwen 3.7 Flash se comparent-ils à Plus et Max ?