Tarifs de Qwen 3.7 Flash : ce que vous payez vraiment en 2026

Kurnia Kharisma Agung Samiadjie
Écrit par

Kurnia Kharisma Agung Samiadjie

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 31, 2026

Vérifié par un expert
Illustration de deux personnes examinant des cartes de tarifs échelonnés sur un écran, avec le logo Qwen

La grille tarifaire, et les quatre compteurs qui se cachent derrière

Voici le prix publié, dans son intégralité, tel qu'il s'applique réellement.

Taille du promptEntrée / 1MSortie / 1MLecture cache / 1MÉcriture cache / 1M
Moins de 32K tokens$0.03$0.13$0.006$0.038
32K à 256K$0.10$0.40$0.02$0.125
256K à 1M$0.20$0.80$0.04$0.25

Ces tarifs viennent de l'API de modèles d'OpenRouter, le même flux qui alimente la page du modèle Qwen3.7 Flash. La fiche modèle sur Alibaba Cloud Model Studio affiche la même structure à trois paliers en CNY.

Quatre éléments font varier le montant qui vous est facturé, et un seul figure dans ce tableau.

Quatre compteurs intitulés palier de taille de prompt, succès et échecs de cache, batch ou non, et retentatives, alimentant tous une seule facture
Quatre compteurs intitulés palier de taille de prompt, succès et échecs de cache, batch ou non, et retentatives, alimentant tous une seule facture

Entrez votre propre charge de travail dans les quatre :

Le reste de cet article explique ce que chacune de ces quatre variables fait réellement.

Compteur 1 : le palier de taille de prompt, et comment les boucles d'agents finissent par y glisser

La tarification est échelonnée selon la taille du prompt, pas selon le nombre de tokens que vous achetez sur un mois. Un appel avec 32,001 tokens de prompt est facturé à $0.10 par million sur chacun d'entre eux, pas seulement sur ceux qui dépassent la limite. Passez 256K et toute la requête est de nouveau retarifée à $0.20.

Cela rend le palier supérieur 6.7x plus élevé que le tarif d'entrée affiché et 6.2x plus élevé que le tarif de sortie affiché. Cela signifie aussi que les deux chiffres présents dans chaque titre sur ce modèle, « le modèle vision le moins cher » et « 1M de contexte », ne peuvent pas être vrais en même temps dans le même appel. Mon collègue Rama a détaillé ce compromis dans le test de Qwen 3.7 Flash ; la version fiche technique se trouve dans la présentation de Qwen 3.7 Flash.

Ce qui est moins évident, c'est comment on y arrive sans le vouloir. Les boucles d'agents glissent d'un palier à l'autre d'elles-mêmes :

  • Un prompt système avec des schémas d'outils représente souvent déjà 3K à 8K tokens avant que l'utilisateur n'ait dit quoi que ce soit.
  • Les documents récupérés viennent s'ajouter par-dessus. Quatre articles de centre d'aide de 2K chacun, c'est encore 8K.
  • Chaque tour renvoie toute la conversation, si bien que le tour 1 peut faire 12K et le tour 6 déjà 40K.

Le tour 1 est facturé à $0.03. Le tour 6 est facturé à $0.10, rétroactivement sur l'ensemble du prompt. Rien n'a changé dans votre code. C'est le même type de problème que choisir un modèle sur son tarif affiché ailleurs, ce qui explique pourquoi Opus 5 contre Sonnet 5 finit par être un débat sur le coût par tâche accomplie plutôt que sur le coût par token.

La preuve que cela arrive réellement aux utilisateurs se trouve sur la page du fournisseur lui-même. OpenRouter publie une moyenne pondérée mobile sur 30 jours de ce que les clients paient après caching, et pour ce modèle, c'est $0.044 en entrée et $0.149 en sortie avec un taux de succès de cache de 51.0%. Le prix effectif se situe au-dessus du prix catalogue, ce qui n'est arithmétiquement possible que si une part significative du trafic paie les paliers supérieurs.

Si vous comparez des modèles sur leurs grilles tarifaires, le même piège existe ailleurs, sous un autre déguisement. Les tarifs de GPT-5.6 doublent l'entrée et ajoutent 50% à la sortie au-delà de 272K tokens, et les tarifs de Claude facturent une prime pour les écritures de cache. Seul Qwen3.7 Max reste à tarif plat sur toute la fenêtre, ce qui coûte 49x plus par token d'entrée pour y arriver.

Compteur 2 : le caching, où écrire dans le cache coûte plus cher que ne pas cacher

C'est le compteur sur lequel on se trompe le plus souvent, et cela vaut le coup de faire le calcul une bonne fois.

Qwen 3.7 Flash expose deux types de cache. Le caching implicite se lit à 20% du tarif d'entrée standard et ne coûte rien à créer. Le caching explicite est scindé en deux : vous payez un tarif de création puis un tarif de lecture bien plus bas. Sur le listing en USD d'OpenRouter, le cache explicite de cinq minutes se crée à $0.038 et se lit à $0.003, contre un tarif d'entrée standard de $0.03.

Relisez bien. Écrire une entrée de cache coûte 1.27x ce qu'il aurait coûté d'envoyer simplement les tokens.

Deux chemins après avoir écrit dans un cache : le relire dans les cinq minutes et payer $0.003, ou le laisser expirer sans le lire et payer 1.27x
Deux chemins après avoir écrit dans un cache : le relire dans les cinq minutes et payer $0.003, ou le laisser expirer sans le lire et payer 1.27x

Le calcul tourne vite en votre faveur. Écrivez une fois et lisez une fois, et vous aurez dépensé $0.041 par million contre $0.060 sans cache, donc le cache est déjà rentable. Chaque lecture suivante est presque gratuite. Tout cela ne tourne mal que dans un cas précis : le cache expire avant que quiconque ne le lise, et vous avez payé une prime de 27% pour rien.

Ce qui est exactement la forme d'une file de support. Les tickets n'arrivent pas en une rafale concentrée contre le même contexte, ils arrivent au compte-gouttes tout au long de la journée. Une durée de vie de cinq minutes est généreuse pour une session de chat et inutile pour une boîte de réception. Le taux de succès de cache de 51% qu'OpenRouter mesure sur l'ensemble du trafic de ce modèle est une hypothèse de planification raisonnable, pas les 90% que vous obtenez dans un script de benchmark.

Deux règles pratiques en découlent. Utilisez le caching implicite par défaut, puisqu'il n'a pas de coût de création et se lit tout de même à 20%. Réservez le caching explicite aux préfixes pour lesquels vous êtes sûr qu'ils seront touchés à répétition dans la fenêtre, comme un long prompt système sur un endpoint à fort débit. Si vous construisez du retrieval par-dessus, le compromis RAG contre LLM compte aussi ici, car un contexte récupéré plus petit est à la fois moins cher par appel et moins susceptible de vous faire basculer dans le palier suivant.

Compteur 3 : la remise batch n'existe que dans exactement une région

La fiche modèle d'Alibaba elle-même tarifie ce modèle en CNY, dans quatre tableaux régionaux distincts, et les différences ne sont pas cosmétiques.

Poste de facturation (par 1M, palier de base)PékinSingapourFrancfortTokyo
Entrée0.2 CNY0.225 CNY0.2 CNY0.2 CNY
Sortie0.8 CNY0.974 CNY0.8 CNY0.8 CNY
Lecture cache implicite0.04 CNY0.045 CNY0.04 CNY0.04 CNY
Entrée (Batch File)0.1 CNY
Sortie (Batch File)0.4 CNY

Trois constats dans ce tableau.

Les tarifs Batch File réduisent de moitié les deux compteurs, et cela n'existe qu'à Pékin. Batch Inference est marqué comme non pris en charge dans les grilles de capacités de Singapour, Francfort et Tokyo, si bien que la remise de 50% que tout autre fournisseur propose mondialement dépend ici de l'endroit où vous déployez. Notez aussi le piège dans le piège : les lignes Batch Chat sont tarifées à 0.2 et 0.8, identiques au standard. Seule la voie batch basée sur fichiers bénéficie de la remise.

Singapour coûte plus cher pour le même modèle. L'entrée est 12.5% au-dessus du tarif de base et la sortie environ 22% au-dessus. Rien dans la grille de capacités ne l'explique ; c'est simplement une grille tarifaire différente.

La recherche web est aussi limitée par région, prise en charge à Pékin et Singapour et non prise en charge à Francfort et Tokyo. C'est une question de fonctionnalité plus que de prix, jusqu'à ce qu'il faille brancher une API de recherche séparée et la payer deux fois.

Quatre cartes régionales montrant Pékin avec recherche web et remise batch, Singapour avec recherche web seulement, et Francfort et Tokyo sans aucun des deux
Quatre cartes régionales montrant Pékin avec recherche web et remise batch, Singapour avec recherche web seulement, et Francfort et Tokyo sans aucun des deux

Encore un mot sur la devise. La fiche modèle affiche du CNY sur chaque onglet et ne montre aucun chiffre en USD nulle part ; les tarifs en dollars que tout le monde cite proviennent du listing de revente d'OpenRouter. Ce sont deux vitrines pour un même schéma tarifaire, pas une contradiction à résoudre, et convertir entre les deux vous donnera un chiffre qui ne correspond à aucune des deux factures. Calculez le prix selon la vitrine par laquelle vous achetez réellement. Toute personne comparant entre fournisseurs se heurtera au même problème, ce qui explique en partie pourquoi la comparaison OpenAI contre Anthropic contre Gemini est plus difficile que de lire trois pages de tarifs.

Compteur 4 : les retentatives, la ligne que personne ne budgétise

OpenRouter mesure un taux d'erreur d'appels d'outils de 8.88% pour ce modèle, contre 6.45% pour Qwen3.7 Plus. Dans une boucle d'agent, un appel d'outil échoué n'est pas gratuit. Vous avez payé pour le prompt qui l'a produit, et vous paierez à nouveau pour la retentative qui inclut l'échec dans son contexte, avec une taille de prompt légèrement plus grande.

Neuf pour cent n'est pas catastrophique, mais cela appartient au modèle, c'est pourquoi le calculateur ci-dessus l'ajoute comme multiplicateur plutôt que de le laisser en note de bas de page.

La traîne de latence raconte la même histoire, mais en temps plutôt qu'en argent. Le P50 de bout en bout est de confortables 3.56 secondes. Le P99 est de 90.19 secondes. Si votre timeout est inférieur à cela, vous annulez et réémettez environ un appel sur cent, et vous payez pour les deux. Et comme exactement un seul fournisseur propose ce modèle, il n'y a aucune route de repli vers laquelle basculer quand cela ralentit.

« Flash » est une promesse sur le prix, pas sur la vitesse. À 59 tokens de sortie par seconde, ce modèle est environ six fois plus lent que Gemini 3.5 Flash-Lite, ce qui compte vraiment si quelque chose attend la réponse. Il est aussi, curieusement, environ cinq fois plus rapide que son propre frère Plus.

Comment il se positionne face au reste du segment vision bon marché

Chaque chiffre ci-dessous provient de la page tarifaire du fournisseur lui-même, au palier synchrone standard.

ModèleEntrée $/1MSortie $/1MContexteVisionLe piège dans la grille tarifaire
Qwen 3.7 Flash$0.03$0.131MTexte, image, vidéoTrois paliers ; le batch est réservé à Pékin
Mistral Small 4$0.15$0.60256KTexte, imageTarif plat, mais la plus petite fenêtre ici
GPT-5.6 Luna$0.20$1.201.05MTexte, image2x l'entrée au-delà de 272K ; le batch le réduit de moitié
Gemini 3.1 Flash-Lite$0.25$1.50Non publiéTexte, imageMoins cher que le 3.5 Flash-Lite plus récent
Gemini 3.5 Flash-Lite$0.30$2.501,048,576Texte, image, vidéoStockage du cache facturé à l'heure
Claude Haiku 4.5$1.00$5.00200KTexte, imageÉcritures de cache à 1.25x l'entrée
Gemini 3.6 Flash$1.50$7.501,048,576Texte, image, vidéoTarifé 5x au-dessus du palier Lite

Qwen remporte la première ligne avec un écart d'un ordre de grandeur, et c'est le seul modèle ici qui accepte une entrée vidéo pour moins de $0.10. Mais la comparaison est plus serrée que ce que les chiffres bruts suggèrent une fois qu'on applique les remises propres à chaque fournisseur. Les tarifs de Mistral sont plats, donc ce que vous voyez est ce que vous payez. Le mode batch réduit de moitié les deux paliers de Google dans le monde entier sans restriction régionale, comme le détaille le décryptage des tarifs de Gemini 3.5 Flash-Lite.

Et GPT-5.6 a réduit le prix de Luna de 80% le 30 juillet 2026, ce qui a rebattu ce tableau quelques jours avant que je n'écrive ceci. La carte complète des paliers est dans l'article sur les tarifs de GPT-5.6, et le haut de la gamme Google se trouve dans les tarifs de Gemini 3.6 Flash.

Deux lignes méritent qu'on s'y attarde. Plus récent ne veut pas dire moins cher au sein même de la gamme de Google, où 3.1 Flash-Lite reste moins cher que 3.5. Et les poids ouverts ne signifient pas bon marché, ce que démontrent les tarifs de Kimi K3 avec $3 en entrée et $15 en sortie. Si ce sont des poids ouverts que vous recherchez ici, notez que Qwen 3.7 est fermé, et le tour d'horizon des meilleurs agents IA open source est un meilleur point de départ.

Au sein de la famille Qwen, l'échelle de prix est raide :

ModèleEntrée $/1MSortie $/1MSurcoût de contexte longModalité
Qwen3.7 Flash$0.03$0.13Oui, à 32K et 256KTexte, image, vidéo
Qwen3.7 Plus$0.32$1.28Oui, à 256KTexte, image
Qwen3.7 Max$1.475$4.425Aucun publiéTexte uniquement

Flash est 10.7x moins cher en entrée que Plus et 49x moins cher que Max, et c'est le seul des trois qui accepte la vidéo. Max, le fleuron, n'a aucune vision du tout. Un contexte plus large sur la gamme se trouve dans le décryptage des tarifs de Qwen, et le nouveau palier de prévisualisation est couvert dans les tarifs de Qwen3.8-Max.

Si aucun des trois ne convient, les alternatives à Qwen couvre ce qui est en lice par ailleurs, et la présentation de la famille Qwen est la version simple et accessible de cette échelle.

Ce que dit la communauté, qui est presque rien

Cela vaut la peine de le dire clairement, car cela change le poids que le prix seul devrait avoir : il n'existe aucune donnée indépendante de rapport prix-performance sur ce modèle. Il n'est pas répertorié sur Artificial Analysis, n'a aucune entrée LMArena, et Qwen n'a publié aucun benchmark avec lui. Une recherche sur Hacker News du nom du modèle ne renvoie aucun résultat, ni dans les articles ni dans les commentaires, sur toute la période.

Ce qui s'est le plus rapproché d'une explication est venu d'un fil de discussion sans rapport la même semaine :

Hacker News

« Qwen/Alibaba ont arrêté de faire des sorties en poids ouverts pendant un moment. Aucune rancune ni rien, je ne vais certainement pas regarder les dents d'un cheval offert, mais DeepSeek comme Moonshot ont été très constants avec les poids ouverts ainsi qu'en partageant une recherche vraiment détaillée. »

La communauté qui teste habituellement à fond une sortie Qwen a arrêté de regarder quand la lignée est passée aux poids fermés, si bien qu'un lancement uniquement en API est arrivé sans personne pour le benchmarker. Dans le même fil, un autre commentateur a noté que le modèle bon marché rival « n'a pas de capacités de vision, ce qui est un atout majeur pour les tâches agentiques » — ce qui est précisément l'argument de vente de ce modèle, écrit par quelqu'un qui ne savait pas qu'il était déjà sorti quatre jours plus tôt.

En pratique : vous pouvez faire confiance au prix, car le fournisseur l'a publié. Vous ne pouvez pas encore faire confiance à ce que quiconque affirme sur ce que vous obtenez en échange. Prévoyez votre propre évaluation avant d'engager une charge de travail, comme vous le feriez pour n'importe quel modèle dans le débat sur les meilleurs agents IA.

Ce que cela coûte réellement sur une file de support

C'est ici que je dois sortir de la grille tarifaire, car c'est la question avec laquelle la plupart des gens arrivent.

Faites tourner le calculateur sur une charge de travail de support plausible : 200,000 conversations par mois, 12K tokens de prompt chacune une fois qu'on inclut un prompt système et quelques articles récupérés, 700 tokens en sortie, moitié en succès de cache, avec la marge de retentatives activée. Cela donne environ $67 par mois — sous l'estimation affichée, parce que le cache fait son travail à une taille de prompt qui ne quitte jamais le palier de base. C'est un chiffre suffisamment petit pour ressembler à une erreur d'arrondi, et c'est ce chiffre qui rend la construction en interne visiblement évidente.

Chez eesel, nous observons régulièrement cette décision se jouer, et le schéma est constant. D'après une analyse interne du churn, plusieurs clients techniques — dont une entreprise de construction-tech en RA et une marque de beauté DTC — sont partis pour construire directement sur une API de LLM. Ce qui pousse les équipes dans l'autre sens, c'est ce que les tokens ne couvrent pas. Du côté des acheteurs, un responsable ingénierie d'une entreprise de matériel de distributeurs automatiques de Bitcoin, qui gère une base de connaissances Confluence et Telegram de plus de 300 articles, l'a formulé ainsi :

« Nous aurions pu essayer d'écrire notre propre application LLM, mais nous ne voulions pas investir notre temps dans cela. Nous voulions quelque chose que nous n'aurions pas à maintenir. »

La maintenance est le coût réel. Un appel brut à un modèle n'a aucune idée de quel article de votre centre d'aide est à jour, aucune règle sur quand transférer à un humain, aucun moyen de se tester lui-même face à votre historique avant de répondre à un client réel. Se tromper là-dessus coûte plus cher que n'importe quel palier de tokens : nous avons vu un bot au ton assuré donner tranquillement de mauvaises réponses, c'est pourquoi chaque déploiement eesel est simulé sur des tickets historiques avant de toucher une conversation réelle.

Si vous voulez le chiffre honnête et global plutôt que la ligne API, le décryptage du coût du service client IA et la comparaison du coût par résolution sont de meilleurs points de départ que n'importe quel tableau par token, et coût IA contre agent humain cadre le chiffre que la finance demande réellement.

Le travail d'ingénierie qu'un tarif de $0.03 ne vous achète pas, à peu près dans l'ordre où il vous rattrape :

Rien de tout cela n'est un argument contre les modèles bon marché. C'est un argument pour savoir quelle facture on lit réellement. Un modèle aussi peu coûteux est un excellent composant et un produit médiocre, et la différence entre les deux est précisément ce à quoi se résume un agent IA face à un chatbot traditionnel.

Essayer eesel

Si vous êtes arrivé ici en calculant si un modèle à $0.03 peut porter votre file de support, la réponse honnête est que les tokens n'ont jamais été la partie difficile. eesel est la version de ce projet que vous n'avez pas à construire : il se branche sur Zendesk, Freshdesk, Gorgias ou votre boîte de réception en quelques minutes, lit le centre d'aide et les tickets passés que vous avez déjà, et ne répond qu'à ce dont il est sûr, en escaladant tout le reste.

Le point qui compte le plus pour quiconque a déjà été échaudé par une démo : vous pouvez le simuler sur des milliers de vos propres tickets historiques avant qu'un seul client ne le voie, afin de connaître le taux de résolution et le coût par ticket à l'avance plutôt que de découvrir les deux en production. Gratuit à essayer, aucune reconstruction nécessaire.

Le tableau de bord du helpdesk eesel AI, montrant l'activité de l'IA sur une file de support en production
Le tableau de bord du helpdesk eesel AI, montrant l'activité de l'IA sur une file de support en production

La version courte

Les tarifs de Qwen 3.7 Flash sont réels et constituent le tarif vision le moins cher disponible, à condition que vos prompts restent sous 32K, que vous déployiez à Pékin, que votre cache soit effectivement lu, et que votre agent ne fasse pas trop de retentatives. Changez l'un de ces éléments et le chiffre bouge, dans un cas jusqu'à 6.7x.

Modélisez-le avant de migrer. Et si la charge de travail de l'autre côté du calcul est une file de support, tarifez le système entier, pas les tokens : le meilleur LLM pour le support est généralement celui que vous n'avez pas à maintenir vous-même.

Sources

Questions fréquentes

Combien coûte Qwen 3.7 Flash par 1M de tokens ?
Qwen 3.7 Flash coûte à partir de $0.03 par 1M de tokens en entrée et $0.13 par 1M de tokens en sortie, et ce tarif ne s'applique qu'aux prompts de moins de 32K tokens. De 32K à 256K, c'est $0.10/$0.40, et de 256K à 1M, c'est $0.20/$0.80. La grille tarifaire complète de la famille est disponible dans notre décryptage des tarifs de Qwen.
Pourquoi ma facture Qwen 3.7 Flash est-elle plus élevée que le prix annoncé ?
Presque toujours parce que vos prompts ont franchi un palier. La moyenne mobile sur 30 jours d'OpenRouter sur ce que ses clients paient réellement est de $0.044 en entrée et $0.149 en sortie, au-dessus du prix affiché de $0.03/$0.13, avec un taux de succès de cache de 51.0%. Les longs prompts système, les documents récupérés et les conversations d'agents qui s'allongent vous poussent tous au-delà de la limite des 32K. Le mécanisme est détaillé dans le test de Qwen 3.7 Flash.
Qwen 3.7 Flash est-il moins cher que Gemini 3.5 Flash-Lite ?
Au prix catalogue, oui, avec un facteur 10x sur l'entrée : $0.03 contre $0.30 par 1M. L'écart se réduit une fois pris en compte le palier batch de Google, qui réduit de moitié Flash-Lite à $0.15, et le débit, où Flash-Lite est plusieurs fois plus rapide par token. Les chiffres sont dans notre article sur les tarifs de Gemini 3.5 Flash-Lite.
Qwen 3.7 Flash propose-t-il un niveau gratuit ?
Aucun quota gratuit spécifique au modèle n'est publié. La fiche Model Studio ne mentionne aucune allocation gratuite pour ce modèle, et la mention « 100 millions de tokens gratuits » dans le pied de page du site d'Alibaba est une promotion pour les nouveaux utilisateurs valable sur tout le site, pas un avantage propre à Qwen 3.7 Flash. Traitez-le comme une API payante dès le premier appel.
Comment les tarifs de Qwen 3.7 Flash se comparent-ils à Plus et Max ?
Flash est 10.7x moins cher en entrée que Qwen3.7 Plus ($0.32/$1.28) et 49x moins cher que Qwen3.7 Max ($1.475/$4.425). Flash et Plus ont tous deux des surcoûts de contexte long ; Max est le seul dont le tarif est plat sur toute la fenêtre de 1M. Pour le fleuron le plus récent, voir les tarifs de Qwen3.8-Max.
Qwen 3.7 Flash est-il assez peu coûteux pour faire fonctionner une file de support ?
Les tokens sont bon marché ; le système qui les entoure est le vrai coût. Un déploiement de support nécessite une récupération sur votre centre d'aide, des règles d'escalade, des tests par rapport aux tickets passés et quelqu'un pour le faire fonctionner. Notre guide pour choisir un LLM pour le support et le décryptage du coût du service client IA replacent tous deux la ligne des tokens dans son contexte.
Qwen 3.7 Flash offre-t-il une remise batch ?
Oui, mais seulement dans une région et seulement dans un mode. Les tarifs Batch File à Pékin réduisent de moitié l'entrée et la sortie, à 0.1 et 0.4 CNY par 1M au palier de base. Batch Chat est facturé au tarif standard, et Batch Inference est marqué comme non pris en charge à Singapour, Francfort et Tokyo.
Dans quelle devise Qwen 3.7 Flash est-il tarifé ?
La fiche modèle d'Alibaba Cloud n'affiche que du CNY, dans les quatre régions. Les chiffres en USD que tout le monde cite proviennent du listing de revente d'OpenRouter. Les deux décrivent la même structure à trois paliers, donc utilisez la vitrine par laquelle vous achetez réellement plutôt que de convertir entre les deux.

Share this article

Kurnia Kharisma Agung Samiadjie

Article by

Kurnia Kharisma Agung Samiadjie

Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.

Related Posts

All posts →
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen
Trending

Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Qwen 3.7 Flash a été lancé sans article de blog, sans benchmarks et sans poids ouverts. Voici la fiche technique complète, la tarification par paliers, et ce que Qwen n'a jamais prétendu.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Illustration du décryptage des tarifs de PromptQL
Trending

Tarifs PromptQL : ce que ça coûte vraiment en 2026

Un décryptage des tarifs de PromptQL : l'unité facturable OLU, le tarif de lancement à 0,14 $, les crédits gratuits, le multiplicateur de modèle qui détermine vraiment la facture, et des exemples de coûts calculés.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Bannière de couverture des alternatives à PromptQL sur un fond indigo
Trending

Les 8 meilleures alternatives à PromptQL en 2026

Les 8 meilleures alternatives à PromptQL en 2026, de Databricks Genie au projet open source Wren AI, avec de vrais tarifs, les forces de chacun, et pour qui ils conviennent réellement.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026
Bannière de couverture qu'est-ce que PromptQL avec le logo PromptQL sur fond indigo
Trending

Qu'est-ce que PromptQL ? L'agent de données IA de Hasura, expliqué

Qu'est-ce que PromptQL ? Une explication claire de l'agent de données IA de Hasura : l'idée de planifier puis exécuter, ce à quoi il se connecte, son coût et à qui il s'adresse.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Bannière de l'avis sur PromptQL avec le logo PromptQL sur fond indigo
Trending

Avis sur PromptQL (2026) : l'agent de données de Hasura, testé

Un avis pratique sur PromptQL : comment l'agent de données de Hasura sépare planification et exécution, ce qu'il coûte, et si la promesse de fiabilité tient la route.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Illustration d'un chronomètre qui s'envole pour révéler une piste dégagée, symbolisant une limite d'utilisation levée
Trending

OpenAI a supprimé la limite de 5 heures de Codex : ce qui a vraiment changé

OpenAI a temporairement supprimé la limite d'utilisation de 5 heures sur Codex et ChatGPT Work. Voici ce qui a changé le 12 juillet, ce qui est resté, et ce que cela signifie pour vous.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration éditoriale d'un classement de benchmarks avec une barre haute mise en évidence, représentant ZCode et le modèle GLM-5.2
Trending

ZCode : ce qu'est vraiment le nouvel agent de codage IA de Z.ai

Un test concret de ZCode, l'application de codage agentique gratuite de l'équipe GLM : le modèle GLM-5.2 qui la fait tourner, les vraies critiques de la semaine de lancement, et à qui elle s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Bannière illustrée sur le détail des prix de Palmier Pro, un éditeur vidéo macOS natif IA, avec une timeline et un motif de crédits
Trending

Prix de Palmier Pro : ce que coûte vraiment l'éditeur vidéo IA

Palmier Pro est gratuit pour monter et facturé au crédit pour générer. Voici les prix complets, le fonctionnement des crédits, le piège du macOS uniquement, et si ça vaut le coup.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Bannière illustrée pour un guide sur les tarifs et les coûts d'API de Google Gemini 3.5 Pro
Trending

Tarifs de Gemini 3.5 Pro : ce qu'il coûte (et ce qui manque encore)

Une réponse honnête sur les tarifs de Gemini 3.5 Pro : ce n'est pas encore disponible. Voici ce que coûte le palier Pro actuel, les offres grand public et le vrai calcul de l'API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement