Qwen 3.7 Flash : spécifications, tarifs et ce qu'il fait vraiment

Alicia Kirana Utomo
Écrit par

Alicia Kirana Utomo

Katelin Teen
Relu par

Katelin Teen

Dernière modification July 31, 2026

Vérifié par un expert
Illustration de panneaux d'image, de vidéo et de documents alimentant un modèle vision-langage, avec le logo Qwen

Ce qu'est vraiment Qwen 3.7 Flash

Je travaille sur les agents au sein d'eesel, donc la majeure partie de ma semaine se passe dans la couche située entre un modèle et un utilisateur réel, et la première chose que je fais à chaque lancement, c'est chercher le mécanisme. Avec Qwen 3.7 Flash, cette recherche a pris environ quatre minutes. Il n'y a presque aucun mécanisme publié.

Il n'existe aucun article de recherche Qwen pour ce modèle. Le fil d'articles derrière qwen.ai contient des billets de lancement pour Qwen 3.7 Max et Qwen 3.7 Plus, et le mot « Flash » n'apparaît dans aucun des deux.

La seule annonce de première main est un unique paragraphe dans le changelog QwenCloud, daté du 25 juillet 2026. OpenRouter indique la sortie au 27 juillet 2026 sous le slug qwen/qwen3.7-flash-20260727, et les deux dates sont documentées, à deux jours d'écart.

Voici l'argumentaire complet, mot pour mot, extrait de la fiche modèle d'Alibaba Cloud :

"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."

Remarquez à qui la comparaison est faite. Pas Gemini, pas GPT, pas Claude. Son propre prédécesseur. C'est une entreprise qui positionne une mise à jour incrémentale de plateforme, pas un fleuron, et le reste du lancement s'est comporté de la même façon : il est apparu comme une simple entrée de catalogue, pas comme un événement.

C'est dans les faits mécaniques que ça devient intéressant.

SpécificationQwen 3.7 Flash
Fenêtre de contexte1,000,000 tokens
Entrée maximale991,808 tokens
Entrée maximale, mode réflexion983,616 tokens
Sortie maximale65,536 tokens
Chaîne de raisonnement maximale262,144 tokens
Modalités d'entréeTexte, image, vidéo
Modalité de sortieTexte
RaisonnementActivé par défaut, avec budget de tokens
Fine-tuningNon pris en charge, dans aucune région
PoidsFermés, API uniquement

Ces données proviennent directement de la fiche Model Studio, et les lignes du mode réflexion sont le seul endroit où la page admet que ce mode existe. Aucun paramètre enable_thinking n'est documenté, aucun indicateur de streaming, et absolument rien sur la façon dont le modèle a été entraîné : pas de nombre de paramètres, pas de mention dense ou MoE, pas de chiffre de tokens d'entraînement. Le seul fait structurel documenté est la famille du tokenizer. Si vous êtes habitué à lire une véritable fiche modèle, celle-ci est en grande partie vide.

Ce que Qwen a affirmé, et ce qu'il n'a soigneusement pas affirmé

C'est la section que je relirais deux fois avant de construire quoi que ce soit dessus, car l'écart entre ce que dit internet sur les capacités de ce modèle et ce que dit Alibaba est large.

Deux colonnes comparant ce que Qwen a affirmé pour 3.7 Flash et ce qu'il n'a jamais affirmé
Deux colonnes comparant ce que Qwen a affirmé pour 3.7 Flash et ce qu'il n'a jamais affirmé

Affirmé, dans les propres termes de Qwen : reconnaissance universelle d'objets renforcée, perception du monde réel et intelligence spatiale améliorées, comportement d'agent multimodal amélioré pour les scénarios de recherche et d'interpréteur de code, et codage multimodal optimisé. Chacune de ces affirmations est une phrase sans aucun chiffre derrière.

Jamais affirmé, nulle part : l'OCR. Le mot n'apparaît sur aucune surface officielle. Ni l'analyse de documents. Si vous cherchez un modèle bon marché pour lire des factures, Qwen ne vous a jamais dit que c'était celui-là, et la seule évaluation indépendante ayant mesuré l'OCR l'a classé dernier sur 23.

Également jamais affirmé : l'usage de la GUI et de l'ordinateur. Cela appartient à Qwen 3.7 Plus, dont l'entrée de changelog parle de lire les écrans et d'exploiter les interfaces graphiques de bout en bout. Le texte éditorial d'OpenRouter dit que Flash convient pour « computer interaction », ce qui est la formulation d'OpenRouter, pas celle d'Alibaba. Cela a été largement repris comme s'il s'agissait d'une affirmation du fournisseur.

Ce qui est réel et documenté : l'appel de fonction et les sorties structurées sont tous les deux marqués comme pris en charge, et l'ensemble des outils serveur intégrés accessibles via l'API Responses est véritablement utile, couvrant code_interpreter, web_search, web_extractor, ainsi que la recherche d'image et de texte en complément. La complétion de préfixe fonctionne aussi dans toutes les régions, tout comme le context caching, sous ses formes implicite et explicite.

Une particularité au niveau des paramètres pour quiconque porte du code : la liste des paramètres pris en charge d'OpenRouter pour Flash ne comporte ni top_k, ni frequency_penalty, ni stop, ces trois paramètres que l'ancien Qwen 3.6 Flash accepte pourtant. Une mise à niveau directe échouera sur chacun de ces points.

Flash, Plus ou Max : choisissez selon ce que le modèle peut voir

L'échelle Qwen 3.7 ne se classe pas comme on pourrait s'y attendre, il vaut donc mieux la parcourir plutôt que de faire des suppositions. Choisissez un modèle ci-dessous et la carte se remplit.

Quel modèle Qwen 3.7 vous convient
$0.03 in / $0.13 out

Voit le texte, les images et la vidéo. Contexte de 1M, 59 tokens par seconde mesurés, taux d'erreur d'appel d'outil de 8.88%. Aucun score de qualité publié nulle part. Utilisez-le lorsque le travail est à fort volume et que le coût d'une mauvaise réponse est faible : étiquetage en masse, classification de première passe, triage d'images.

$0.32 in / $1.28 out

Voit le texte et les images, pas la vidéo. Environ 10 fois le prix de Flash. C'est le niveau auquel Qwen attribue la lecture d'écran et l'exploitation d'interfaces graphiques, et celui qui possède un score d'intelligence Artificial Analysis de 39. Utilisez-le lorsque quelque chose en aval dépend de l'exactitude de la réponse.

$1.48 in / $4.43 out

Texte uniquement. Le fleuron ne peut rien voir. Il obtient 46 sur l'index Artificial Analysis à 201 tokens par seconde, c'est donc le niveau de raisonnement, pas celui de la perception. Utilisez-le pour du travail textuel exigeant, et associez-le à Flash si des images sont impliquées.

Les tarifs sont les prix catalogue d'OpenRouter dans le palier sous les 32K. Les scores d'intelligence sont des chiffres Artificial Analysis pour Plus et Max ; Flash n'y est pas répertorié.

La bizarrerie qui vaut la peine d'être signalée : le modèle le moins cher est le seul à pouvoir regarder une vidéo, tandis que le fleuron ne peut rien voir du tout. Flash est aussi le plus rapide des trois en débit mesuré, 59 tokens par seconde contre 12 pour Plus. Normalement, c'est le niveau d'entrée de gamme auquel on retire des éléments. Ici, la perception se trouve en bas de l'échelle et le raisonnement en haut, ce qui signifie que beaucoup de projets réels finiront par appeler deux d'entre eux.

Les paliers de tarification, en bref

Le chiffre de $0.03 est réel. C'est aussi le meilleur des trois cas, car la tarification est échelonnée selon la durée de votre prompt.

Taille du promptEntrée / 1MSortie / 1M
Moins de 32K$0.03$0.13
De 32K à 256K$0.10$0.40
De 256K à 1M$0.20$0.80

Les deux choses pour lesquelles le modèle est réputé, le tarif à $0.03 et la fenêtre de 1M, ne peuvent donc pas être vraies en même temps dans la même requête. Utilisez le contexte et vous payez 6.7 fois le tarif d'entrée que vous aviez budgété. La propre fiche d'Alibaba imprime la structure identique à trois paliers en CNY, il n'y a donc aucune contradiction entre les deux vitrines, juste deux devises.

Le trafic réel dépasse déjà le prix affiché : la moyenne mobile sur 30 jours d'OpenRouter de ce que ses clients paient réellement est de $0.044 en entrée et $0.149 en sortie, avec un taux de succès de cache de 51%. J'ai couvert le calcul complet par paliers, l'économie du cache et la comparaison avec le reste du niveau bon marché dans la revue de Qwen 3.7 Flash ; les tarifs de toute la famille se trouvent dans l'article tarifs Qwen.

Où on peut réellement l'utiliser

C'est la partie que personne ne mentionne, et c'est la partie qui a effectivement fait échouer des projets que j'ai vus partir en production. Le modèle n'est pas le même produit dans toutes les régions.

Grille montrant la recherche web, l'inférence par lots et les limites de débit selon les quatre régions de Qwen
Grille montrant la recherche web, l'inférence par lots et les limites de débit selon les quatre régions de Qwen
CapacitéPékinSingapourFrancfortTokyo
Recherche webPrise en chargePrise en chargeNon prise en chargeNon prise en charge
Inférence par lotsPrise en chargeNon prise en chargeNon prise en chargeNon prise en charge
Appel de fonctionPrise en chargePrise en chargePrise en chargePrise en charge
Context cachingPrise en chargePrise en chargePrise en chargePrise en charge
Fine-tuningNon prise en chargeNon prise en chargeNon prise en chargeNon prise en charge
Requêtes par minute30,00015,00015,00015,000

Si vos exigences de résidence des données vous placent à Francfort ou à Tokyo, la recherche web intégrée sur laquelle repose la moitié des démos d'agents n'est tout simplement pas là, et vous devrez construire votre propre couche de récupération à la place. Si vous prévoyiez de l'exécuter comme un job par lots bon marché sur une archive d'images, l'inférence par lots existe à Pékin et nulle part ailleurs. Et le fine-tuning n'est disponible nulle part, dans aucune région, ce qui écarte la solution de secours habituelle consistant à enseigner votre domaine à un modèle bon marché. Le prompting et la récupération sont les seuls leviers dont vous disposez, ce qui répond de lui-même à la question RAG contre fine-tuning ici.

Il existe trois portes d'entrée : QwenCloud, Alibaba Cloud Model Studio, et enfin OpenRouter. À noter qu'OpenRouter n'a qu'un seul fournisseur derrière lui, Alibaba Cloud International, et transmet chaque requête directement là-bas. Aucun repli de routage, aucun second hôte vers lequel basculer. C'est un profil de risque très différent d'un modèle avec cinq fournisseurs en concurrence sur le prix.

Ce qui a été mesuré, et ce qui ne l'a pas été

Très peu de choses, et le peu qui existe mérite une lecture attentive.

Rien de la part de Qwen. Aucun tableau de score, aucun nom d'évaluation, aucun pourcentage, sur aucune surface. Le changelog est de la prose. La fiche modèle n'a pas de section d'évaluation. Les deux articles de recherche Qwen 3.7 publient des tableaux de benchmarks pour Max et Plus et ne mentionnent jamais Flash.

Rien de la part des évaluateurs habituels. Artificial Analysis renvoie une 404 franche pour ce modèle alors que sa page Plus renvoie un 200, l'absence est donc réelle et non un raté de scraping. Le classement LMArena répertorie sept entrées Qwen 3.7 et aucune d'entre elles n'est Flash. Hugging Face n'a aucun dépôt, car il n'y a pas de poids.

Une évaluation indépendante existe. Roboflow Vision Evals l'a noté, et la forme du résultat est le modèle en miniature : 22e sur 23 au global à 61.7%, 1er sur 23 sur le coût à environ $0.0001 par échantillon, 10e sur l'identification à 84.4%, et bon dernier sur la transcription OCR. Un seul cabinet d'évaluation ne fait pas un verdict, et il s'agit d'un banc de test spécifique à la vision plutôt que général. Cela reste le seul signal de qualité tiers qui existe.

La télémétrie du fournisseur est la source la plus riche. OpenRouter mesure 59 tokens par seconde en P50, une latence médiane de 1.20s, une disponibilité de 99.99%, et un taux d'erreur d'appel d'outil de 8.88%. Le chiffre que je mettrais sur une diapositive, c'est la traîne : latence P99 de bout en bout de 90.19 secondes. Dans une boucle d'agent, un appel sur cent qui bloque pendant une minute et demie n'est pas une erreur d'arrondi, c'est une file d'attente.

Le tableau côté communauté est tout aussi mince. La recherche en texte intégral de Hacker News renvoie zéro résultat pour ce modèle, et aucune histoire de lancement n'a jamais été soumise. Le 31 juillet, quatre jours après sa sortie, HN débattait justement de l'écart que ce modèle vient combler sans savoir qu'il existait, dans un fil consacré à une sortie concurrente :

Hacker News

"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."

Un autre commentateur dans le même fil explique le silence mieux qu'aucune analyse ne le pourrait : Qwen a arrêté de publier des poids ouverts, si bien que la foule qui amplifie normalement une sortie Qwen a arrêté de regarder.

Hacker News

"Qwen/Alibaba have stopped doing open weights releases for a while."

À qui ce modèle s'adresse

Sur la base de tout ce qui précède, le classement honnête est simple.

Utilisez-le si vous faites du travail multimodal à fort volume où une seule mauvaise réponse est peu coûteuse et récupérable : étiquetage d'images produit, classification de tickets en première passe, filtrage d'images vidéo, extraction en masse où un humain revoit la sortie de toute façon. Les données d'usage confirment cette lecture ; les principaux consommateurs sur OpenRouter sont des harnais d'agents, pas des produits de chat. Avec la 1re place sur 23 en coût, rien d'autre dans le niveau vision n'approche ce prix.

Évitez-le si vous avez besoin d'OCR, de contrôle GUI, d'un chiffre de qualité défendable, de poids que vous pouvez héberger, de fine-tuning, d'une latence de traîne sous la seconde, ou d'un second fournisseur pour basculer. N'importe lequel de ces points suffit à le disqualifier à lui seul.

Si ce sont des poids que vous voulez, regardez les options d'agents open source. Si vous cherchez un modèle bon marché noté et benchmarké, Gemini 3.5 Flash-Lite publie de vrais chiffres.

C'est aussi le cas de Gemini 3.6 Flash, ainsi que de Mistral, et chacun des trois vous dira ce que vous achetez.

Réfléchissez davantage si vous choisissez un modèle pour construire un produit destiné aux clients. C'est le sujet de la section suivante, et c'est là que j'ai vraiment des cicatrices.

Si cela s'approche d'une file de support client

Je construis les agents chez eesel, et nous avons passé des années à faire tourner de l'IA sur des files de support réelles, à travers des milliers de tickets réels. L'échec que j'ai vu le plus souvent n'est pas un modèle qui est bête. C'est un modèle qui est confiant tout en étant approximativement juste.

Une équipe de support technique B2B avec laquelle nous avons travaillé, qui exploite de la télématique automobile via Zendesk, est tombée précisément dans ce piège. Leur bot a commencé à dire aux clients « yes, we support your car model » pour des marques qui n'étaient pas dans leur base de données, parce qu'un article du centre d'aide affirmait que l'entreprise prenait en charge tous les modèles. Le modèle n'hallucinait pas dans un sens exotique quelconque. Il a lu un document, généralisé, et répondu avec une totale assurance. Leur responsable a décrit la phase de mise en place comme « trial and error in the beginning, » ce qui est une façon très polie de décrire le fait de découvrir cela en production.

Comparez maintenant Qwen 3.7 Flash à cela. Un taux d'erreur d'appel d'outil de 8.88%. Un P99 proche de 90 secondes. Dernier sur 23 en OCR tout en correspondant néanmoins à la vérité terrain 84.1% du temps en moyenne, ce qui correspond exactement au profil d'un modèle qui se trompe de manières qui paraissent justes. Aucun score de qualité publié avec lequel discuter. Ce sont de bons chiffres pour étiqueter un million d'images. Ce ne sont pas les chiffres que je veux voir se dresser entre une marque et un client agacé.

Tableau de bord eesel AI montrant l'activité des tickets Zendesk
Tableau de bord eesel AI montrant l'activité des tickets Zendesk

Le piège le plus profond est celui que crée une étiquette de prix à $0.03 : elle donne l'impression que le modèle est le produit. Il ne l'a jamais été. Les parties coûteuses sont la récupération sur un centre d'aide qui se contredit, le routage qui place le ticket au bon endroit, l'escalade qui ne laisse pas tomber le client en plein milieu d'une phrase, et savoir quand ne rien dire. Rien de tout cela n'arrive avec les tokens. La comparaison du coût par ticket a l'air magnifique sur un tableur, jusqu'à ce que vous chiffriez l'échafaudage.

Voir des bots confiants donner des réponses erronées avec assurance est la raison pour laquelle chaque déploiement que nous réalisons désormais est simulé sur des tickets historiques avant de toucher une file en production, afin que vous puissiez voir ce qu'il aurait répondu à de vrais clients plutôt que de l'apprendre par un vrai client. C'est un problème d'assurance qualité, pas un problème de sélection de modèle, et cela ne devient pas plus simple quand les tokens deviennent moins chers.

Si vous partez quand même sur la voie du fait-maison, et de nombreuses équipes le font raisonnablement, la lecture que je recommanderais vraiment commence par choisir un LLM pour le support, puis entraîner sur votre base de connaissances.

Ensuite, consacrez du temps réel à la prévention des hallucinations et au transfert vers un humain. Ces quatre problèmes sont le vrai travail. Le modèle est la partie facile.

Essayez eesel

Si vous êtes arrivé ici parce que vous chiffrez une IA de support et que $0.03 par million de tokens ressemblait à la réponse, la version honnête est que le coût du token n'a jamais été le chiffre qui décide de cela. eesel se connecte à Zendesk, Freshdesk, Gorgias et le reste en quelques minutes, s'entraîne sur votre centre d'aide existant et vos tickets passés, puis, avant de répondre à qui que ce soit, se rejoue face à des milliers de vos tickets historiques pour que vous puissiez voir les réponses réelles qu'il aurait envoyées et le taux de résolution qu'il aurait atteint. Vous gardez le contrôle exact sur les tickets qu'il est autorisé à toucher. Gratuit à essayer, et la simulation tourne avant que vous vous engagiez à quoi que ce soit.

Pour en savoir plus sur les décisions annexes, le guide de déviation des tickets couvre où le volume va réellement et les meilleurs outils de support client couvre ce qui existe d'autre.

Si vous fixez une file d'attente en ce moment même, les notes sur le désengorgement d'un backlog constituent la lecture la plus urgente, et le service client alimenté par l'IA offre une vue d'ensemble plus large. Et si vous voulez la logique du modèle bon marché depuis l'autre bout du marché, la comparaison Claude Opus 5 fait le même constat en sens inverse.

Questions fréquentes

Qu'est-ce que Qwen 3.7 Flash ?
Qwen 3.7 Flash est le modèle Qwen 3.7 le moins cher d'Alibaba : un modèle natif de raisonnement vision-langage qui reçoit du texte, de l'image et de la vidéo en entrée et renvoie du texte. Il est accessible uniquement par API, vendu via QwenCloud, Alibaba Cloud Model Studio et OpenRouter, avec une fenêtre de contexte de 1M de tokens et le raisonnement activé par défaut. Pour la famille plus large, notre aperçu de Qwen cartographie le reste de la gamme.
Combien coûte Qwen 3.7 Flash ?
Il coûte $0.03 par 1M de tokens en entrée et $0.13 par 1M de tokens en sortie, mais seulement pour des prompts sous les 32K. Entre 32K et 256K, cela passe à $0.10/$0.40, et au-delà de 256K, cela passe à $0.20/$0.80. Le calcul complet par paliers, incluant ce que paient réellement les clients d'OpenRouter, se trouve dans notre revue de Qwen 3.7 Flash, et les tarifs de toute la famille figurent dans le détail des tarifs Qwen.
Quelle est la fenêtre de contexte de Qwen 3.7 Flash ?
1,000,000 de tokens sur le papier. L'entrée utilisable est limitée à 991,808 en mode standard et à 983,616 en mode réflexion, avec une sortie limitée à 65,536 et un budget de chaîne de raisonnement de 262,144. Tout usage qui épuise cette fenêtre tombe dans le palier de tarification le plus élevé, donc un appel avec un contexte de 1M n'est pas un appel à $0.03.
Qwen 3.7 Flash prend-il en charge la vidéo ?
Oui. Sa chaîne de modalités est texte+image+vidéo vers texte, ce qui en fait le seul modèle de la famille Qwen 3.7 acceptant la vidéo. Plus accepte les images, et Max est uniquement textuel. Cette inversion est inhabituelle, puisque c'est normalement le niveau d'entrée de gamme qui a le moins de capacités.
Qwen 3.7 Flash est-il open source ?
Non. Hugging Face ne renvoie aucun dépôt pour ce modèle, OpenRouter enregistre un identifiant Hugging Face nul, et Roboflow indique une licence propriétaire. Toute la lignée Qwen 3.7 est à poids fermés, ce qui rompt réellement avec la réputation antérieure de Qwen. Si vous avez besoin de poids que vous pouvez héberger vous-même, commencez par notre sélection des meilleurs agents IA open source.
Qwen 3.7 Flash contre Qwen 3.7 Plus : quelle est la différence ?
Flash est environ 10 fois moins cher en entrée, plus rapide en débit mesuré, et le seul des deux à accepter la vidéo. Plus est celui auquel Qwen attribue la lecture d'écran et l'exploitation de l'interface graphique, et c'est celui qui possède un score d'intelligence Artificial Analysis. Flash n'a strictement aucun chiffre de qualité publié.
Où puis-je utiliser Qwen 3.7 Flash ?
Quatre régions : Pékin, Singapour, Francfort et Tokyo. La recherche web ne fonctionne qu'à Pékin et Singapour, l'inférence par lots est exclusive à Pékin, et le fine-tuning n'est disponible nulle part. Les limites de débit sont de 30,000 requêtes par minute à Pékin et 15,000 dans les trois autres régions.
Qwen 3.7 Flash est-il assez performant pour le support client ?
Pour la classification et l'étiquetage en masse, probablement. Pour répondre aux clients, les chiffres jouent contre lui : un taux d'erreur d'appel d'outil de 8.88%, une latence P99 proche de 90 secondes, et aucun score de qualité publié. Notre guide sur la prévention des hallucinations et les notes sur le taux de résolution par IA expliquent pourquoi le seuil de confiance compte plus que le prix du token.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Illustration de deux personnes examinant des cartes de tarifs échelonnés sur un écran, avec le logo Qwen
Trending

Tarifs de Qwen 3.7 Flash : ce que vous payez vraiment en 2026

Le tarif de $0.03 est réel, et ce n'est qu'un des quatre compteurs sur votre facture. Voici comment le palier de prompt, le cache, la région de batch et le taux de retentatives se combinent pour former le montant qui vous est réellement facturé.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Illustration éditoriale représentant une comparaison de modèles d'IA en tant qu'alternatives à Inkling
Trending

8 meilleures alternatives à Inkling en 2026

Inkling est ouvert et intéressant, mais il est cher pour un modèle à poids ouverts et ce n'est pas le modèle le plus intelligent que vous puissiez utiliser. Voici les 8 alternatives que j'essaierais vraiment, avec de vrais prix et les points forts de chacune.

Rama Adi NugrahaRama Adi NugrahaJul 20, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab passé en revue
Trending

Avis sur Inkling : le modèle ouvert de Thinking Machines vaut-il le coup ?

Un avis honnête sur Inkling : ce dans quoi le premier modèle à poids ouverts de Thinking Machines Lab excelle vraiment, où le prix et les benchmarks déçoivent, et qui devrait vraiment l'utiliser.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Illustration d'Inkling, le modèle d'IA à poids ouverts de Thinking Machines Lab
Trending

Inkling expliqué : le modèle d'IA à poids ouverts de Thinking Machines

Ce qu'est vraiment Inkling : le premier modèle à poids ouverts de Thinking Machines Lab, ses vrais benchmarks, ce qu'il coûte à faire tourner, et s'il a sa place près d'une file de support.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Illustration éditoriale d'un classement de benchmarks avec une barre haute mise en évidence, représentant ZCode et le modèle GLM-5.2
Trending

ZCode : ce qu'est vraiment le nouvel agent de codage IA de Z.ai

Un test concret de ZCode, l'application de codage agentique gratuite de l'équipe GLM : le modèle GLM-5.2 qui la fait tourner, les vraies critiques de la semaine de lancement, et à qui elle s'adresse.

Rama Adi NugrahaRama Adi NugrahaJul 12, 2026
Illustration du décryptage des tarifs de PromptQL
Trending

Tarifs PromptQL : ce que ça coûte vraiment en 2026

Un décryptage des tarifs de PromptQL : l'unité facturable OLU, le tarif de lancement à 0,14 $, les crédits gratuits, le multiplicateur de modèle qui détermine vraiment la facture, et des exemples de coûts calculés.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 10, 2026
Bannière illustrée pour un guide sur les tarifs et les coûts d'API de Google Gemini 3.5 Pro
Trending

Tarifs de Gemini 3.5 Pro : ce qu'il coûte (et ce qui manque encore)

Une réponse honnête sur les tarifs de Gemini 3.5 Pro : ce n'est pas encore disponible. Voici ce que coûte le palier Pro actuel, les offres grand public et le vrai calcul de l'API.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Illustration éditoriale d'un grand modèle de langage raisonnant sur un long flux de documents
Trending

Avis sur Kimi K3 : le modèle frontière open source de Moonshot, testé

Un avis pratique sur Kimi K3 : l'architecture du modèle open source de 2,8 billions de paramètres, les benchmarks, les prix réels, et ce que pense vraiment la communauté durant sa semaine de lancement.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Bannière principale de l'avis Tasklet AI 2026
Trending

Avis Tasklet AI 2026 : la plateforme d'agents en vaut-elle la peine ?

Un avis pratique sur Tasklet AI pour 2026 : ce que fait réellement la plateforme d'agents IA, comment se comporte le prix au crédit sous une charge de travail réelle, ses points forts et ses limites.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement