Tarifs Cohere Embed 5 : ce que coûtent vraiment Pro et Fast en 2026

Rama Adi
Écrit par

Rama Adi

Katelin Teen
Relu par

Katelin Teen

Dernière modification October 1, 2026

Vérifié par un expert
Illustration de deux personnes examinant un tableau de bord des tarifs Cohere Embed 5 avec le logo Cohere

Tarifs Cohere Embed 5 en un coup d'œil

Cohere a lancé la famille Embed 5 le 30 septembre 2026, en deux niveaux, qui partagent tous deux un contexte de 128K et plus de 100 langues, avec des entrées pouvant être du texte, une image ou la combinaison fusionnée texte plus image. J'ai relevé chaque prix publié et les ai réunis dans un tableau, tirés directement de la page de tarifs de Cohere, de l'article de lancement et des fiches des places de marché cloud :

OptionPrixFacturé parIdéal pour
Clé d'essaiGratuit, 1 000 appels/moisn/a (pas d'usage en production)Tests
Embed 5 Pro, texte0,12 $ / million de tokensTokens d'entréeIndexer des documents
Embed 5 Fast, texte0,08 $ / million de tokensTokens d'entréeRequêtes, boucles d'agents
Embed 5 Pro ou Fast, images0,40 $ / million de tokensTokens d'imageImages de pages, diapositives
Model Vault Small (Pro ou Fast)3,00 $/h ou 2 000 $/moisInstance dédiéeVolume élevé et constant
Model Vault Medium (Pro ou Fast)5,00 $/h ou 3 250 $/moisInstance dédiéeTrès gros volume
Amazon SageMaker2,39 $ à 8,48 $/hôte/h de frais logiciels + instanceHeureÉquipes déjà sur AWS
Microsoft FoundryListé en préversion, pas encore de prixn/aÉquipes sur Azure
Page de tarifs de Cohere montrant Embed 5 Pro à 0,12 $ et Embed 5 Fast à 0,08 $ par million de tokens, aux côtés de Rerank 4 et Parse 5, tirée de Cohere
Page de tarifs de Cohere montrant Embed 5 Pro à 0,12 $ et Embed 5 Fast à 0,08 $ par million de tokens, aux côtés de Rerank 4 et Parse 5, tirée de Cohere

Le même onglet liste aussi Parse 5 à 1,50 $ pour 1 000 pages et Rerank 4 dès 2,00 $ pour 1 000 recherches, et avec Embed 5 ils forment toute la pile de recherche que vend Cohere. En lisant les fiches, deux choses m'ont sauté aux yeux. D'abord, Model Vault facture le même tarif pour Pro et Fast, ce qui signifie que sur une instance dédiée toute la logique du « Fast est moins cher » disparaît, et que la seule raison de choisir Fast y est la vitesse. Ensuite, Embed 4 a complètement disparu de la page de tarifs, alors que la documentation des modèles le liste encore sans avis de dépréciation. Si vous êtes sur Embed 4 aujourd'hui, rien ne casse, mais le signal sur l'endroit où Cohere veut vous voir est assez clair. (Mon avis sur Cohere AI couvre le reste de la gamme.)

Je construis des intégrations chez eesel, et la partie d'eesel qui transforme un centre d'aide et quelques années de tickets en quelque chose qu'une IA peut interroger, c'est précisément cette couche. Quand je lis des fiches de prix d'embeddings, je les lis donc comme un plombier lit un devis de tuyaux. Le prix à l'unité compte, bien sûr, mais ce que vous chiffrez vraiment, c'est tout ce à quoi les tuyaux se raccordent.

Ce qui change par rapport à Embed 4

La version courte : Cohere a tenu le prix, puis bougé à peu près tout le reste. Voici la comparaison côte à côte, avec les tarifs d'Embed 4 tirés des tarifs Cohere sur Azure et de l'instantané de prix de Cohere d'août :

Embed 4Embed 5 ProEmbed 5 Fast
Texte, par million de tokens0,12 $0,12 $0,08 $
Images, par million de tokens0,47 $0,40 $0,40 $
Model Vault Small4,00 $/h, 2 500 $/mois3,00 $/h, 2 000 $/mois3,00 $/h, 2 000 $/mois
Dimensions par défaut153620482048
Score ViDoRe V3 (Cohere)77,085,884,5

Vous obtenez donc un bond de qualité de 8,8 points au même prix du texte, des images 15 % moins chères et une instance dédiée à 500 $ de moins par mois. Fast, lui, n'existait pas du tout avant.

La ligne que j'entourerais est celle des dimensions par défaut. Le prix par token est le même, mais chaque vecteur sort un tiers plus gros par défaut. Si vous changez de modèle en gardant les réglages par défaut, votre facture d'embeddings reste stable et celle de votre base vectorielle augmente. J'y viens plus bas, car la correction est simple et fait vraiment économiser de l'argent.

Ce qui compte comme token facturable

La documentation de facturation de Cohere indique qu'embed est facturé selon le nombre de tokens vectorisés, et les tokens que Cohere ajoute en coulisses ne sont pas facturés. Vous ne payez que l'entrée. Il n'y a aucun frais de tokens de sortie, puisqu'un appel d'embedding renvoie une liste de nombres et non du texte.

Quelques détails méritent d'être connus, car ils façonnent la facture réelle :

  • Le batching ne change pas le prix. Chaque appel embed accepte jusqu'à 96 textes ou entrées, ce qui aide le débit, mais le coût par token reste le même.
  • Les images sont facturées au token, mais la conversion n'est pas publiée. La documentation explique le redimensionnement (les images de plus de 2 458 624 pixels sont réduites) sans donner de formule de tokens par image. Il vaut donc la peine de lancer d'abord un petit échantillon avant de fixer un budget pour une grosse archive de PDF.
  • Aucune remise par lots n'est indiquée. L'article de lancement dit que l'embedding par lots est disponible, mais le guide Embed Jobs dit toujours qu'il ne fonctionne qu'avec les modèles v3.0. Ne comptez pas sur un tarif par lots à 50 % comme celui de Google.
  • Les clés d'essai sont étroites. L'embedding de texte tourne à 2 000 entrées par minute en essai comme en production, mais l'embedding d'images est de 5 entrées par minute en essai contre 400 en production.

Tout le reste est de l'arithmétique simple : tokens d'entrée fois le tarif. C'est le même modèle de facturation que l'API OpenAI et la plupart des autres services d'embeddings hébergés.

L'astuce : indexer avec Pro, interroger avec Fast

Pour moi, c'est la chose la plus utile de tout le lancement, et c'est en fait une fonction de prix déguisée en fonction technique. Pro et Fast partagent un même espace d'embeddings, donc une requête vectorisée par Fast peut interroger un index construit par Pro, sans rien reconstruire.

"For many customers, we recommend the following deployment pattern: index with Pro, query with Fast."

Cohere a testé chaque association sur 40 jeux de données de développement. Avec une configuration entièrement Pro notée 100, un index Pro interrogé par Fast obtient 98,4, un index Fast interrogé par Pro 97,3, et tout Fast 96,6. Un piège se cache dans les notes de bas de page : les deux côtés doivent utiliser la même dimension de sortie.

Indexer une fois avec Pro à 0,12 $ par million, interroger avec Fast à 0,08 $ par million, en conservant 98,4 % de la qualité entièrement Pro
Indexer une fois avec Pro à 0,12 $ par million, interroger avec Fast à 0,08 $ par million, en conservant 98,4 % de la qualité entièrement Pro

Pourquoi cela compte-t-il pour le coût ? Parce que dans la plupart des systèmes de recherche et de RAG (voici un pipeline RAG de support si vous voulez voir la forme complète), l'indexation se fait une fois (plus les mises à jour), alors que les requêtes se font indéfiniment. Vous payez ainsi le tarif Pro sur la partie rare, et le tarif Fast sur celle que vous faites à chaque seconde. Fast a aussi traité 377,3 documents par seconde contre 159,7 pour Pro dans le test de débit de Cohere, donc les requêtes sont plus rapides en plus d'être moins chères.

Diagramme à barres du débit d'Embed 5 : Fast à 377,3 documents par seconde contre Pro à 159,7, tiré de Cohere
Diagramme à barres du débit d'Embed 5 : Fast à 377,3 documents par seconde contre Pro à 159,7, tiré de Cohere

Je nuancerais un peu la lecture habituelle, car pour la plupart des équipes le côté requêtes est minuscule. Un bot de support qui traite 30 000 questions par mois, à environ 100 tokens chacune, envoie 3 millions de tokens de requête : 0,36 $ sur Pro ou 0,24 $ sur Fast. Le titre « Fast fait économiser » est réel à l'échelle des boucles d'agents, où un modèle lance des dizaines de recherches par tâche. Pour un centre d'aide normal, choisissez Fast pour la latence, puis ne vous souciez plus de son coût.

Le coût que la page de tarifs ne montre pas : le stockage vectoriel

Chaque vecteur que vous créez doit vivre quelque part, généralement dans une base de données vectorielle, et ce quelque part vous facture chaque mois. Dans un budget d'embeddings, c'est la partie que je vois le plus sous-estimée, car l'API d'embeddings est un coût unique par document alors que la base de données est un loyer.

Embed 5 vous laisse choisir la taille de sortie (256, 512, 768, 1024, 1536 ou 2048 dimensions) et le format (float, int8, binary et quelques variantes). L'exemple de Cohere : 100 millions de chunks avec les 2048 dimensions float par défaut occupent 819 Go, tandis que 256 dimensions binary occupent 3,2 Go, soit 256 fois moins.

Stockage pour 100 M de chunks : 2048-dim float à 819 Go coûte environ 270 $/mois, 1024-dim int8 à 102 Go environ 34 $/mois, 256-dim binary à 3,2 Go environ 1 $/mois
Stockage pour 100 M de chunks : 2048-dim float à 819 Go coûte environ 270 $/mois, 1024-dim int8 à 102 Go environ 34 $/mois, 256-dim binary à 3,2 Go environ 1 $/mois

J'ai chiffré ces trois tailles sur le plan serverless de Pinecone à 0,33 $ par Go et par mois (octets de vecteurs bruts uniquement, avant surcoût d'index et métadonnées). L'écart est alors de 270 $ par mois contre 34 $ contre environ 1 $. Sur deux ans, le réglage float par défaut coûte environ 6 500 $ rien qu'en stockage, plus que les 6 000 $ que coûte la vectorisation de 50 milliards de tokens avec Pro au départ.

Ce que vous perdez en qualité en réduisant est plus faible qu'on ne le pense. Le graphique de Cohere trace la qualité de recherche face au coût de stockage relatif, et les courbes int8 se superposent presque aux courbes float. La recommandation de Cohere elle-même est int8 en 1024 dimensions, et c'est aussi le réglage par lequel je commencerais.

Graphique de Cohere de la qualité de recherche face au coût relatif de stockage vectoriel pour Embed 5 Pro, Embed 5 Fast et Voyage 4 Large en float32, int8 et binary, tiré de Cohere
Graphique de Cohere de la qualité de recherche face au coût relatif de stockage vectoriel pour Embed 5 Pro, Embed 5 Fast et Voyage 4 Large en float32, int8 et binary, tiré de Cohere

D'autres bases de données tarifent différemment, et la forme de la facture change avec elles. Weaviate Cloud facture par million de dimensions vectorielles stockées (dès 0,00465 $ sur Flex), donc 2048 dimensions coûtent littéralement le double de 1024. Pinecone facture aussi de 16 $ à 18 $ par million d'unités de lecture sur Standard, avec un minimum mensuel de 50 $, et pour de petits index cela pèse plus que le stockage. J'ai comparé les options de bases de données plus en détail dans mon analyse des tarifs Weaviate et le tour d'horizon des alternatives à Weaviate.

Si vous préférez ne pas gérer de base du tout, l'option hébergée d'OpenAI est traitée dans mon guide des vector stores, même si elle vous lie aux modèles d'embeddings d'OpenAI.

Estimez votre facture Embed 5

Saisissez ici votre propre corpus et votre propre trafic. Le calculateur utilise les tarifs publiés de l'API et le tarif de stockage de Pinecone de 0,33 $/Go, la ligne de stockage est donc à considérer comme un plancher.

Essayez de passer de int8 en 1024 dimensions à float en 2048 dimensions, les valeurs par défaut d'Embed 5. Sur un million de chunks, la facture d'indexation ne bouge pas du tout, tandis que la ligne de stockage est multipliée par 8.

API vs Model Vault vs places de marché cloud

Model Vault remplace le compteur au token par un loyer fixe pour une instance dédiée mono-locataire. Le calcul du seuil de rentabilité est assez simple :

InstanceMensuelRentable sur ProRentable sur Fast
Small2 000 $~16,7 Md de tokens/mois~25 Md de tokens/mois
Medium3 250 $~27,1 Md de tokens/mois~40,6 Md de tokens/mois

Seize milliards de tokens par mois, c'est environ 550 millions par jour. Très peu d'équipes vectorisent autant, donc pour presque tout le monde l'API reste l'option la moins chère. Cohere ne publie pas non plus combien de tokens une instance Small peut traiter par mois : vérifiez le débit avec l'équipe commerciale avant de supposer qu'une instance couvrira votre pic.

Des gens achètent quand même Model Vault, et la raison tient plus au contrôle qu'au prix. Il n'y a pas de multi-location partagée et le débit est garanti, ce qui donne aussi un meilleur argumentaire pour les revues de sécurité. Cela colle avec tout le discours de Cohere sur le déploiement en entreprise. Si vous avez besoin que tout reste dans votre propre réseau, les deux modèles peuvent être auto-hébergés sur vLLM via un déploiement privé, au prix fixé par l'équipe commerciale.

Les places de marché sont alors une troisième voie. Sur Amazon SageMaker, Embed 5 est facturé comme des frais logiciels horaires par hôte (2,39 $ sur une ml.g5.xlarge, jusqu'à 8,48 $ sur la plus grande instance Pro) plus l'instance SageMaker elle-même. Microsoft Foundry liste les deux modèles en préversion, sans prix pour l'instant. Amazon Bedrock et Oracle OCI n'ont encore qu'Embed 4 au 1er octobre, à 0,12 $ par million de tokens sur Bedrock. Si votre entreprise a des dépenses cloud engagées, la voie de la place de marché peut rester pertinente même quand le tarif brut est moins bon.

Exemples concrets : ce que paie une vraie équipe

Voici trois scénarios, avec les tarifs publiés et un stockage int8 en 1024 dimensions sauf mention contraire.

Le centre d'aide et l'historique de tickets d'une équipe support. 2 000 articles d'aide d'environ 800 tokens et 50 000 anciens tickets d'environ 400 tokens font 21,6 millions de tokens. Indexer avec Pro coûte 2,59 $, une seule fois. Les requêtes, à 30 000 par mois sur Fast, coûtent 0,24 $ par mois. Les vecteurs tiennent dans l'offre gratuite de 2 Go de Pinecone. La facture d'embeddings est ici une erreur d'arrondi. Le vrai coût se trouve dans l'ingénierie du découpage et de la synchronisation, plus les permissions et la couche LLM par-dessus, le même arbitrage que je détaille dans la recherche sémantique sur Zendesk Guide.

Une archive de documents pour un outil de recherche interne. 20 millions de chunks de 500 tokens font 10 milliards de tokens. L'indexation Pro coûte 1 200 $ ; Fast serait à 800 $. Le stockage en float 2048 dimensions est d'environ 164 Go, soit 54 $ par mois sur Pinecone. En int8 1024, environ 20 Go, soit 6,76 $ par mois. À la sortie du prochain modèle, une réindexation recoûte les 1 200 $ complets, et si les PDF doivent d'abord être analysés, Parse 5 ajoute sa propre facture à la page.

Un agent à fort volume qui cherche à chaque étape. 500 millions de tokens de requête par jour font 15 milliards par mois. Sur Fast, 1 200 $ par mois ; sur Pro, 1 800 $. Aucun des deux ne franchit la ligne des 2 000 $ de Model Vault, donc l'API l'emporte, sauf si vous avez besoin de capacité dédiée.

La leçon des trois : l'API d'embeddings n'est presque jamais la partie coûteuse. Le stockage et la réindexation le sont, tout comme les personnes qui maintiennent le pipeline.

Comment se positionnent les tarifs d'Embed 5

J'ai aligné Embed 5 face aux autres modèles d'embeddings phares, chaque prix tiré de la page de tarifs de l'éditeur. Les scores sont les chiffres ViDoRe V3 de Cohere issus de son article de lancement : lisez-les comme le test de Cohere elle-même et non comme un test indépendant.

Prix par million de tokens de texte : Embed 5 Fast 0,08 $, Embed 5 Pro 0,12 $, Voyage 4 Large 0,12 $, OpenAI 3-large 0,13 $, Gemini Embedding 2 0,20 $, avec les scores ViDoRe V3 rapportés par Cohere
Prix par million de tokens de texte : Embed 5 Fast 0,08 $, Embed 5 Pro 0,12 $, Voyage 4 Large 0,12 $, OpenAI 3-large 0,13 $, Gemini Embedding 2 0,20 $, avec les scores ViDoRe V3 rapportés par Cohere
ModèleTexte / million de tokensLotsOffre gratuiteViDoRe V3 (Cohere)
Cohere Embed 5 Pro0,12 $Non indiquéEssai de 1 000 appels/mois85,8
Cohere Embed 5 Fast0,08 $Non indiquéEssai de 1 000 appels/mois84,5
Voyage 4 Large0,12 $33 % de remise200 M de tokens83,7
Gemini Embedding 20,20 $0,10 $Oui83,2
OpenAI text-embedding-3-large0,13 $n/aAucune75,5
OpenAI text-embedding-3-small0,02 $n/aAucunen/a
Jina Embeddings v50,045 $ à 0,05 $n/a10 M de tokens, non commercial74,5 (v5 Small)
Mistral embed0,10 $n/an/an/a

Embed 5 Fast est le modèle le moins cher du groupe le mieux noté, et Pro égale Voyage 4 Large sur le prix tout en le devançant légèrement sur le test de Cohere. Gemini Embedding 2 coûte 2,5 fois ce que coûte Fast au plein tarif, même si son prix par lots de 0,10 $ réduit beaucoup l'écart pour l'indexation hors ligne (tarifs complets dans mon guide des tarifs Gemini). L'API d'embeddings d'OpenAI coûte un cent de plus que Pro pour un score bien plus bas sur ce benchmark.

Graphique ViDoRe V3 de Cohere : Embed 5 Pro 85,8, Embed 5 Fast 84,5, Gemini Embedding 2 83,2, Voyage 4 Large 83,7, Embed 4 77,0, Jina v5 Small 74,5, OpenAI text-embedding-3-large 75,5, tiré de Cohere
Graphique ViDoRe V3 de Cohere : Embed 5 Pro 85,8, Embed 5 Fast 84,5, Gemini Embedding 2 83,2, Voyage 4 Large 83,7, Embed 4 77,0, Jina v5 Small 74,5, OpenAI text-embedding-3-large 75,5, tiré de Cohere

Deux réserves honnêtes s'imposent. Si le prix pur par token est votre seul objectif, 3-small d'OpenAI et Voyage 4 Lite sont tous deux à 0,02 $, un quart de Fast. Et le tableau multilingue de Cohere elle-même montre Gemini Embedding 2 devant Pro sur 9 des 10 langues asiatiques et moyen-orientales testées, le télougou affichant le plus grand écart (91 contre 80). Si votre corpus est surtout en hindi, japonais ou arabe, testez Gemini avant de vous engager. Le modèle embed de Mistral à 0,10 $ est une autre option pour des données européennes ; voir mes notes sur les tarifs de Mistral AI. Pour une liste plus large, mon article sur les alternatives à Cohere AI compare les fournisseurs au-delà des embeddings.

Ce que disent les développeurs

Embed 5 a un jour au moment où j'écris, donc il n'existe pas encore de vrais avis d'utilisateurs. Ce qui existe, c'est un historique régulier pour les embeddings de Cohere en général, et le thème qui revient est la fiabilité :

Hacker News

"It has the most crisp, steady P50 of any external service I've used in a long time."

Les critiques portent plutôt sur le coût à grand volume et sur la dépendance à une API fermée, ce qui est vrai de tout modèle d'embeddings hébergé :

G2

"The API can also become expensive when you start using it more frequently."

Reddit

"Voyage for embeddings + rerank is totally defensible - Cohere is popular partly because it's been the default in a lot of examples, not because it's always better."

Je trouve cette dernière remarque juste, et les chiffres d'Embed 5 confirment les deux côtés : Pro gagne le benchmark de Cohere elle-même, mais de 2,1 points sur Voyage 4 Large au même prix. Si vous faites déjà bien tourner Voyage, rien ne presse pour migrer. Si vous êtes sur Embed 4, passer à Embed 5 ne coûte rien de plus par token et c'est presque un gain pur. L'intégration Cohere de LangChain réduit le changement à une modification d'une ligne du modèle, même s'il faudra quand même revectoriser le corpus.

Quelle option tarifaire d'Embed 5 vous convient

Voici mes recommandations, selon la situation :

  • Vous prototypez. Utilisez la clé d'essai, puis une clé de production à l'usage. Ne pensez pas encore à Model Vault.
  • Vous construisez une recherche ou un RAG sur un corpus fixe. Indexez avec Pro, interrogez avec Fast, stockez en int8 1024 dimensions. C'est la configuration de haute qualité la moins chère que propose Cohere.
  • Vous faites tourner des agents qui cherchent en permanence. Fast des deux côtés si vous avez besoin du débit 2,4 fois supérieur ; index Pro plus requêtes Fast si la qualité prime.
  • Vous vectorisez des dizaines de milliards de tokens par mois ou avez besoin d'isolation. Chiffrez Model Vault et demandez à l'équipe commerciale le débit par instance avant de signer. Sur AWS, comparez avec SageMaker et les tarifs des agents Bedrock que vous payez peut-être déjà.
  • Vous vectorisez surtout du contenu en langues asiatiques. Comparez d'abord Gemini Embedding 2 à Pro sur vos propres données.
  • Vous voulez juste un bot de support qui répond à partir de vos documents. Sautez complètement la décision sur les embeddings et regardez une base de connaissances IA ou un coéquipier helpdesk qui gère la recherche pour vous.

Essayez eesel quand l'objectif, ce sont des réponses de support

La plupart de ceux qui chiffrent des modèles d'embeddings ne construisent pas un moteur de recherche pour lui-même. Ils hésitent souvent entre RAG et fine-tuning pour un centre d'aide. Ce qu'ils veulent au final, c'est un bot qui répond aux clients à partir d'un centre d'aide et d'anciens tickets. C'est là que je m'arrêterais pour demander si vous avez vraiment besoin de posséder la pile.

Chez eesel, j'ai vu des équipes faire ce choix dans les deux sens. Une entreprise néerlandaise d'hébergement web sur Zendesk, qui dépensait environ 1 700 $ par mois, a quitté eesel pour construire sa propre IA en interne. Le constat de l'équipe par la suite n'avait rien à voir avec le coût des modèles :

"A lot of their friction came from setup complexity (handovers, Zendesk integration, business hours logic) and a lack of clear guidance on how to configure things correctly."

C'est la partie que les pages de tarifs d'embeddings ne montrent jamais. Les vecteurs ne coûtent presque rien. Ce sont les transferts et les intégrations, plus les règles autour, qui constituent le vrai travail.

Vue d'activité d'eesel montrant les conversations résolues et en attente d'un coéquipier IA dans une instance Zendesk connectée
Vue d'activité d'eesel montrant les conversations résolues et en attente d'un coéquipier IA dans une instance Zendesk connectée

eesel est un coéquipier helpdesk IA qui rejoint votre file existante dans Zendesk, Freshdesk et d'autres helpdesks, apprend de votre base de connaissances et de vos anciens tickets, et vous laisse rejouer de vrais tickets à travers lui avant qu'il ne parle à un client. Il n'y a aucun modèle d'embeddings à choisir ni nombre de dimensions à régler, et vous n'avez pas non plus de facture de base vectorielle.

La tarification repose sur des plans de crédits fixes à partir de 299 $ pour 500 crédits par mois, un ticket ou un chat traité valant un crédit.

Si vous êtes développeur, choisir cette voie ne signifie pas perdre le contrôle, ce que je détaille davantage dans mon guide de l'API d'agent de support client. La CLI eesel permet de connecter des intégrations, de modifier les instructions du coéquipier, d'approuver ou de refuser les actions en attente et de lire son journal d'activité depuis un terminal, avec une sortie JSON et un indicateur --dry-run pour les scripts. Des agents de code comme Claude Code peuvent aussi la piloter via MCP.

J'ai écrit davantage sur ce flux de travail dans gérer des agents depuis le terminal et le guide de la CLI pour le support.

Essayez eesel gratuitement et voyez à quoi ressemble votre centre d'aide en coéquipier de support opérationnel, sans écrire un seul appel d'embedding.

Questions fréquentes

Combien coûte Cohere Embed 5 ?
Selon la page de tarifs de Cohere, Embed 5 Pro coûte 0,12 $ par million de tokens sur l'API à l'usage, et Embed 5 Fast coûte 0,08 $ par million de tokens. Les entrées d'images coûtent 0,40 $ par million de tokens sur les deux niveaux. Pour le reste de la gamme Cohere, voir mon analyse des tarifs de Cohere AI.
Quelle est la différence de prix entre Embed 5 Pro et Embed 5 Fast ?
Fast est un tiers moins cher sur le texte (0,08 $ contre 0,12 $ par million de tokens) et environ 2,4 fois plus rapide, avec un score de 84,5 contre 85,8 sur le test ViDoRe V3 de Cohere. Les tokens d'image coûtent le même 0,40 $ sur les deux. Comme ils partagent un seul espace vectoriel, beaucoup d'équipes indexent avec Pro et interrogent avec Fast, le schéma que Cohere recommande elle-même.
Cohere Embed 5 est-il plus cher qu'Embed 4 ?
Non. Embed 5 Pro conserve les 0,12 $ par million de tokens de texte d'Embed 4, les tokens d'image passent de 0,47 $ à 0,40 $, et la plus petite instance Model Vault passe de 2 500 $ à 2 000 $ par mois. Le seul coût qui peut augmenter est le stockage, puisqu'Embed 5 utilise 2048 dimensions par défaut contre 1536 pour Embed 4. Plus de contexte dans mon avis sur Cohere AI.
Existe-t-il une offre gratuite pour Cohere Embed 5 ?
Chaque compte reçoit une clé d'essai gratuite, mais d'après la documentation des limites de débit, elle est plafonnée à 1 000 appels d'API par mois et Cohere n'autorise pas son usage en production ni à des fins commerciales. Les clés de production sont à l'usage, facturées chaque mois ou dès que votre solde atteint 250 $.
Quand Cohere Model Vault devient-il moins cher que l'API Embed 5 ?
L'instance Small à 2 000 $/mois atteint son seuil de rentabilité à environ 16,7 milliards de tokens Pro ou 25 milliards de tokens Fast par mois. En dessous, l'API au token est moins chère. La plupart des équipes choisissent Model Vault pour l'isolation et un débit garanti, pas pour économiser sur les embeddings RAG.
Comment les tarifs de Cohere Embed 5 se comparent-ils aux embeddings d'OpenAI ?
text-embedding-3-large d'OpenAI coûte 0,13 $ par million de tokens et text-embedding-3-small coûte 0,02 $. Embed 5 Pro est un cent moins cher que 3-large et obtient 85,8 contre 75,5 sur le benchmark de Cohere. Mon guide de l'API d'embeddings d'OpenAI détaille le côté OpenAI.
Ai-je besoin de Cohere Embed 5 pour créer un agent de support IA ?
Seulement si vous construisez vous-même la pile de recherche. Un agent de helpdesk IA comme eesel gère l'embedding, le stockage et la recherche pour un seul prix, donc vous ne dimensionnez jamais une base vectorielle et ne choisissez aucun nombre de dimensions. Il apprend directement de votre base de connaissances et de vos anciens tickets.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Deux personnes qui cherchent dans un index de documents alimenté par les embeddings de Cohere Embed 5
Trending

Cohere Embed 5 : Pro vs Fast, benchmarks, tarifs et mode d'emploi

Cohere Embed 5 expliqué : ce que sont Pro et Fast, l'astuce d'indexer avec Pro, la solidité des benchmarks, ce que ça coûte et quand le prix par token n'a plus d'importance.

KiraKiraOct 1, 2026
Illustration comparant les niveaux de modèle DeepSeek V4 Flash et V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro : quel niveau utiliser ?

Le niveau bon marché de DeepSeek obtient désormais un score plus élevé que le niveau cher sur le classement indépendant. Voici précisément où cela se vérifie, et les deux endroits où ce n'est pas le cas.

Rama AdiRama AdiAug 3, 2026
Illustration dessinée à la main de deux personnes regardant une petite étiquette de prix et une autre bien plus grande à côté d'une grande étincelle bleue Gemini, pour un guide des tarifs de Gemini 4 Argon
Trending

Tarifs de Gemini 4 Argon : la promo à 2 $/10 $, la facture à 4 $/20 $ et ce que coûte vraiment une tâche

Gemini 4 Argon coûte pour l'instant 2 $/10 $ par million de tokens, puis 4 $/20 $. Voici ce que cela donne par tâche, par ticket et face à GPT-6.1 Sol et Claude Opus 5.5.

KiraKiraOct 1, 2026
Bannière des tarifs TypeSafe Jev en rose et blanc cassé, montrant un faible coût par million de tokens
Trending

Tarifs TypeSafe Jev (2026) : 0,042 $ par million de tokens, sortie gratuite

Les tarifs de TypeSafe Jev expliqués : 0,042 $ par million de tokens en entrée, sortie gratuite, aucun palier tarifaire pour l'instant, et ce que coûte réellement un modèle System One en production.

Kurnia KharismaKurnia KharismaSep 22, 2026
Bannière principale de TypeSafe Jev en rose et blanc cassé, illustrant un modèle rapide de décisions typées
Trending

Avis TypeSafe Jev : le modèle « System One » qui donne à l'IA les propriétés du code

Un avis pratique sur TypeSafe Jev : ce que le modèle System One fait vraiment, si les promesses de vitesse, de prix et d'impossibilité de « halluciner » tiennent la route, et où un modèle de décisions typées trouve sa place dans le travail réel.

Rama AdiRama AdiSep 21, 2026
Illustration annonçant Claude Fable 5.1, le nouveau modèle de pointe d'Anthropic
Trending

Claude Fable 5.1 : tarifs, capacités et ce que ça change pour votre équipe

Claude Fable 5.1 est le modèle le plus performant d'Anthropic à ce jour. Voici les tarifs réels, ce qui a changé par rapport à Fable 5, et où il se positionne pour les équipes support et contenu.

KiraKiraSep 2, 2026
Deux personnes examinant des compteurs de tokens, des grilles tarifaires par million de tokens et une longue facture imprimée
Trending

Tarifs de l'API Anthropic en 2026 : tous les tarifs et les vrais leviers de coût

La grille tarifaire complète de l'API Anthropic pour chaque modèle Claude, plus les quatre multiplicateurs qui déterminent votre facture réelle : mise en cache, batch, effort et deux majorations.

Kurnia KharismaKurnia KharismaAug 13, 2026
Tarifs de Grok 4.6 en 2026 : chaque tarif, et ce que les équipes paient vraiment
Trending

Tarifs de Grok 4.6 en 2026 : chaque tarif, et ce que les équipes paient vraiment

Grok 4.6 affiche un tarif de 2,00 $ en entrée et 6,00 $ en sortie par million de tokens. Le prix effectif d'entrée mesuré par OpenRouter est de 0,74 $. Voici chaque poste de la facture, et par quelle porte il vaut mieux acheter.

Kurnia KharismaKurnia KharismaAug 13, 2026
Tarifs DeepSeek V4 Flash : ce que vous paierez réellement
Trending

Tarifs DeepSeek V4 Flash : ce que vous paierez réellement

DeepSeek V4 Flash affiche $0.14 en entrée et $0.28 en sortie par million de tokens. Des utilisateurs réels ont publié des taux mixtes sous le cent. Voici ce qui décide lequel des deux vous attend.

KiraKiraAug 4, 2026

Prêt à recruter votre collègue IA ?

Configuration en quelques minutes. Pas de carte bancaire requise.

Commencer gratuitement