En mai 2026, DeepSeek rendait permanente une remise de 75 % sur son modèle phare V4-Pro : 0,87 $ le million de tokens en sortie, environ 28 fois moins cher que Claude Opus. Cette page de l’histoire est tournée. Le 17 août 2026, une nouvelle grille a fait grimper les tarifs — jusqu’à +1 100 % sur les tokens en cache. Aujourd’hui, l’écart avec Claude Opus 5 est de 6,3 à 12,6 fois, et il dépend de l’heure à laquelle vous appelez l’API. Voici la grille à jour, ce que ça change pour votre budget, et comment recalculer votre coût réel.
Ce qui s’est passé : la bascule
Cet article a d’abord raconté une baisse. Il faut maintenant raconter l’inverse, parce que les faits ont changé deux fois en trois mois.
| Date | Événement |
|---|---|
| 22-23 mai 2026 | DeepSeek annonce que la remise de 75 % sur V4-Pro devient permanente ; elle devait expirer le 31 mai. Le tarif de sortie est alors de 0,87 $ le million de tokens [5]. |
| 24 juillet 2026 | Fin des alias deepseek-chat et deepseek-reasoner, qui étaient routés vers V4-Flash pendant la période de transition [2]. |
| 13 août 2026 | Publication de V4-Pro-0813 : 1,6 billion de paramètres, 1 M de tokens de contexte, 384 K de sortie, licence MIT [3]. |
| 17 août 2026 | Entrée en vigueur de la nouvelle grille tarifaire, en forte hausse par rapport à la précédente [2]. |
| 23 août 2026 | Les week-ends basculent intégralement au tarif hors pointe [1]. |
Le mouvement est net. Par rapport à la grille précédente, les nouveaux tarifs vont jusqu’à +200 % sur l’entrée, +350 % sur la sortie et +1 100 % sur les tokens en cache. C’est l’inverse exact du récit de « guerre des prix » auquel DeepSeek avait habitué le marché.
La grille tarifaire de V4-Pro aujourd’hui
Voici les tarifs officiels, en dollars par million de tokens [1]. La grille est la même pour les deux modèles, mais DeepSeek facture deux niveaux selon l’heure :
| Modèle | Cache hit | Entrée | Sortie |
|---|---|---|---|
deepseek-v4-pro — hors pointe | 0,022 $ | 0,66 $ | 1,98 $ |
deepseek-v4-pro — pointe | 0,044 $ | 1,32 $ | 3,96 $ |
deepseek-flash — hors pointe | 0,003 $ | 0,15 $ | 0,60 $ |
deepseek-flash — pointe | 0,006 $ | 0,30 $ | 1,20 $ |
Pointe ou hors pointe : la question qui décide du budget
La pointe couvre 01h00-04h00 et 06h00-10h00 UTC, du lundi au vendredi, hors jours fériés chinois. Tout le reste est hors pointe, à moitié prix [1].
Deux conséquences pratiques. D’abord, le hors pointe n’est pas un tarif nocturne marginal : il couvre la majorité des heures de la semaine et l’intégralité des week-ends depuis le 23 août 2026. Ensuite, la pointe tombe en pleine journée de travail européenne — 01h00-04h00 UTC correspond à 03h00-06h00 à Paris en heure d’été, et 06h00-10h00 UTC à 08h00-12h00. Autrement dit, un traitement lancé le matin depuis l’Europe est facturé au tarif double.
Décaler un traitement planifié de quelques heures peut donc diviser une facture par deux, sans changer une ligne de code.
Contexte et sortie maximale
V4-Pro-0813 accepte jusqu’à 1 million de tokens de contexte et produit jusqu’à 384 000 tokens en sortie [1] [3] [4]. Une réserve qui compte : le modèle ne prend pas la vision en charge [1]. Si votre chaîne traite des images, V4-Pro n’est pas un remplacement direct.
Ce que coûte un volume type
Prenons un cas simple : 100 millions de tokens de sortie par mois.
| Période | Tarif de sortie | Coût mensuel |
|---|---|---|
| Mai 2026 | 0,87 $ / M | 87 $ |
| Aujourd’hui, hors pointe | 1,98 $ / M | 198 $ |
| Aujourd’hui, en pointe | 3,96 $ / M | 396 $ |
Le même volume est donc passé de 87 $ à 198 $ ou 396 $ selon l’heure de traitement : 2,3 à 4,5 fois plus cher [1] [5].
Comment calculer votre coût réel
La première version de cet article raisonnait en « tokens de sortie × tarif ». C’est trop optimiste. Quatre postes entrent dans la facture :
- L’entrée. Elle est facturée séparément et représente souvent l’essentiel du volume : prompts système, documents envoyés, historique de conversation.
- Le cache. Un prompt déjà vu est facturé au tarif « cache hit » : 0,022 $ contre 0,66 $ hors pointe, soit trente fois moins. C’est le premier levier d’optimisation, même après la hausse.
- Les tokens de raisonnement. Le raisonnement est réglable (none, low, high, max) et activé sur
highpar défaut. Les traces renvoyées par le modèle font partie de l’échange, et en usage agentique avec outils, elles doivent être renvoyées dans les appels suivants — donc repayées en entrée [3]. - La plage horaire. Un même traitement coûte le double entre 06h00 et 10h00 UTC en semaine.
Une mise en garde utile : la grille officielle ne documente que deux modulations, le cache et la plage horaire [1]. Ne budgétez pas sur une remise batch qui n’y figure pas — vérifiez-la avant de l’inscrire dans un prévisionnel.
Le comparatif qui a changé
L’ancien chiffre phare — « 28 fois moins cher » — ne tient plus. Voici les écarts réels sur les tokens de sortie, là où se concentre l’essentiel du coût en production :
| Modèle | Entrée ($ / M) | Sortie ($ / M) | × plus cher que V4-Pro hors pointe | × plus cher qu’en pointe |
|---|---|---|---|---|
| DeepSeek V4-Pro, hors pointe | 0,66 $ | 1,98 $ | — | — |
| DeepSeek V4-Pro, en pointe | 1,32 $ | 3,96 $ | ×2 | — |
| Claude Opus 5 [6] [7] | 5 $ | 25 $ | ×12,6 | ×6,3 |
| Claude Fable 5 [6] | 10 $ | 50 $ | ×25 | ×12,6 |
| GPT-5.5 [8] | 5 $ | 30 $ | ×15,2 | ×7,6 |
Face à Claude Opus 5, V4-Pro est donc environ 6,3 fois moins cher en pointe et 12,6 fois hors pointe. Face à Fable 5 (10 $ / 50 $), l’écart va de 12,6 à 25 fois [6]. L’avantage reste considérable — il n’est simplement plus d’un ordre de grandeur.
Deux corrections de chiffres au passage. GPT-5.5 n’est pas à 10 $ le million de tokens en sortie mais à 5 $ l’entrée et 30 $ la sortie [8]. Et le cache à 0,003625 $, autrefois présenté comme « le prix le plus bas du marché », n’est plus le tarif de V4-Pro : il est aujourd’hui à 0,022 $ hors pointe. C’est le modèle deepseek-flash qui porte le tarif le plus bas, à 0,003 $ [1].
Pourquoi cette hausse
La lecture économique la plus simple est celle de la fin d’un subventionnement. DeepSeek a expliqué au printemps 2026 que le prix de la version Pro resterait élevé tant que les supernœuds Huawei Ascend 950 ne seraient pas livrés en volume, attendus au second semestre 2026. La remise permanente de mai pouvait se lire comme un pari sur cette échéance ; la grille d’août se lit comme un retour à l’équilibre en attendant.
Autre élément de contexte : la baisse des prix se poursuit au niveau du marché, mais plus chez DeepSeek. Le 24 juillet 2026, Anthropic a lancé Claude Opus 5 à 5 $ / 25 $, soit la moitié du tarif de Fable 5 [6] [7]. Le 30 juillet 2026, OpenAI a baissé les prix de sa gamme Luna de 80 %, et de 20 % sur Terra [9]. DeepSeek a été l’un des premiers à casser les prix ; il est aujourd’hui le premier à les remonter.
Conformité et souveraineté : le point qui ne change pas
La question des prix a bougé, celle de la conformité non. Fin janvier 2025, le Garante italien — l’autorité de protection des données personnelles — a bloqué DeepSeek sur le fondement de l’article 58(2)(f) du RGPD. Parmi les motifs retenus : le stockage de données d’utilisateurs sur des serveurs situés en République populaire de Chine.
DeepSeek a contesté l’applicabilité du RGPD en soutenant ne pas opérer en Italie. L’argument a été rejeté au titre de l’article 3(2)(a) : le fait de cibler des personnes situées dans l’Union suffit à faire entrer le service dans le champ du règlement.
Concrètement : pour des données clients, des données de santé ou tout ce qui relève d’un secteur réglementé, l’hébergement hors Union européenne reste un obstacle majeur, indépendamment du prix. Le tarif bas de mai 2026 ne l’avait pas levé ; la hausse d’août 2026 ne le change pas davantage.
Faut-il changer de modèle ?
Les cas où la migration vaut encore le coup
- Volumes importants de tâches répétitives et standardisées — résumé, traduction, classification, réponses FAQ — planifiées hors pointe.
- Coût API déjà significatif dans le budget.
- Données non confidentielles et sans contrainte de localisation.
- Prompts système longs et réutilisés : le cache reste trente fois moins cher que l’entrée.
- Traitements décalables : l’écart entre pointe et hors pointe est de 100 %.
Les cas où il vaut mieux rester sur Claude ou GPT
- Données clients sensibles ou soumises au RGPD.
- Secteur réglementé : santé, finance, juridique.
- Traitements qui ne peuvent pas être décalés et tournent en heures de pointe.
- Chaînes multimodales : V4-Pro ne prend pas la vision en charge.
- Exigence de qualité sur du raisonnement complexe.
La stratégie hybride
La vraie question n’est pas « DeepSeek ou Claude ? » mais « quelle tâche, pour quel modèle, à quelle heure ? ».
Une architecture raisonnable pour un indépendant en 2026 :
- Volume, faible risque, décalable → DeepSeek V4-Pro hors pointe.
- Tâches critiques, nuancées, ou données sensibles → Claude Opus 5 ou GPT-5.5, selon le budget.
- Volume très élevé et tâches simples →
deepseek-flash, à 0,003 $ le cache hit et 0,60 $ la sortie hors pointe.
Cette approche évite aussi de dépendre d’un seul fournisseur — une leçon que la suspension de Claude Fable 5 a rappelée brutalement.
Comment tester sans tout casser
Trois étapes, inchangées.
Étape 1 — Isolez une tâche à faible risque. Répétitive, standardisée, et dont une erreur occasionnelle n’a pas de conséquence grave : résumé d’articles, classification d’emails, traduction de contenus marketing.
Étape 2 — Testez en parallèle sur 50 à 100 exemples réels. Même prompt, mêmes entrées, sur votre modèle habituel et sur V4-Pro. Comparez les sorties à l’aveugle.
Étape 3 — Migrez uniquement si la qualité est équivalente. Gardez votre modèle actuel pour tout le reste, puis élargissez progressivement.
Ajoutez une quatrième étape devenue indispensable : mesurez le coût réel sur le volume testé, en relevant les tokens d’entrée, la part de cache et l’heure d’exécution. C’est le seul moyen de savoir si la hausse d’août annule l’économie attendue.
Le point sur les alias legacy
Les alias deepseek-chat et deepseek-reasoner ont bien été retirés le 24 juillet 2026 [2]. Pendant la période de grâce, ils étaient routés vers V4-Flash et non vers V4-Pro : qui ne l’avait pas vu a subi une perte de qualité silencieuse. Le réflexe à garder : appeler explicitement deepseek-v4-pro ou deepseek-flash, et ne jamais laisser un alias décider du modèle à votre place.
Ce que cela signifie pour le marché
La leçon de cet épisode n’est pas que DeepSeek serait devenu cher : il reste 6 à 12 fois moins cher qu’Opus 5. La leçon est qu’un prix d’appel n’est pas un prix durable.
Un tarif lancé comme une « guerre des prix » peut devenir permanent, puis être révisé de +350 % en trois mois. Bâtir un budget sur l’hypothèse que le prix le plus bas restera le plus bas est une erreur de méthode : le tarif d’un modèle est une décision commerciale de votre fournisseur, pas une propriété acquise du marché.
Pour les indépendants et créateurs qui construisent des agents IA, cela renforce un principe simple : ne jamais traiter votre choix de modèle comme une décision définitive. Abstraction, test de parité, et un budget qui prévoit une hausse plutôt qu’une baisse.
Pour aller plus loin
Si vous voulez d’abord voir comment je travaille, mon parcours est ici.
Questions fréquentes
Pourquoi le prix de DeepSeek V4-Pro a-t-il augmenté en août 2026 ?
Le 17 août 2026, DeepSeek a remplacé sa grille par une nouvelle, nettement plus élevée : jusqu’à +200 % sur l’entrée, +350 % sur la sortie et +1 100 % sur les tokens en cache. La hausse coïncide avec la publication de V4-Pro-0813, le 13 août, et se lit comme la fin progressive du subventionnement qui avait rendu la remise de 75 % permanente en mai 2026.
DeepSeek V4-Pro est-il encore moins cher que Claude ou GPT ?
Oui, mais plus dans les mêmes proportions. Face à Claude Opus 5 (5 $ / 25 $ le million de tokens), V4-Pro à 1,98 $ la sortie hors pointe est environ 12,6 fois moins cher, et 6,3 fois moins cher en heures de pointe (3,96 $). L’ancien chiffre de 28 fois, calculé sur la grille de mai 2026, n’est plus valable.
Qu’est-ce que la tarification pointe / hors pointe de DeepSeek ?
DeepSeek facture deux grilles selon l’heure d’appel. Les heures de pointe sont 01h00-04h00 et 06h00-10h00 UTC, du lundi au vendredi, hors jours fériés chinois. Tout le reste — dont l’intégralité des week-ends depuis le 23 août 2026 — est hors pointe, à moitié prix. Concrètement, la pointe correspond au créneau 08h00-12h00 à Paris en heure d’été.
Que sont devenus les alias deepseek-chat et deepseek-reasoner ?
Ils ont été retirés le 24 juillet 2026. Pendant la période de transition annoncée trois mois plus tôt, ces deux noms ne pointaient pas vers V4-Pro mais vers V4-Flash, en modes sans et avec raisonnement. Un appel resté sur l’alias a donc continué de fonctionner en changeant silencieusement de modèle. Appelez explicitement deepseek-v4-pro ou deepseek-flash.
Comment calculer le coût réel d’un usage de V4-Pro en volume ?
Quatre postes comptent : les tokens d’entrée, le taux de cache hit, les tokens de raisonnement (activés sur high par défaut, renvoyés dans les appels suivants en usage agentique) et la plage horaire. Un calcul réduit aux seuls tokens de sortie sous-estime la facture. La grille officielle ne documente que le cache et la pointe comme modulations : ne budgétez pas sur une remise batch non vérifiée.
Peut-on utiliser DeepSeek avec des données clients sensibles ?
C’est le point qui n’a pas changé. Fin janvier 2025, le Garante italien a bloqué DeepSeek sur le fondement de l’article 58(2)(f) du RGPD, en retenant notamment le stockage de données d’utilisateurs sur des serveurs situés en Chine. DeepSeek a contesté l’applicabilité du RGPD ; l’argument a été rejeté au titre de l’article 3(2)(a). Pour des données sensibles ou un secteur réglementé, l’hébergement hors Union européenne reste un obstacle.
Sources
- Models & Pricing — DeepSeek API DocsDeepSeek
Grille officielle à jour : pour deepseek-v4-pro, 0,022 $ / 0,66 $ / 1,98 $ par million de tokens hors pointe (cache hit, entrée, sortie) et 0,044 $ / 1,32 $ / 3,96 $ en pointe. Fixe les heures de pointe (01h00-04h00 et 06h00-10h00 UTC, du lundi au vendredi), le contexte de 1 M de tokens, la sortie maximale de 384 K, l’absence de prise en charge de la vision et les tarifs de deepseek-flash.
- Change Log — DeepSeek API DocsDeepSeek
Journal officiel des changements d’API : annonce de la nouvelle grille tarifaire avec bascule pointe / hors pointe au 16 août 2026 à 16h00 UTC (00h00 heure de Pékin le 17 août), et retrait des alias deepseek-chat et deepseek-reasoner au 24 juillet 2026, routés vers V4-Flash pendant la période de transition.
- DeepSeek-V4-Pro Gets RefreshedDeepLearning.AI — The Batch
Analyse indépendante de V4-Pro-0813 : 1,6 billion de paramètres (49 milliards actifs par token), 1 M de tokens d’entrée et 384 K de sortie, licence MIT, raisonnement réglable et activé sur high par défaut. Confirme que les prix ont augmenté et rappelle les heures de pointe en UTC ainsi que le tarif de pointe (1,32 $ / 0,044 $ / 3,96 $).
- DeepSeek V4 Pro 0813 — OpenRouterOpenRouter
Corroboration tierce de l’existence et de la version du modèle V4-Pro-0813 : l’offre opérée par DeepSeek y est listée à 0,66 $ l’entrée, 1,98 $ la sortie et 0,022 $ le cache read par million de tokens, cohérente avec la page de prix officielle.
- DeepSeek permanently reduces the price of its flagship V4 model by 75 percentEngadget
Article du 23 mai 2026 établissant que la remise de 75 % sur V4-Pro, qui devait expirer le 31 mai, est devenue permanente, avec un tarif alors compris entre 0,003625 $ et 0,87 $ par million de tokens (contre 0,0145 $ à 3,48 $ auparavant). Sert de point de comparaison pour mesurer la hausse d’août 2026.
- Pricing — Claude APIAnthropic
Grille tarifaire officielle : Claude Fable 5 et Fable 5.1 à 10 $ l’entrée et 50 $ la sortie par million de tokens, Claude Opus 5 à 5 $ / 25 $, Claude Sonnet 5 à 2 $ / 10 $. Base du calcul des écarts de prix avec V4-Pro.
- Anthropic launches Claude Opus 5, a cheaper AI model for coding agents and enterprise workflowsVentureBeat
Couverture du lancement de Claude Opus 5, positionné à 5 $ l’entrée et 25 $ la sortie par million de tokens, soit la moitié du tarif de Fable 5 — illustration que la baisse des prix se poursuit chez les concurrents de DeepSeek.
- Models — OpenAI API documentationOpenAI
Catalogue officiel des modèles. La fiche GPT-5.5 accessible depuis cette page donne 5 $ l’entrée, 0,50 $ le cache et 30 $ la sortie par million de tokens : le chiffre de 10 $/M cité dans la première version de l’article ne correspond à aucune grille officielle.
- Changelog — OpenAI API documentationOpenAI
Journal officiel : à partir du 30 juillet 2026, GPT-5.6 Luna coûte 80 % de moins et GPT-5.6 Terra 20 % de moins. Documente la poursuite de la baisse des prix côté américain au moment où DeepSeek augmentait les siens.
Chiffres et affirmations vérifiés sur ces sources le .



