DeepSeek a officialisé le passage en disponibilité générale (GA) de V4 Pro le 13 août 2026. Annoncé en preview fin avril, le modèle entre en production avec un lot de changements qui intéressent directement les devs : support natif de la Responses API d’OpenAI, intégration Codex en un clic, et une nouvelle grille tarifaire à double régime peak/off-peak.

Ce qui s’est passé

L’annonce, publiée sur la documentation officielle DeepSeek, confirme plusieurs points :

  • V4 Pro est disponible partout : sur l’app et le web via le mode « Expert Mode », et via l’API. Le nom du modèle appelable ne change pas — deepseek-v4-pro (build interne DeepSeek-V4-Pro-0813). Pas de migration de code nécessaire, mais le comportement du modèle derrière l’alias a changé.
  • Le reasoning effort devient réglable : low, high ou max sur V4 Pro et V4 Flash, pour ajuster le compromis qualité/latence/coût selon la tâche.
  • Support natif de la Responses API, avec une configuration officielle pour Codex en un clic. Fini le proxy de traduction Responses-to-Chat-Completions que beaucoup utilisaient.
  • Caractéristiques techniques : contexte de 1M tokens, sortie maximale de 384K tokens, et compatibilité aussi avec le format Anthropic (api.deepseek.com/anthropic).

Côté tarifs, c’est le changement le plus structurant. À partir du 16 août 2026 à 16:00 UTC, DeepSeek passe à une facturation peak/off-peak, avec des tarifs off-peak 50 % moins chers que le peak (heures de peak : 01:00–04:00 et 06:00–10:00 UTC). En off-peak, V4 Pro coûte $0.66 par million de tokens en entrée (cache miss) et $1.98 en sortie ; en peak, $1.32 et $3.96. V4 Flash reste l’option low-cost : $0.22 / $0.66 en off-peak.

Pourquoi c’est important

C’est la première fois que DeepSeek s’aligne nativement sur le standard Responses API au lieu de le bricoler. Pour les équipes qui font tourner des agents ou utilisent Codex, ça supprime une couche d’intégration fragile et stabilise le setup. Le pricing peak/off-peak, lui, est un signal clair : DeepSeek assume des coûts d’infrastructure variables et pousse les workloads déplaçables (batchs, jobs nocturnes) vers les heures creuses — un modèle qu’on voit de plus en plus dans le cloud.

Implications pour les devs et le web

  1. Re-tester ses agents : l’alias deepseek-v4-pro pointe sur un nouveau build. Tool calls, latence et consommation de tokens peuvent différer : à re-valider en staging avant la prod.
  2. Planifier les coûts : batchs, retries, génération de contenu — tout ce qui est élastique peut être schedulé en off-peak pour diviser la facture par deux.
  3. Vérifier la compatibilité réelle de la Responses API : tout n’est pas supporté (pas de file_search, code_interpreter, MCP, ni previous_response_id). Testez ce dont votre agent dépend vraiment, car les paramètres non supportés sont ignorés silencieusement.
  4. Pour les sites web : la génération de contenu (SEO, traductions, descriptions produits) est un candidat parfait au scheduling off-peak. Le delta de prix entre Flash et Pro reste large, donc gardez Flash pour les tâches à fort volume.

Source