OpenAI GPT-Realtime-2, Translate, Whisper : la voix devient une commodité à 2 centimes la minute

Le 7 mai 2026, OpenAI a sorti trois modèles d'API vocale qui marquent un point de bascule pour toute l'industrie. Ce n'est plus une démonstration technologique — c'est une infrastructure tarifée, prête pour la production, avec des partenaires comme Deutsche Telekom et Vimeo déjà en intégration. La voix vient de cesser d'être un projet R&D pour devenir un consommable facturable à la minute.

Trois modèles, trois usages distincts

GPT-Realtime-2 : le voice agent de référence

Le modèle remplace l'ancien GPT-Realtime sorti en 2024. Les apports clés :

  • Raisonnement de classe GPT-5 : capable de tenir des conversations agentiques longues, d'enchaîner des appels d'outils et de gérer un état complexe
  • Contexte 128 000 tokens (contre 32 000 avant) : plus besoin de stitching externe pour les conversations longues
  • Latence inférieure à 400 ms sur les requêtes simples

Prix : 32 $ par million de tokens audio en entrée (0,40 $ avec cache hit) et 64 $ par million en sortie. Ramené à la minute : environ 0,18 $ pour une conversation moyennement intense, soit 30 à 40 % moins cher que la génération précédente à qualité équivalente.

GPT-Realtime-Translate : 70 langues d'entrée, 13 de sortie, en temps réel

C'est probablement la sortie la plus impactante des trois. 70 langues acceptées en entrée, 13 langues disponibles en sortie. Tarif : 0,034 $ la minute — soit environ 2 centimes d'euros.

Le modèle ne traduit pas en mode batch (segment par segment) : il maintient une conversation. La traduction colle au rythme du locuteur, gère les interruptions, et conserve la prosodie. Cas d'usage évidents :

  • Support client multilingue où l'agent parle français et le client une autre langue
  • Réunions internationales où chaque participant entend l'audio dans sa langue préférée
  • Streaming de conférences avec sous-titres traduits en direct
  • Voice agents téléphoniques capables de basculer de langue à la volée

GPT-Realtime-Whisper : streaming low-latency

Successeur de la famille Whisper mais optimisée pour le streaming. Latence garantie sous 300 ms. Tarif : 0,017 $ par minute, soit environ 1 centime.

C'est le modèle pour les cas d'usage haute fréquence où la transcription doit être quasi-instantanée : sous-titres live, dictée vocale, capture de réunions, transcription de centres d'appels en temps réel.

Premiers clients : qui a signé et pourquoi

OpenAI a communiqué une liste de partenaires en intégration au lancement, ce qui est rare et significatif :

Pour GPT-Realtime-2 : Zillow (assistant immobilier vocal), Glean (recherche d'entreprise par voix), Intercom (support client conversationnel), Priceline (réservation vocale), Foundation Health (triage médical assisté), Bluejay.

Pour GPT-Realtime-Translate : BolnaAI, Vimeo (sous-titrage multilingue), Deutsche Telekom (support client transfrontalier).

Le profil de ces clients trahit la stratégie OpenAI : viser les use cases à fort volume et fort revenu unitaire — pas le grand public, mais l'entreprise qui peut absorber un coût d'API de quelques centimes par interaction en échange d'une expérience radicalement supérieure.

Pourquoi le contexte 128K change tout pour les voice agents

Le saut de 32 000 à 128 000 tokens en contexte est techniquement spectaculaire mais surtout commercialement décisif. À 32K, un agent vocal devait gérer manuellement sa mémoire — résumer les échanges précédents, recharger des extraits, gérer des fenêtres glissantes. Ce travail de plomberie absorbait facilement 30 % du temps d'ingénierie d'un projet voice.

À 128K, l'agent peut tenir une conversation de plusieurs heures sans perdre le fil. C'est suffisant pour :

  • Un support client complexe qui dure 45 minutes
  • Une session de coaching ou de thérapie
  • Un onboarding produit de 2 heures
  • Une transcription continue d'une journée de réunions

Pour les développeurs, la promesse est claire : moins d'ingénierie de prompt, plus de focus sur l'expérience utilisateur. Le coût d'entrée pour construire un voice agent enterprise vient de baisser drastiquement.

La traduction temps réel à 0,034$/min : ce que ça débloque

Une traduction professionnelle humaine coûte entre 80 et 150 € de l'heure. Une traduction par batch via les anciennes API (segments de 30 secondes, latence 5-10 secondes) coûtait environ 0,10 $/min mais avec une UX dégradée.

GPT-Realtime-Translate à 0,034 $/min en streaming, c'est :

  • 30 fois moins cher qu'une traductrice humaine professionnelle
  • 3 fois moins cher que les API batch précédentes
  • Conversationnel — les interlocuteurs peuvent s'interrompre, se reprendre, sans casser le flux

Les nouveaux usages économiquement viables :

  • Hot-line multilingue 24/7 pour une PME exportatrice
  • Salons commerciaux où le commercial parle français et reçoit l'audio traduit du visiteur
  • Apps de voyage qui traduisent en direct les conversations avec les chauffeurs, hôteliers, commerçants
  • Téléassistance médicale transfrontalière
  • Streaming Twitch/YouTube avec audience internationale

Le coût de 2 centimes la minute est psychologiquement décisif : il rentre dans des budgets que des startups peuvent absorber sans levée de fonds.

Comparaison rapide avec Anthropic Claude Voice et Google Gemini Live

À cette date :

  • Anthropic propose Claude Voice (sur l'app et l'API) avec un raisonnement supérieur mais pas de modèle de traduction temps réel équivalent
  • Google Gemini Live offre la traduction sur 100+ langues mais avec une qualité de conversation inférieure et une latence plus élevée (700-900 ms typiquement)
  • OpenAI se positionne sur le rapport qualité/prix/latence le plus équilibré pour l'usage enterprise

Le marché va probablement converger en 12 mois : Anthropic devrait sortir un modèle de traduction comparable, et Google va devoir améliorer sa latence. Mais à l'instant T, OpenAI prend une longueur d'avance sur le voice enterprise — un segment estimé à 8-12 Md$ en 2026 par Forrester.


FAQ

Quelle est la différence entre GPT-Realtime-Whisper et l'ancien Whisper ?

L'ancien Whisper était un modèle batch — vous lui envoyez un fichier audio complet et il renvoie la transcription. GPT-Realtime-Whisper est conçu pour le streaming : il transcrit en quasi-temps réel à mesure que l'audio arrive, avec une latence sous 300 ms. La qualité de transcription est équivalente, mais l'UX et les cas d'usage sont radicalement différents.

Le français est-il bien supporté par GPT-Realtime-Translate ?

Oui, le français est parmi les 13 langues de sortie supportées, et bien sûr dans les 70 langues d'entrée. Les tests communautaires des premiers jours indiquent une qualité comparable à ce que produirait un traducteur humain non-spécialisé sur des sujets génériques. Pour des domaines techniques (médical, juridique, financier), la spécialisation par fine-tuning sera utile.

Peut-on utiliser ces modèles sur de la téléphonie classique (SIP, RTC) ?

Oui, OpenAI fournit une API WebRTC native et un adaptateur SIP pour intégration avec les PBX et call centers existants. Les partenaires Deutsche Telekom et Intercom utilisent justement cette voie pour leur déploiement.

Quel est l'impact sur les outils de traduction professionnelle type Interprefy ou Wordly ?

Significatif. Ces acteurs proposaient déjà des solutions de traduction live, mais à des prix institutionnels (plusieurs euros la minute, contrats annuels). Avec un prix à 0,034 $/min côté OpenAI, leur proposition de valeur devra évoluer vers des services premium : précision domaine-spécifique, conformité juridique, support humain en escalade. Le segment pur volume va probablement basculer vers les API OpenAI/Google d'ici 12 mois.