ElevenLabs découpe la transcription vocale par métier, la santé en premier
— Business
Scribe v2 Medical réduit de moitié le taux d'erreur sur les dictées cliniques par rapport à la version généraliste. ElevenLabs prouve surtout qu'un modèle vocal se rentabilise mieux en verticale spécialisée qu'en produit unique pour tous les usages.

Un médecin qui dicte un compte-rendu n'a pas le droit à l'approximation. Un dosage mal transcrit, un nom de molécule confondu avec un autre qui sonne pareil, et le brouillon généré devient un risque plutôt qu'un gain de temps. C'est ce problème précis qu'ElevenLabs attaque avec Scribe v2 Medical, une version de son modèle de transcription entraînée spécifiquement sur le vocabulaire clinique.
Le chiffre qui compte ici tient en une comparaison simple : sur des dictées médicales en anglais, français et allemand, le taux d'erreur tombe à 4,9 % contre 7,6 % pour la version généraliste du même modèle. Concrètement, presque deux fois moins de mots à corriger avant qu'un texte parte dans un dossier patient. Le produit reste positionné comme un brouillon à relire, jamais comme un outil d'interprétation médicale, ce qui limite son usage aux structures de santé et aux éditeurs de logiciels du secteur.
Ce sujet ne s'adresse à aucun studio créatif directement. Il dit pourtant quelque chose d'utile sur la manière dont les fournisseurs de voix et de transcription construisent leur offre. Plutôt que de vendre un modèle générique censé tout comprendre, ElevenLabs découpe son catalogue par métier, avec une tarification identique à la version standard et la même API. Cette logique de déclinaison verticale, une fois rodée sur la santé, se retrouve dans d'autres secteurs à vocabulaire technique dense, juridique, industriel, et potentiellement dans les usages audiovisuels où la précision terminologique pèse aussi, sous-titrage de contenus spécialisés ou transcription de tournages techniques.
La limite reste nette sur les mots isolés : un terme médical prononcé seul, sans phrase autour, fait grimper le taux d'erreur à 14,3 %, contre 7,5 % quand il est intégré dans un contexte. Le modèle a besoin de phrases complètes pour bien deviner, une contrainte que la fonction de liste de termes attendus atténue sans l'effacer complètement.
Ce que révèle surtout cette sortie, c'est la maturité d'un marché où la transcription générique ne suffit plus à se différencier. Les fournisseurs de voix vont continuer à trancher leur offre en tranches de métiers, et chaque tranche viendra avec son propre niveau de fiabilité, son propre prix, sa propre documentation de limites. Une reconfiguration à surveiller pour quiconque dépend déjà d'un outil de transcription générique dans sa chaîne de production, car la version spécialisée de demain risque de coûter plus cher que celle d'aujourd'hui.