Sonic 3.6 prend la tête d'un classement de voix IA construit vote après vote
— AUDIOVISUEL
Cartesia revendique la première place d'un classement de synthèse vocale fondé sur 315 000 votes humains recueillis à l'aveugle. Le score reste circonscrit à l'anglais des agents de service client et ne couvre ni la publicité ni le doublage.

Datapoint publie un classement de voix synthétiques bâti sur 315 000 votes humains, recueillis en faisant écouter deux extraits à l'aveugle à chaque fois. Quinze modèles s'affrontent deux par deux sur 300 textes, chaque duel jugé dix fois par des évaluateurs différents. Sonic 3.6 de Cartesia arrive en tête, suivi de Simba 3.2 de Speechify. Le protocole ne demande pas seulement une lecture fidèle du texte, il juge aussi le ton, les pauses et l'adaptation à une situation précise.
Ces situations sont celles d'un centre d'appels, pas d'un plateau de doublage. Remboursements, prises de rendez-vous, salutations de marque, annonces de politique, gestion d'un client mécontent. Quiconque conçoit la voix d'un accueil téléphonique ou d'un serveur vocal de marque trouve ici un outil concret pour arbitrer entre fournisseurs, avec des extraits écoutables et des scores par catégorie plutôt qu'un simple podium marketing. Un producteur audio chargé de choisir une voix pour un standard d'entreprise peut isoler la catégorie qui correspond réellement à son brief, empathie ou lecture transactionnelle, au lieu de suivre le classement général.
Le score reste relatif au groupe évalué. Ajouter ou retirer un concurrent, changer les textes ou les évaluateurs peut déplacer les positions sans qu'aucun modèle n'ait changé. Le jeu de données publié correspond au classement du 1er septembre avec quinze modèles, quand le site affiche déjà un tableau à seize entrées début septembre. Personne ne peut encore reconstituer ce second classement avec les seules données diffusées.
La transparence proposée dépasse largement l'habitude du secteur. Textes, extraits, votes individuels, scores de confiance et séparation entre données d'entraînement et de test sont réunis dans un même ensemble téléchargeable. Ce niveau de détail permet d'auditer une méthode plutôt que de se contenter d'un chiffre affiché sur une page produit.
Le périmètre reste étroit. Tout est en anglais, tout vise le service client, et rien ici ne mesure la latence, la stabilité sur un long échange ou le rendu dans une publicité, un jeu vidéo ou un livre audio. Choisir une voix pour un projet créatif à partir de ce seul podium reviendrait à confondre une préférence mesurée sur des scripts de dépannage avec une qualité universelle. Le bon réflexe consiste à rouvrir le classement par catégorie avant de signer avec un fournisseur.