Les IA vocales excellent en parlant, échouent à écouter
— AUDIOVISUEL
Le benchmark Real World VoiceEQ de Hume met en lumière un déséquilibre criant : quarante modèles vocaux maîtrisent la synthèse mais s'effondrent face aux bruits de fond et aux accents régionaux. Une asymétrie révélatrice qui expose les failles persistantes de la compréhension orale — là où les utilisateurs attendent justement une robustesse maximale.

Elles articulent, modulent, imitent l'intonation humaine avec un naturel troublant. Comprendre ce qu'on leur dit, c'est une autre affaire. Voilà le constat que dresse Hume avec Real World VoiceEQ, un benchmark qui a passé au crible plus de 40 modèles vocaux, propriétaires comme open source, sur la base de plus de 700 000 évaluations humaines.
Le protocole ratisse large. Quatre terrains d'analyse : reconnaissance vocale, synthèse, speech-to-speech et compréhension du langage parlé. Et une batterie de variables tirées du monde réel — accents, âges, styles d'élocution, émotions, environnements sonores. De quoi extraire les modèles du confort feutré des tests de laboratoire.
Le verdict tombe sans détour. Aucun système ne domine sur tous les fronts ; le secteur se fragmente et chacun se spécialise. Le talon d'Achille, lui, est partout le même. Beaucoup de modèles raisonnent à partir d'une transcription, pas du signal vocal lui-même. Le ton, le rythme, l'hésitation, l'accentuation passent à la trappe.
Les benchmarks classiques flattent ces performances. En conditions réelles, la note dégringole. Accent marqué, bruit ambiant, voix qui se chevauchent, conversation qui s'étire : autant de moments où les modèles décrochent. Le speech-to-speech, quant à lui, reste immature. Comprendre et répondre y demeurent deux compétences dissociées.
Hume en tire une méthode plutôt qu'un classement : l'évaluation humaine reste irremplaçable, à croiser avec des benchmarks publics, des tests privés et un suivi en production. Reste la question que le benchmark laisse ouverte. À quoi sert une machine qui parle mieux qu'elle n'entend ?