Qwen-Audio-3.0-TTS : la voix IA apprend enfin la ponctuation émotionnelle
— AUDIOVISUEL
Alibaba détaille son nouveau modèle vocal, piloté par balises expressives et consignes en langage naturel, avec clonage tolérant aux références bruitées. Je pense que ces 86 balises changent vraiment la manière de diriger une voix synthétique, même si je reste prudent sur le rendu réel en français.

Quatre-vingt-six balises glissées dans le texte pour déclencher un soupir, une hésitation, une colère qui monte : je pense que c'est la première fois qu'un TTS propose un vocabulaire de direction d'acteur aussi fin, plutôt qu'un simple curseur d'émotion. Pour un monteur son qui doit livrer une voix-off publicitaire un vendredi soir avec trois retours client dans la journée, ça change la nature du travail : on ne règle plus un paramètre abstrait, on écrit une didascalie dans le texte lui-même, [angry] ici, [whispers] là, et la machine tient la tonalité jusqu'à la balise suivante.
Ce qui me frappe surtout, c'est le clonage tolérant aux références dégradées. Dans la vraie vie, un client n'envoie jamais un enregistrement studio propre : c'est une note vocale prise dans une salle de réunion, un extrait YouTube compressé, un souvenir de voix d'archive. Si le débruitage est vraiment intégré au trajet de clonage sans abîmer le timbre, ça évite l'étape de nettoyage audio qui plombait jusqu'ici tout projet de voix de marque reconstituée à partir de matière pauvre.
Je reste prudent sur un point : les chiffres de performance viennent des mesures du laboratoire lui-même, même adossées à un classement tiers. Un taux d'erreur qui gagne en labo ne dit rien du naturel perçu par une oreille française sur un texte technique de packaging ou un script d'animation produit. Je testerais d'abord sur une voix française avec accent régional avant de la mettre dans un livrable client, parce que la promesse des seize langues masque toujours des écarts de qualité selon la langue réellement travaillée au quotidien.
La latence de 300 ms sur la version Flash m'intéresse pour un tout autre usage : le prototypage vocal en réunion créative, où l'on veut entendre un timbre en direct pendant qu'on discute encore du script. C'est peut-être là, plus que dans la livraison finale, que ce modèle rendra service en premier à un motion designer pressé.
Je verrais bien un premier test grandeur nature sur un doublage de démo produit multilingue avant tout engagement en production.