Superwhisper découpe sa dictée vocale en trois modèles spécialisés
— AGENTS
Superwhisper sépare la transcription cloud, la reformulation cloud et un petit modèle local qui nettoie et structure le texte sans connexion réseau. Les chiffres de précision viennent tous de tests internes, sur des environnements calmes et anglophones pour l'essentiel.

Dicter un compte-rendu de réunion client ou un brief de campagne prend en général plus de temps à corriger qu'à énoncer. Superwhisper attaque ce problème en éclatant sa dictée en trois briques : une qui écoute, une qui reformule dans le cloud, une qui nettoie en local. Cette dernière, S1-mini, tourne entièrement sur l'ordinateur, sans envoyer un octet sur un serveur.
Pour un directeur artistique ou un chef de projet qui dicte ses notes de réunion entre deux rendez-vous, la promesse est concrète : convertir une énumération parlée en liste, transformer une adresse dictée en adresse électronique propre, corriger une hésitation du type mardi je veux dire jeudi. Le curseur de ton, du message informel à la formulation professionnelle complète, évite la relecture systématique avant d'envoyer un compte-rendu à un client. Restituer une dictée en moins d'une seconde après l'avoir arrêtée, comme l'annonce Superwhisper pour les courts messages, change la manière dont on peut composer un mail entre deux prises de vue sans perdre le fil.
La réserve tient à la nature des chiffres avancés. La précision de 94,8 pour cent et le score de structure à 97,6 pour cent viennent d'une évaluation interne, sur des transcriptions déjà propres, pas de conditions réelles avec accent marqué, bruit de studio ou vocabulaire technique de tournage. Ce que ces modèles savent faire sur une phrase de test bien née ne dit rien de leur tenue sur une réunion de production chaotique enregistrée au téléphone.
La promesse de confidentialité mérite aussi d'être lue précisément. Dès qu'un modèle cloud entre dans la chaîne, l'audio et le texte transitent par les serveurs de Superwhisper ou de ses partenaires, même si l'éditeur affirme ne rien conserver ni réutiliser pour l'entraînement. Pour un studio qui manipule des briefs sous clause de confidentialité, le choix du tout local avec S1-mini associé à un modèle vocal embarqué reste la seule option qui évite ce transit, quitte à perdre en fluidité de reformulation.
Reste la question des poids ouverts annoncés sur Hugging Face, sans lien ni licence précisée au moment de l'annonce. Un studio qui voudrait adapter ce modèle à son propre vocabulaire métier ou l'héberger sur son infrastructure attendra que ces détails se stabilisent avant de s'engager. En l'état, l'outil vaut surtout pour qui dicte déjà ses notes au quotidien et cherche à gagner du temps sur la mise en forme, pas pour qui cherche une brique à retravailler.