Grok Transcribe 2.0 vise la précision, au prix de la vitesse en direct
— AUDIOVISUEL
Le nouveau modèle de transcription de SpaceXAI tombe à 2,7 % d'erreurs en streaming sur un classement indépendant, un niveau qui change la donne pour le sous-titrage de rushes multilingues. La rapidité de réponse recule dans le même mouvement, un arbitrage à connaître avant de le brancher sur un agent vocal en direct.

Une transcription automatique qui rate un numéro de téléphone ou une adresse e-mail oblige à tout réécouter à la main. C'est ce genre de friction, minuscule mais répétée sur des heures de rushes, que Grok Voice Transcribe 2.0 attaque en priorité. Sur le classement indépendant d'Artificial Analysis, le modèle tombe à 2,7 % d'erreurs de transcription en streaming, soit moins de trois mots mal reconnus sur cent.
Ce chiffre parle directement au monteur vidéo ou au motion designer chargé de sous-titrer une interview tournée dans un environnement bruyant, ou de dérusher un tournage multilingue. Atlassian a déjà basculé Loom sur ce modèle, jugé plus fiable que sa solution précédente pour transcrire ses vidéos, avant d'enchaîner sur un montage de code à partir de cette transcription. Le même principe s'applique à un atelier créatif : une note vocale enregistrée sur le tournage, transcrite proprement, devient une base de sous-titrage ou un script de montage exploitable sans repasser par une oreille humaine sur chaque minute.
La gestion du changement de langue en cours d'enregistrement compte tout autant pour des productions tournées avec des équipes ou des intervenants multilingues, un cas fréquent en publicité internationale ou en documentaire de marque. Le modèle suit la bascule sans repasser une seconde fois sur l'audio, ce qui évite une étape de recalage manuel.
La précision affichée a un prix. Artificial Analysis mesure 0,49 seconde avant d'obtenir la transcription finale, contre 0,14 seconde pour ElevenLabs Scribe v2 Realtime. Pour un sous-titrage de post-production, cet écart ne pèse rien. Pour un agent vocal ou une transcription live pendant un tournage, il se ressent immédiatement dans la fluidité de l'échange.
Les chiffres de SpaceXAI eux-mêmes restent internes et mesurés sur ses propres jeux de test, ce qui invite à regarder d'abord le résultat public plutôt que la formule commerciale qui les accompagne. Le tarif, lui, ne bouge pas par rapport à la version précédente, diarisation et horodatage compris.
Pour un studio qui traite des heures de rushes multilingues chaque semaine, ce niveau d'erreur change concrètement le temps de relecture avant livraison. Pour un usage en direct, la latence reste le point à tester avant d'y engager un budget.