Gemma 4 31B pulvérise la latence vocale de GPT-4.1

— AUDIOVISUEL

Google revendique un avantage décisif avec son modèle Gemma 4 31B : un premier son émis en 354 ms seulement sur LiveKit, divisant par cinq la latence vocale de GPT-4.1. Un saut de performance qui redessine les priorités des agents conversationnels en temps réel — la fluidité devient l'arme de différenciation face aux capacités brutes.

Gemma 4 31B pulvérise la latence vocale de GPT-4.1

Sur le papier, GPT-4.1 reste une valeur sûre. En conversation vocale, il accuse le poids de chaque milliseconde. LiveKit a sorti le chronomètre. Verdict contre-intuitif : Gemma 4 31B, le modèle à poids ouverts de Google, boucle la réponse vocale près de cinq fois plus vite.

Les chiffres cadrent le duel. 192 millisecondes avant le premier token, 354 avant le premier son audible, lorsque le modèle tourne sur des GPU co-localisés avec l'infrastructure LiveKit. Passé par OpenRouter, le même Gemma s'effondre à 1 876 millisecondes. La proximité matérielle fait tout. Le débit raconte la même histoire : 158 tokens par seconde en local, contre 33 par l'intermédiaire.

Restait la compétence. Sur tau2bench, qui mesure l'usage agentique d'outils, Gemma 4 31B affiche 76,9 %. LiveKit l'a aussi jeté dans son propre banc d'essai, un agent réceptionniste d'hôtel. Facture de l'opération : environ six fois inférieure à celle de GPT-4.1.

Le reste tient à la plomberie. Le modèle se branche à LiveKit Cloud et à LiveKit Agents, avec rétention de données nulle par défaut et compatibilité avec les briques de reconnaissance et de synthèse vocale de Deepgram ou Cartesia. Le pari assumé — privilégier la latence basse plutôt que le débit maximal, parce qu'une voix qui hésite trahit la machine.

Reste à savoir si la mesure survit hors du terrain de LiveKit. Un benchmark maison qui couronne l'écosystème maison invite à la prudence : combien de ces 192 millisecondes tiennent une fois le modèle débranché de son infrastructure d'origine ?

Sources

Umiros Média