Liquid AI accélère ses modèles vision-langage sans toucher à leurs réponses
— AGENTS
Un petit modèle de 280 millions de paramètres anticipe les mots que produira LFM2.5-VL, qui vérifie ensuite le tout en un seul passage. Le texte sort identique, mais arrive jusqu'à trois fois plus vite sur un MacBook équipé d'une puce récente.

Faire tourner un modèle qui lit des images coûte cher en temps de calcul, surtout quand la réponse s'allonge. Liquid AI ajoute un second modèle, minuscule à côté du premier, chargé de deviner plusieurs mots à l'avance. Le modèle principal contrôle ensuite ce paquet de mots en une seule opération plutôt que mot par mot. La réponse finale ne change pas d'une virgule, seule la vitesse pour l'obtenir progresse.
Cette brique ne s'adresse pas à un graphiste ou un motion designer devant une interface. Elle concerne les équipes techniques qui déploient des modèles capables de décrire, lire ou analyser des images sur un ordinateur local ou sur un serveur, via des outils comme llama.cpp ou SGLang. Sur un MacBook Pro équipé d'une puce M5 Max, le décodage va jusqu'à 3,13 fois plus vite selon la tâche traitée.
Ce gain se limite à la partie où le modèle produit du texte mot par mot. Avant d'écrire quoi que ce soit, l'image doit d'abord être analysée par un module séparé, une étape que ce système d'accélération ne touche pas. Une tâche qui passe beaucoup de temps à examiner l'image avant de répondre profite donc moins de cette accélération qu'une tâche qui génère une longue réponse.
Ce type de mécanique tourne aujourd'hui derrière des modèles techniques publiés en accès libre, mais elle finit par irriguer les outils grand public qui embarquent de la lecture d'image, du sous-titrage automatique ou de l'extraction de texte dans une photo. Elle pèse directement sur la vitesse et le coût de ces fonctions au moment où un éditeur de logiciel choisit d'en intégrer une nouvelle version.
L'efficacité réelle dépend d'un détail simple à retenir pour qui suit ces annonces sans les décortiquer : plus le petit modèle devine juste, plus le gain se confirme, et plus on augmente la variété des réponses possibles, plus cette anticipation se dégrade. La promesse d'une vitesse multipliée par trois reste donc une moyenne haute, pas une garantie universelle sur toutes les tâches visuelles.