Un modèle de 27 milliards de paramètres compressé à 6 Go pour tourner en local

— AGENTS

PrismML fait tenir un modèle de 27 milliards de paramètres dans moins de 6 Go, contre 54 Go en version complète, en limitant l'essentiel des poids à trois valeurs. La compression garde 98,2 % du score moyen d'origine sur les tests choisis par l'entreprise, avec des reculs marqués sur la vision et les connaissances générales.

Un modèle de 27 milliards de paramètres compressé à 6 Go pour tourner en local

Faire tourner un modèle de 27 milliards de paramètres sur un simple ordinateur portable relevait jusqu'ici du bricolage. PrismML annonce y arriver en compressant Bonsai 2, dérivé de Qwen3.8 27B, à moins de 6 Go, contre 54 Go pour la version complète. La technique limite l'essentiel des poids à trois valeurs possibles au lieu de seize bits par valeur, ce qui explique le facteur neuf revendiqué sur la taille du fichier.

Ce travail s'adresse d'abord aux développeurs qui construisent des agents locaux : lecture de documents privés, appels d'outils, connexion à des serveurs MCP, contrôle d'un dépôt de code via Cline. Pour eux, faire tenir un modèle capable de raisonner et de lire des images sur une seule carte graphique change la manière de chiffrer un projet qui doit rester hors ligne, sans dépendre d'une facture d'API qui grimpe avec chaque requête.

La comparaison chiffrée mérite d'être regardée de près. PrismML mesure une conservation de 98,2 % de la performance moyenne de la version complète, mais cette moyenne agrège des tests très différents. Les mathématiques et la programmation résistent bien à la compression, tandis que la compréhension d'images recule nettement, avec un score qui passe de 71,36 à 66,19 sur les évaluations visuelles retenues.

Cette perte compte pour quiconque envisagerait ce modèle sur des tâches où l'image porte l'information utile, lecture de captures d'écran, analyse de documents scannés, description de visuels. La compression choisit ses priorités, et la vision n'en fait pas partie.

Les chiffres de vitesse et de consommation restent produits par PrismML seule, sans reproduction indépendante publiée au moment du lancement. La fenêtre de contexte annoncée à 262 000 tokens demande par ailleurs beaucoup plus de mémoire que les seuls poids du modèle, ce qui limite les promesses faites sur les machines modestes.

Bonsai 2 ne rend pas la puissance locale gratuite, mais il déplace le critère qui compte vraiment : la quantité de capacité conservée par gigaoctet chargé, plutôt que la taille brute du modèle. Pour un studio qui envisagerait un agent tournant sans connexion, la question à poser dès demain n'est plus la taille du fichier, mais la liste précise des tâches où cette compression tient encore la route.

Sources

Umiros Média