Perplexity code un moteur sur mesure pour faire tourner Qwen sur Mac M5
— AGENTS
Perplexity abandonne les outils génériques d'Apple pour un moteur taillé au millimètre pour un seul modèle et une seule puce. La démonstration tient la route sur les longues réponses, mais l'avance fond dès que l'outil généraliste reçoit une mise à jour.

Perplexity vient de publier Lily, un moteur d'inférence écrit spécifiquement pour faire tourner un modèle Qwen sur les derniers Mac équipés d'une puce M5. Rien de générique ici : chaque ligne de code connaît à l'avance l'architecture du modèle, son format de compression, la taille de ses couches. C'est l'inverse de la philosophie des outils Apple habituels, pensés pour accueillir n'importe quel modèle au prix d'un peu de vitesse en moins.
Ce genre de brique tournera un jour derrière les assistants installés sur les machines des studios, la plupart d'entre eux fonctionnant déjà sous macOS. Le raisonnement de Perplexity vise un usage précis : un assistant qui traite localement les fichiers et les applications de l'ordinateur, pendant qu'un modèle distant gère la recherche et le raisonnement lourd. Sur une conversation longue, où le modèle doit répondre plusieurs fois de suite, le gain de vitesse mesuré tourne autour d'un quart. Concrètement, cela veut dire des réponses qui arrivent nettement plus vite quand l'échange s'étire, un détail qui compte pour qui attend un assistant pendant une session de travail chargée.
La réserve tient dans la fragilité de l'exercice. Une nouvelle version de Qwen, un autre format de poids, une génération de Mac plus ancienne, et tout le travail d'optimisation doit recommencer. L'outil généraliste d'Apple, lui, encaisse le changement de modèle sans drame, quitte à perdre quelques points de vitesse. La mise à jour récente de cet outil a d'ailleurs déjà comblé une partie de l'écart sur le traitement initial des longues instructions, preuve que l'avance d'un moteur sur mesure ne dure jamais très longtemps.
Ce que Perplexity montre surtout, c'est la valeur d'une inférence locale bien pensée sur puce Apple, à un moment où de plus en plus d'outils créatifs cherchent à tourner directement sur la machine plutôt que sur un serveur distant. Le prix et la disponibilité future de ces assistants embarqués se jouent maintenant, dans ce genre de travail d'ingénierie invisible. Le code étant public, d'autres équipes pourront s'en inspirer pour leurs propres modèles, sur leurs propres machines.
Reste à voir combien de temps un moteur taillé pour un seul modèle garde son intérêt face à des outils génériques qui s'améliorent en continu.