Par Arthur Dekeyser
En résumé
Perplexity publie Lily, son moteur local d’inférence derrière Hybrid Compute.
Lily cible Qwen3.6-35B-A3B et nécessite au moins 32 Go de mémoire unifiée.
Lily atteint 4 156 tokens préremplis et 170 tokens décodés par seconde sur un M5 Max.
Le signal : Perplexity publie Lily, qui atteint 4 156 tokens préremplis par seconde sur un M5 Max de 40 cœurs.
Vous appréciez ce genre d'analyse ?
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Gratuit, sans engagement.
+11 000 fondateurs abonnés
Perplexity publie Lily. Perplexity a rendu public Lily, le moteur d’inférence locale utilisé derrière Hybrid Compute. Le projet cible le modèle Qwen3.6-35B-A3B. Lily repose sur un processus unique, avec une couche écrite en Rust. Il fournit aussi une API de conversations compatible avec l’API d’OpenAI. Cette architecture regroupe donc l’exécution du modèle et son interface dans un même moteur. Le code est disponible dans le dépôt pplx-garden sur GitHub. Perplexity présente Lily comme une solution conçue pour les ordinateurs Mac équipés de puces Apple Silicon. Le projet associe ainsi un modèle précis, une implémentation Rust et une interface connue des développeurs utilisant déjà cette API.
La mémoire fixe le seuil. Lily nécessite un Mac Apple Silicon doté d’au moins 32 Go de mémoire unifiée pour offrir des performances réalistes. Le modèle visé est Qwen3.6-35B-A3B, dont le point de contrôle quantifié sur quatre bits occupe 19,4 Go. La taille du fichier constitue donc une donnée centrale pour l’exécution locale. Le modèle est référencé sur Hugging Face. Perplexity ne décrit pas Lily comme un moteur généraliste dans ces éléments. Le projet est explicitement conçu pour Qwen3.6-35B-A3B. Son périmètre matériel est également précis. Il concerne les Mac Apple Silicon disposant d’une mémoire unifiée suffisante.
Le test atteint 4 156. Sur un M5 Max doté de 40 cœurs et de 128 Go de mémoire unifiée, Lily a affiché une moyenne de 4 156 tokens préremplis par seconde. Le même test a enregistré 170,0 tokens décodés par seconde. Ces deux mesures distinguent les phases de préremplissage et de génération. Elles décrivent les performances observées sur cette configuration matérielle précise. Le point de contrôle utilisé pèse 19,4 Go en quatre bits. Les résultats ne portent donc pas seulement sur la taille du modèle. Ils associent un moteur Rust et Metal, un modèle Qwen3.6-35B-A3B, ainsi qu’un Mac M5 Max de 40 cœurs et 128 Go.
Perplexity revendique un écart. Selon Perplexity, Lily atteint 1,23 fois les performances de MLX-LM en préremplissage. Selon la même entreprise, le moteur atteint 1,35 fois celles de MLX-LM en décodage. Ces comparaisons portent sur les deux catégories de débit mesurées. MLX-LM est disponible dans son dépôt GitHub. Perplexity attribue ses gains de préremplissage les plus importants au routage des experts conservé sur le processeur graphique, avec une amélioration annoncée de 89 %. L’entreprise attribue aussi 77,4 % à la fusion de la déquantification dans le calcul matriciel groupé. Ces chiffres sont des résultats revendiqués par Perplexity.
Le décodage dépend du traitement. Perplexity attribue ses gains de décodage à deux optimisations précises. Le conditionnement GQA aurait apporté une amélioration de 23,8 % à 32 000 tokens. L’attention par blocs fixes aurait apporté une amélioration de 40,2 % à 128 000 tokens. Ces résultats sont associés à des longueurs de contexte distinctes. Ils ne constituent pas une moyenne unique pour toutes les utilisations de Lily. Le moteur conserve par ailleurs une architecture à processus unique. Sa couche Rust et son API compatible avec les conversations OpenAI complètent ce fonctionnement. Le projet reste centré sur Qwen3.6-35B-A3B et Apple Silicon.
Le projet reste ciblé. Lily est conçu pour un modèle déterminé et pour une famille matérielle déterminée. Qwen3.6-35B-A3B constitue le modèle visé. Un Mac Apple Silicon avec au moins 32 Go de mémoire unifiée constitue le seuil indiqué pour des performances réalistes. Le point de contrôle en quatre bits pèse 19,4 Go. Sur un M5 Max de 40 cœurs et 128 Go, Perplexity rapporte 4 156 tokens préremplis par seconde et 170,0 tokens décodés par seconde. Le projet est accessible dans le dépôt pplx-garden. Hybrid Compute est présenté sur le site de Perplexity.
Gardez un coup d'avance en IA et tech.
Chaque mardi et vendredi, l'essentiel en business & IA décryptées en 5 minutes. Zéro spam.
+11 000 fondateurs abonnés