Faire tourner une IA locale avec Lemonade SDK 10.5

Lemonade SDK est un serveur d’IA locale open source, développé avec le soutien d’AMD, qui permet d’exécuter des modèles de langage (LLM), de la génération d’image et de la synthèse vocale directement sur votre machine, sans passer par le cloud. La version 10.5, publiée en mai 2026, ajoute le support de ROCm 7.13, fait passer macOS en disponibilité générale (GA), et améliore la gestion des modèles personnalisés. Elle expose une API compatible OpenAI, ce qui permet de brancher Lemonade sur la plupart des outils existants sans réécrire de code.

Lemonade SDK évolue très rapidement, avec des versions publiées presque chaque semaine. 

Depuis la 10.5, plusieurs mises à jour sont déjà sorties (jusqu’à la version 11.0). Cet article se concentre sur la version 10.5, une étape clé du projet, tout en signalant les évolutions les plus récentes lorsque c’est pertinent.

Qu’est-ce que Lemonade SDK ?

Lemonade SDK est un projet open source sponsorisé par AMD, disponible sur GitHub, qui vise à simplifier l’exécution de modèles d’intelligence artificielle en local. Contrairement à une API cloud classique, Lemonade tourne entièrement sur votre propre matériel : ordinateur portable, poste de travail, ou serveur privé.

Youtube video

Le projet ne se limite pas au texte. Il prend en charge la génération de texte, la génération d’image, la transcription vocale (speech-to-text) et la synthèse vocale (text-to-speech), au sein d’un seul et même serveur. Cette approche multimodale unifiée le distingue de nombreux outils concurrents, qui nécessitent souvent plusieurs services séparés pour couvrir les mêmes fonctionnalités.

Techniquement, Lemonade repose sur un cœur écrit en C++, ce qui lui permet de s’installer rapidement sur Windows, Linux, macOS et Docker. Il détecte automatiquement le matériel disponible, puis sélectionne le meilleur moteur d’exécution : llama.cpp pour les modèles GGUF, un backend dédié pour les modèles ONNX, ou encore un moteur optimisé pour les NPU AMD.

Pourquoi faire tourner une IA en local plutôt que dans le cloud ?

Le recours à une IA locale répond à plusieurs besoins que le cloud ne couvre pas toujours efficacement. Le premier est la confidentialité des données : aucune information ne quitte la machine, ce qui est particulièrement important pour les documents sensibles, les données médicales ou les projets sous contrainte réglementaire stricte.

Le deuxième avantage concerne le coût et la latence. Une fois le matériel amorti, l’inférence locale ne génère aucun frais d’API récurrent, et la réponse ne dépend plus de la disponibilité ou de la surcharge d’un serveur distant. Enfin, l’IA locale permet un contrôle total sur les modèles utilisés : choix précis des versions, personnalisation fine, et absence de dépendance à un fournisseur unique.

Lemonade SDK 10.5 répond directement à ces besoins en exploitant au mieux le matériel AMD (NPU et GPU), tout en restant accessible sur d’autres plateformes via des backends alternatifs comme Vulkan ou Metal.

Les nouveautés de la version 10.5

La version 10.5 de Lemonade SDK, sortie en mai 2026, marque une étape importante dans la maturité du projet. Voici les évolutions principales :

  • Mise à jour vers ROCm 7.13 pour les moteurs llama.cpp et stable-diffusion.cpp, avec un gain de compatibilité sur le matériel AMD récent, dont les nouveaux accélérateurs Instinct MI350P.
  • macOS passe de bêta à disponibilité générale (GA) : le support d’Apple Silicon, via le backend Metal de llama.cpp, est désormais considéré comme stable et complet.
  • Gestion des modèles personnalisés améliorée : l’import et l’organisation des modèles GGUF ou ONNX récupérés depuis Hugging Face sont simplifiés.
  • Alignement sur une version récente de llama.cpp en amont, garantissant un accès plus rapide aux dernières optimisations de la communauté open source.
  • Dépréciation d’anciens composants : l’installeur lemonade-server-minimal.msi et l’ancienne CLI lemonade-server sont marqués comme obsolètes, en prévision de leur suppression dans une version future.

Ces changements s’inscrivent dans un rythme de développement particulièrement soutenu : Lemonade est passé de sa version 10.0 (mars 2026, premier support NPU fonctionnel sous Linux) à sa version 10.5 en seulement deux mois, avant de continuer son évolution vers les versions 10.6 et suivantes.

Quel matériel est nécessaire pour Lemonade SDK 10.5 ?

Lemonade SDK 10.5 s’adapte à plusieurs configurations matérielles, avec des performances qui varient sensiblement selon le processeur utilisé :

Configuration matérielleBackend utiliséCas d’usage recommandé
Ryzen AI 300/400 (NPU + iGPU)Ryzen AI SW + Vulkan/ROCmAssistant IA en tâche de fond, faible consommation
Ryzen AI Max+ 395 « Strix Halo » (128 Go RAM unifiée)Ryzen AI SW + ROCmModèles denses volumineux (70B et plus)
Radeon RX 7800/9070 ou supérieurROCm ou VulkanCodage assisté par IA, débit élevé
Mac Apple Silicon (M2/M3/M4)Metal (llama.cpp)Usage général, désormais en disponibilité générale
CPU x86_64 génériqueCPUCompatibilité de secours, performances limitées

Le cas le plus impressionnant reste la plateforme Ryzen AI Max+ 395, dont la mémoire unifiée de 128 Go permet de faire tourner des modèles denses de très grande taille entièrement en mémoire, un scénario généralement réservé aux GPU professionnels haut de gamme.

Comment fonctionne l’exécution hybride NPU + GPU ?

L’une des innovations les plus notables de Lemonade concerne l’exécution hybride entre le NPU et le GPU sur les processeurs Ryzen AI 300 et 400. Le NPU XDNA 2, présent sur ces puces, délivre environ 50 TOPS de calcul dédié à l’IA, une ressource longtemps sous-exploitée pour l’inférence de LLM avant l’arrivée de Lemonade.

Concrètement, Lemonade répartit le travail entre les deux unités de calcul : le NPU traite la phase de lecture du prompt (prompt processing), tandis que le GPU intégré prend en charge la génération token par token (décodage). Cette répartition exploite les forces respectives de chaque composant : le NPU est efficace sur les opérations massivement parallèles à faible consommation, le GPU excelle sur le débit de génération.

Selon les données communiquées par AMD, cette approche hybride permettrait d’obtenir un temps jusqu’au premier token environ 2,3 fois plus rapide qu’une exécution GPU seule, et un débit de décodage jusqu’à 2,4 fois supérieur à une exécution NPU seule. Le bénéfice principal pour l’utilisateur final se traduit surtout par une autonomie de batterie nettement meilleure sur les ordinateurs portables, l’IA locale tournant en arrière-plan sans solliciter excessivement le GPU.

Installer Lemonade SDK 10.5 : les grandes étapes

L’installation de Lemonade SDK 10.5 varie légèrement selon le système d’exploitation, mais suit globalement la même logique :

  1. Télécharger l’installeur adapté à votre plateforme (exécutable Windows, paquet .pkg pour macOS, ou image Docker/Snap/Arch pour Linux) depuis le dépôt GitHub officiel du projet.
  2. Lancer l’installation : Lemonade détecte automatiquement le matériel disponible et configure le backend le plus adapté (ROCm, Vulkan, Metal ou CPU).
  3. Démarrer le serveur Lemonade, qui expose une API compatible OpenAI sur une adresse locale, généralement de la forme http://localhost:13305/v1.
  4. Télécharger un modèle via le gestionnaire de modèles intégré, ou importer un modèle GGUF/ONNX personnalisé depuis Hugging Face.
  5. Connecter votre application à Lemonade en remplaçant simplement l’URL de l’API cloud habituelle par l’adresse locale du serveur Lemonade.

Pour les développeurs qui souhaitent intégrer Lemonade directement dans leur propre logiciel, le projet propose également une version « Embeddable » : un binaire portable, sans installeur, sans branding et sans télémétrie, pensé pour être distribué au sein d’une application tierce.

Youtube video

Lemonade SDK 10.5 face à Ollama : quelles différences ?

Ollama reste aujourd’hui l’outil de référence pour l’exécution locale de LLM, avec une base d’utilisateurs bien plus large et une expérience volontairement simplifiée. Lemonade se positionne différemment, avec une approche plus orientée matériel et intégration technique.

CritèreLemonade SDK 10.5Ollama
Support NPU AMD dédiéOui, natifNon
Modalités supportéesTexte, image, audio, TTSPrincipalement texte (extensions possibles)
Facilité de prise en mainBonne, orientée développeursTrès simple, orientée grand public
Écosystème et adoptionEn forte croissanceTrès large, standard de facto
Intégration MCP (agents)Support natif précoceSupport via extensions tierces
Portabilité matérielleOptimisé AMD, compatible Metal/CPUUniverselle (CPU, NVIDIA, AMD, Apple)

En résumé, Ollama reste le choix le plus simple pour un usage généraliste, en particulier sur du matériel NVIDIA ou pour les utilisateurs qui veulent une prise en main immédiate. Lemonade SDK 10.5 devient particulièrement pertinent sur du matériel AMD Ryzen AI, où il exploite des capacités matérielles (le NPU) qu’Ollama ne peut pas solliciter.

Avec quels outils Lemonade SDK 10.5 s’intègre-t-il ?

Grâce à son API compatible OpenAI, Lemonade SDK 10.5 s’intègre directement dans un grand nombre d’outils déjà utilisés par les développeurs et les équipes techniques, sans nécessiter de développement spécifique. Il suffit généralement de remplacer l’URL de base de l’API cloud par l’adresse locale du serveur Lemonade.

Parmi les intégrations les plus courantes, on retrouve les extensions d’assistance au code comme GitHub Copilot dans VS Code, les plateformes d’automatisation comme n8n, ainsi que des interfaces web dédiées comme Open WebUI. Le projet est également compatible avec des frameworks d’orchestration IA plus avancés, tels que LangChain ou LlamaIndex, souvent utilisés pour construire des applications de type RAG (recherche augmentée par génération).

Cette compatibilité étendue s’explique par un choix de conception assumé : plutôt que d’imposer un écosystème fermé, Lemonade mise sur les standards déjà adoptés par la communauté, notamment le format d’API popularisé par OpenAI. Cette approche réduit considérablement la barrière à l’entrée pour les équipes qui souhaitent migrer tout ou partie de leurs workflows d’IA vers une infrastructure locale, sans réécrire leurs applications existantes.

Sécurité, gains d’autonomie et limites à connaître

Si l’IA locale via Lemonade SDK 10.5 apporte des bénéfices réels en confidentialité et en coût, elle comporte aussi certaines limites à anticiper. La puissance de calcul disponible localement reste inférieure à celle des grappes de GPU utilisées par les fournisseurs cloud, ce qui se traduit par des modèles généralement plus petits, et donc moins performants sur les tâches de raisonnement complexe.

Gestion modèles IA Lemonade SDK

Par ailleurs, la maintenance du serveur, la gestion des mises à jour et le choix des modèles adaptés à chaque matériel demandent un minimum de compétence technique, contrairement à une API cloud clé en main. C’est un compromis assumé : plus de contrôle et de confidentialité, en échange d’une charge opérationnelle plus élevée côté utilisateur.

Quels cas d’usage concrets avec Lemonade SDK 10.5 ?

Plusieurs scénarios d’usage tirent particulièrement parti des capacités de Lemonade SDK 10.5 :

  • Assistant de codage local, intégré à un IDE comme VS Code, sans envoyer le code source vers un service cloud tiers.
  • Automatisation de workflows via des outils comme n8n, avec un LLM local pour traiter des tâches répétitives sans coût d’API récurrent.
  • Chatbot embarqué sur PC portable, fonctionnant en arrière-plan grâce à l’exécution hybride NPU + GPU, sans épuiser la batterie.
  • Pipeline documentaire complet combinant transcription audio, analyse de texte et réponse vocale, le tout géré par un seul serveur Lemonade plutôt que par plusieurs services séparés.
  • Intégration dans une application tierce, grâce à la version Embeddable, pour proposer une fonctionnalité d’IA locale sans dépendre d’un fournisseur cloud.

FAQ — Lemonade SDK 10.5 et l’IA locale

Lemonade SDK 10.5 fonctionne-t-il uniquement sur du matériel AMD ? 

Non. Lemonade fonctionne aussi sur les processeurs Apple Silicon via le backend Metal (support passé en disponibilité générale avec la version 10.5), ainsi que sur CPU générique en dernier recours. En revanche, les fonctionnalités les plus avancées, comme l’exécution hybride NPU + GPU, restent réservées aux processeurs Ryzen AI d’AMD.

Faut-il payer pour utiliser Lemonade SDK ? 

Non, Lemonade est un projet open source et gratuit, distribué sous licence Apache-2.0. Les seuls coûts concernent le matériel nécessaire pour exécuter les modèles localement, contrairement à une API cloud facturée à l’usage.

Lemonade SDK 10.5 peut-il remplacer complètement une API cloud comme celle d’OpenAI ou d’Anthropic ? 

Cela dépend du cas d’usage. Pour des tâches sensibles en confidentialité, ou pour réduire les coûts récurrents, Lemonade constitue une alternative crédible. En revanche, les modèles exécutés localement restent généralement moins puissants que les modèles d’élite disponibles dans le cloud, notamment sur le raisonnement complexe. De nombreuses entreprises combinent d’ailleurs les deux approches au sein d’une architecture de fallback, avec un modèle local en première intention et un modèle cloud en secours pour les tâches les plus exigeantes.

Restez à la pointe de l'information avec
INTELLIGENCE-ARTIFICIELLE.COM !

Abonnez-vous à notre chaîne YouTube et rejoignez-nous sur Actualités

ARTICLES SIMILAIRES

Listnr AI : générateur vocal réaliste et multilingue

Aujourd’hui, Listnr AI s’impose comme l’un des générateurs de voix les plus complets du marché. Découvrez notre test approfondi et notre comparatif des meilleurs générateurs

18 juillet 2026

Inkling IA : le chatbot 100% gratuit qui va bouleverser votre quotidien

Et si l’intelligence artificielle la plus avancée devenait enfin un droit pour tous, et non un privilège ? Avec l’arrivée du modèle Inkling et les

18 juillet 2026

Avis Open Spoken AI : le générateur de contenu non censuré

Notre avis Open Spoken AI révèle une générateur de texte IA sans filtre conçue pour les créateurs audacieux. Elle repose sur trois outils spécialisés couvrant

18 juillet 2026

Mubert IA: créez de la musique libre de droits grâce à l’IA en 2026

Mubert IA révolutionne la production sonore grâce à un modèle hybride unique. Découvrez notre test complet de ce générateur de musique IA de référence en

18 juillet 2026

Rytr Me : notre avis sur cette plateforme de génération de texteRytr

Rytr Me : notre avis sur cette plateforme de génération de texteRytr

Rytr Me, un assistant IA d’appoint abordable propulse vos contenus courts et vos campagnes de webmarketing. L’écriture automatisée transforme la production de contenus et redéfinit

18 juillet 2026

Leap AI avis : décryptage complet de l’outil de détection et d’humanisation en 2026

Leap AI bouscule les codes de l’édition numérique en proposant une double approche technique. Cette suite logicielle intègre un module de détection gratuit associé à

15 juillet 2026