Que acheter pour exécuter un LLM localement en septembre 2026

L'essor des LLM open source : vers une intelligence artificielle plus démocratique et durable

Le choix du matériel pour exécuter des modèles de langage en local a considérablement évolué depuis le printemps. La RTX 5090 continue d’offrir une bande passante immense en une seule GPU, mais son prix en Espagne a atteint plus de 5 000 euros. Parallèlement, les configurations avec 128 Go de mémoire unifiée se sont multipliées : DGX Spark est à 4 800 euros, le Mac Studio M5 Max atteint 128 Go, et le M5 Ultra grimpe jusqu’à 512 Go, tandis qu’AMD et Lenovo élargissent l’offre de mini-PC prêts pour de grands modèles.

Les clés du matériel pour LLM locaux en 30 secondes

  • La RTX 5090 conserve 32 Go GDDR7 et un débit de 1 792 Go/s, mais les modèles disponibles en Espagne débutent à partir d’environ 5 299 euros.
  • DGX Spark propose 128 Go de mémoire unifiée et CUDA pour 4 800 euros.
  • Le Mac Studio M5 Max atteint 128 Go et 614 Go/s ; le M5 Ultra offre 512 Go et 1,2 To/s.
  • AMD dispose déjà de systèmes Ryzen AI Max+ 395 avec 128 Go et prépare des plateformes allant jusqu’à 192 Go.
  • Lenovo lancera en novembre le ThinkCentre X Ultra avec jusqu’à 128 Go, au prix prévu à partir de 3 100 euros.
  • Pour des entraînements importants, le B200 en cloud peut être trouvé à partir d’environ 4,7 euros par heure auprès de certains fournisseurs européens.

Le changement le plus significatif par rapport au guide d’avril ne concerne pas uniquement les processeurs. La mémoire est devenue le composant qui influence le plus le prix de l’IA en local. La pénurie de mémoire haute performance a augmenté le coût des GPU à grande capacité ainsi que de certains systèmes à mémoire unifiée, modifiant ainsi les équilibres qui, il y a quelques mois, favorisaient certaines configurations.

De plus, le logiciel a progressé. Unsloth supporte désormais l’exécution et l’entraînement de modèles sous macOS, Windows et Linux, avec NVIDIA, AMD et d’autres backends, tandis qu’AMD a amélioré le support de ROCm pour Ryzen AI Max+ et que Apple continue d’étendre MLX pour l’entraînement et la distribution entre plusieurs machines.

Tableau d’achat pour septembre 2026

Les prix indiqués sont des références observées en Europe et en Espagne durant septembre 2026. Concernant les cartes graphiques, notamment NVIDIA, la différence entre le prix conseillé et le prix réel peut être considérable.

Équipement Mémoire Débit approximatif Prix indicatif en euros Focus
RTX 5090 32 GB GDDR7 1 792 Go/s à partir d’environ 5 299 € Vitesse maximale pour les modèles adaptés
Framework Desktop Max+ 395 128 GB LPDDR5X-8000 environ 3 889 € Capacité x86
GMKtec EVO-X3 Max+ 395 128 GB LPDDR5X-8000 3 499,99 € Mini-PC haute capacité
DGX Spark 128 GB 273 Go/s 4 800 € CUDA + mémoire unifiée
Mac Studio M5 Max 128 GB jusqu’à 614 Go/s 5 859 € Inférence + MLX
Mac Studio M5 Ultra 256 GB 1,2 To/s 10 999 € Modèles très grands
Lenovo ThinkCentre X Ultra jusqu’à 128 GB LPDDR5X-8533 à partir de 3 100 € prévu Nouvelle plateforme AMD
RTX PRO 6000 Blackwell 96 GB GDDR7 ECC 1 792 Go/s environ 13 000 € ou plus CUDA professionnel
B200 en cloud 180-192 GB HBM jusqu’à 8 To/s à partir d’environ 4,7 €/h Entraînement et grands modèles

La RTX 5090 demeure le cas extrême. NVIDIA maintient 32 GB de GDDR7 et un débit de 1 792 Go/s, mais les modèles espagnols trouvés via Idealo débutent à 5 299 euros, avec de nombreuses variantes dépassant 5 400 euros et certaines dépassant largement les 7 000 euros.

L’écart entre le prix officiel et le prix réel est si important qu’il n’a plus de sens d’utiliser la fiche recommandée de la carte comme référence pour estimer le coût d’une station de travail. Au prix de la carte, il faut ajouter le processeur, la carte mère, la mémoire système, le stockage, l’alimentation et le refroidissement.

En revanche, DGX Spark se vend comme un système complet. NVIDIA fixe son prix européen à 4 800 euros, avec 128 Go de mémoire unifiée, 4 To de NVMe et la super puce GB10 Grace Blackwell.

Jusqu’à 30 milliards de paramètres : la RTX 5090 reste pertinente

La première règle du guide d’avril demeure valable : si le modèle tient confortablement dans la mémoire GPU, le débit est crucial.

Avec 32 Go et 1 792 Go/s, la RTX 5090 permet d’exécuter des modèles quantifiés de taille moyenne à une vitesse que des systèmes à mémoire unifiée plus lente ne peuvent égaler. NVIDIA confirme aussi 21 760 cœurs CUDA et une puissance graphique totale de 575 W.

Pour des modèles densément parametrés de 20 000 à 30 000 milliards de paramètres, notamment en quantification 4 bits, une 5090 reste une solution très rapide. Le problème apparaît lorsque le modèle, le cache KV et le contexte commencent à approcher les 32 Go disponibles.

Les modèles « Mixture of Experts » (MoE) compliquent encore la comparaison. Un modèle peut avoir des dizaines ou centaines de milliards de paramètres, mais n’activer qu’une partie lors de chaque token. Un gros modèle MoE peut donc être plus viable sur une machine de 32 Go qu’un modèle dense beaucoup plus petit.

Il ne s’agit pas seulement de si les poids tiennent. Il faut aussi réserver de la mémoire pour le contexte, le cache KV, l’exécution et les opérations temporaires.

Avec les prix actuels, cependant, la RTX 5090 présente un problème économique. Acheter une carte à plus de 5 000 euros puis bâtir un ordinateur autour peut faire monter le coût total bien au-delà d’une machine complète avec 128 Go de mémoire.

128 Go : le segment qui a le plus changé

Les systèmes AMD Ryzen AI Max+ 395 ont transformé les 128 Go de mémoire unifiée en une option nettement plus abordable.

Framework propose une version Desktop avec Ryzen AI Max+ 395 et 128 GB de LPDDR5X-8000. La plateforme peut réserver jusqu’à 96 GB pour la GPU, selon la configuration mémoire graphique, et fonctionne sous Windows ou Linux.

Le prix de référence européen pour cette configuration de 128 Go tourne autour de 3 889 euros, d’après la documentation commerciale d’août, bien que le prix final dépende du stockage et de la configuration choisie.

On trouve aussi des configurations comme le GMKtec EVO-X3, avec Ryzen AI Max+ 395, 128 GB de LPDDR5X, 4 To de stockage, à 3 499,99 euros en boutique en Espagne.

AMD a aussi étendu sa plateforme. Le nouveau Ryzen AI Max+ PRO 495, basé sur Gorgon Halo, supporte jusqu’à 192 GB de LPDDR5X-8533 et utilise une Radeon 8065S avec 40 unités de calcul. AMD indique une performance NPU jusqu’à 55 TOPS et des configurations de mémoire plus importantes que celles des Ryzen AI Max+ 395 actuels.

Cela ouvre une nouvelle catégorie intermédiaire : de mini-PC capables de charger des modèles de plus de 100 milliards de paramètres, sans nécessiter plusieurs GPU.

AMD a même publié un guide pour exécuter des modèles allant jusqu’à un billion de paramètres répartis entre systèmes Ryzen AI Max+ utilisant llama.cpp et des connexions entre machines. Il s’agit d’une démonstration de capacités, non d’une promesse d’expérience interactive avec un tel modèle.

DGX Spark : 128 Go et CUDA en bureau

DGX Spark occupe une position différente.

Son avantage est d’offrir 128 GB de mémoire unifiée associée à l’écosystème CUDA. NVIDIA précise un débit de 273 Go/s, 128 GB de mémoire cohérente, 1 PFLOP de performance en FP4, et 4 To de stockage NVMe dans le système commercialisé actuellement.

Il ne peut pas rivaliser avec les 1 792 Go/s de la RTX 5090, elles ne doivent donc pas être considérées comme une « RTX 5090 de 128 GB ».

Son attrait réside ailleurs : pour des modèles qui ne tiennent pas dans une GPU classique mais doivent rester au sein de l’écosystème NVIDIA.

Le support pour l’entraînement s’est aussi amélioré. NVIDIA maintient de la documentation spécifique pour utiliser Unsloth sur DGX Spark, incluant CUDA, PyTorch et outils de fine-tuning.

Le prix actuel de 4 800 euros rend la comparaison avec un Mac Studio M5 Max particulièrement pertinente.

Apple M5 Max : la mémoire unifiée n’est plus synonyme de faible vitesse

Apple a bouleversé la donne avec le nouveau Mac Studio.

Le M5 Max peut être configuré avec jusqu’à 512 GB de mémoire unifiée. Dans la version GPU de 40 cœurs, il atteint 614 Go/s de bande passante, tandis que le modèle de base se limite à 460 Go/s.

La configuration de 128 GB avec 512 GB de SSD coûte 5 859 euros selon la grille européenne publiée après lancement.

Ce positionne le M5 Max dans une situation particulière : il est nettement plus cher qu’un mini-PC Ryzen AI Max+ 128 GB, mais offre plus du double de bande passante que le DGX Spark, voire le Double par rapport au Strix Halo.

Pour ceux qui travaillent principalement avec MLX, llama.cpp, et outils adaptés à Apple Silicon, cette différence peut compter. Apple développe aussi des capacités pour répartir l’entraînement via MLX entre plusieurs machines. Lors de la WWDC26, Apple a montré un entraînement de Qwen 3.5, 9 milliards de paramètres, qui est passé d’environ 180 tokens/sec sur un seul ordinateur à environ 600 tokens/sec sur un cluster.

Cela ne transforme pas un cluster Mac en un substitut direct à un système NVIDIA pour tous les usages, mais prouve que le modèle de mémoire unifiée peut s’étendre au-delà d’un seul ordinateur.

M5 Ultra : 256 Go à 10 999 euros, 512 GB en octobre

Le M5 Ultra est la configuration qui change réellement la limite de mémoire.

Apple propose jusqu’à 512 GB de mémoire unifiée et 1,2 To/s de bande passante. La configuration de 256 GB coûte actuellement 10 999 euros en Europe. La version 512 GB sera disponible fin octobre.

La version 256 GB permet déjà d’aborder des modèles totalement hors de portée d’une RTX 5090 de 32 GB ou d’un système de 128 GB.

La bande passante de 1,2 To/s est également cruciale. Le M5 Ultra n’atteint pas la vitesse mémoire de la 5090, mais s’en rapproche beaucoup plus que le Strix Halo ou DGX Spark, tout en offrant une capacité mémoire huit fois supérieure à celle d’une GPU NVIDIA.

Pour des modèles quantifiés de grande taille, cette combinaison change la question de « la capacité » à « quelle vitesse obtenir une fois que tout tient. »

Lenovo entre dans la course des 128 GB

Une nouveauté absente du guide d’avril est Lenovo.

La société a présenté le ThinkCentre X Ultra, un mini-PC de 1,6 litre basé sur Ryzen AI Max+ PRO 495. Il peut embarquer jusqu’à 128 GB de LPDDR5X-8533 et allouer jusqu’à 96 GB à la Radeon 8065S intégrée. Lenovo prépare aussi des configurations permettant de connecter jusqu’à quatre unités pour augmenter mémoire et capacité de calcul.

Sa sortie est prévue pour novembre 2026, avec un prix initial estimé à environ 3 100 euros. Il faut noter que ce prix est celui annoncé par Lenovo et ne garantit pas que la configuration de 128 GB sera nécessairement à ce tarif.

La plateforme supporte aussi Windows et Linux, avec deux emplacements M.2 pour le stockage. Cela montre que les 128 GB de mémoire partagée ne sont plus une exclusivité d’Apple ou de machines très spécialisées.

RTX PRO 6000 : 96 GB de VRAM, mais un prix élevé

Pour ceux qui ont besoin de CUDA et d’une grande mémoire sans passer par un serveur, la RTX PRO 6000 Blackwell Workstation Edition reste une option.

Elle dispose de 96 GB de GDDR7 ECC et 1 792 Go/s, exactement le même débit que la RTX 5090, mais avec trois fois plus de mémoire. NVIDIA la destine aux stations de travail professionnelles et charges de travail IA.

Le problème, c’est le prix. En août, NVIDIA a porté son prix aux États-Unis à 16 000 dollars, et en Europe, on a vu des prix proches de 13 000 euros, voire plus chez certains distributeurs.

À ce niveau, il ne s’agit plus d’une GPU grand public. C’est un investissement pour station de travail, justifié lorsque 96 GB de mémoire et CUDA sont des exigences permanentes.

Pour une entreprise devant fournir des modèles à plusieurs utilisateurs en continu, la mémoire supplémentaire peut justifier cette dépense. Mais pour un développeur individuel exécutant des modèles occasionnellement, l’investissement est complètement différent.

Entraînement : une réponse différente ici

La grande nouveauté par rapport au guide d’avril est l’expansion du logiciel local.

Unsloth supporte désormais macOS, Windows et Linux, et affirme compatibilité avec NVIDIA, AMD, Intel, CPU et Vulkan, en plus du support pour LoRA, QLoRA, SFT, RL, GRPO et DPO.

Cela ne veut pas dire que toutes les plates-formes offrent le même rendement ni que toutes les méthodes fonctionnent aussi bien dans chaque environnement. CUDA reste particulièrement dominant pour l’entraînement et la recherche.

Mais Apple Silicon ne doit plus être considéré uniquement comme une plateforme d’inférence. MLX permet LoRA et QLoRA, et Apple montre des exemples de formation répartie entre plusieurs appareils.

AMD s’est aussi renforcé. ROCm propose une documentation spécifique pour llama.cpp, et AMD publie des outils pour exécuter des modèles sur Ryzen AI Max+ avec ROCm.

Pour le SFT de modèles petits et moyens, une RTX 5090 reste une option très performante et compatible. Mais pour des modèles dépassant largement sa mémoire, la capacité devient le vrai problème, pas la puissance de calcul.

Et pour de grands entraînements, le cloud continue d’offrir un avantage économique très fort.

B200 : quand arrêter d’acheter du hardware

Le B200 possède entre 180 et 192 GB de mémoire HBM3e selon la plateforme, avec un débit avoisinant les 8 To/s. C’est une catégorie totalement différente des machines de bureau.

En septembre 2026, on trouve des instances B200 à partir d’environ 4,7 euros par GPU par heure chez certains fournisseurs européens, d’autres proposant autour de 5,4 à 6 euros. Les prix fluctuent selon le fournisseur, la région, la disponibilité et la formule.

Il existe aussi des configurations B200 beaucoup plus coûteuses en Europe. Par exemple, CoreWeave propose une instance HGX avec huit B200 à environ 59,93 euros par heure en Espagne, avec une option spot à environ 30 euros pour le nœud à huit GPU.

La différence avec l’achat d’une station de travail à plusieurs milliers d’euros est claire : le cloud permet de payer uniquement pour le temps d’entraînement ou d’inférence.

Une tâche de quatre heures avec une B200 à 5 euros de l’heure coûte environ 20 euros. Le même hardware fonctionnant 24 heures par jour pendant un mois dépasse 3 600 euros. La stratégie la plus rationnelle consiste donc souvent à préparer localement les données, le code et les paramètres, puis à utiliser la GPU cloud quand la taille du travail l’impose.

Tableau pratique pour choisir en 2026

Besoin Matériel adapté Prix approximatif
Modèles jusqu’à ~30B avec vitesse maximale RTX 5090 à partir de 5 299 €
70B avec budget limité Ryzen AI Max+ 395, 128 GB 3 500-3 900 €
70B+ avec CUDA DGX Spark, 128 GB 4 800 €
70B avec plus d’espace mémoire Mac Studio M5 Max, 128 GB 5 859 €
Plus de 100B M5 Max 128 GB / M5 Ultra 256 GB à partir de 5 859 €
200B et plus M5 Ultra 256/512 GB à partir de 10 999 €
Pro avec CUDA RTX PRO 6000, 96 GB environ 13 000 € ou plus
Entraînement massif ou modèles gigantesques B200 en cloud à partir de ~4,7 €/h

La conclusion principale de cette mise à jour est qu’il n’existe plus une seule machine adaptée à tous les LLM locaux.

La RTX 5090 reste la référence pour un débit élevé quand le modèle tient dans 32 GB, mais son prix en Espagne a complexifié la décision d’achat. Les systèmes Ryzen AI Max+ 395 offrent beaucoup de mémoire pour un coût inférieur, avec moins de bande passante. DGX Spark ajoute CUDA à cette équation. Le M5 Max combine 128 GB et 614 Go/s, le M5 Ultra offre 512 GB et 1,2 To/s.

Par ailleurs, AMD et Lenovo proposent des configurations entre 128 et 192 GB plus compactes et économiques, et le logiciel réduit aussi les différences entre plateformes qu’il y a quelques mois.

La décision doit partir du modèle visé, de sa quantification, de la taille du contexte, et si l’on privilégie l’entraînement ou l’inférence. Il faut d’abord estimer la mémoire nécessaire, puis l’espace passif en bande passante, avant de comparer les prix.

Pour un modèle qui tient dans 32 GB, dépenser pour 128 GB peut revenir à payer pour une capacité inutilisée. Pour un modèle de 120 milliards de paramètres, une RTX 5090 dépasse tout simplement en mémoire, même si elle est beaucoup plus rapide.

Et lorsque le travail exige 180 GB, plusieurs GPU ou un entraînement distribué, la question n’est plus « quel ordinateur acheter » mais surtout : « durant combien d’heures une machine de centre de données est-elle nécessaire. »

Foire aux questions

Quelle est la GPU la plus rapide pour exécuter des LLM en local ?

La RTX 5090 offre 1 792 Go/s avec 32 Go de GDDR7, ce qui la rend particulièrement adaptée aux modèles qui tiennent entièrement dans sa mémoire.

Quel ordinateur offre le plus de mémoire pour l’IA locale ?

Le Mac Studio M5 Ultra peut aller jusqu’à 512 GB de mémoire unifiée et 1,2 To/s de bande passante. La version 256 GB coûte environ 10 999 euros, la version 512 GB sortira fin octobre.

Combien coûte un DGX Spark en Europe ?

NVIDIA le commercialise actuellement à 4 800 euros, avec 128 GB de mémoire unifiée et 4 To de stockage NVMe.

Faut-il encore utiliser NVIDIA pour l’entraînement des modèles ?

Pas nécessairement. En septembre 2026, des outils permettent d’entraîner sur Apple Silicon via MLX ou avec un support pour AMD, en complément d’Unsloth multiplateforme. Cependant, CUDA conserve un écosystème très vaste pour l’entraînement et certaines techniques spécifiques.

le dernier