Le marché des modèles d’intelligence artificielle téléchargeables a assez mûri pour que de nombreuses entreprises n’aient plus à dépendre systématiquement d’une API propriétaire. En juillet 2026, il existe des options capables de tourner sur un ordinateur portable, une seule GPU professionnelle ou un cluster complet. Mais le choix ne devrait pas se faire sur le seul critère du modèle en tête du dernier classement partagé sur les réseaux sociaux.
Les clés des modèles d’IA ouverts
- De nombreux modèles dits ouverts publient leurs poids, mais pas les données ni l’ensemble du processus d’entraînement.
- Des licences comme Apache 2.0 ou MIT facilitent généralement leur usage commercial.
- Un modèle plus petit peut offrir un meilleur rapport coût, vitesse et stabilité.
- La décision doit reposer sur des tests internes, le matériel disponible, la confidentialité et la licence.
Les poids se téléchargent gratuitement, mais l’inférence, elle, ne l’est pas. Faire tourner un modèle demande de la mémoire, du calcul, du stockage, de l’électricité, du personnel technique et un système capable de servir plusieurs utilisateurs sans dégrader la réponse. La finalité compte tout autant : un assistant interne pour consulter de la documentation n’a pas besoin du même modèle qu’un agent chargé de modifier des dépôts de code, d’interpréter des images ou de résoudre des problèmes mathématiques. Prendre systématiquement le modèle le plus volumineux ne fait souvent que déplacer le coût de l’API vers le centre de données, sans gain proportionnel, un constat proche de celui déjà fait quand le modèle seul ne crée pas de valeur en entreprise.
Ouvert ne signifie pas toujours code source ouvert
L’expression « modèle open source » est parfois employée un peu vite. Dans beaucoup de cas, le fabricant permet de télécharger les paramètres entraînés, d’exécuter et d’adapter le modèle, sans publier les données d’entraînement, le code complet, les critères de filtrage ni les points de contrôle intermédiaires.
L’Open Source Initiative considère qu’un système d’IA ouvert doit permettre de l’utiliser, de l’étudier, de le modifier et de le partager, ce qui suppose des informations suffisantes sur les données, le code d’entraînement et d’exécution, et les paramètres finaux. Selon cette définition, beaucoup de modèles populaires sont en réalité des modèles à poids ouverts, pas des projets open source complets. La nuance compte : une entreprise peut télécharger un modèle et l’utiliser commercialement en toute légalité sans pouvoir reproduire son entraînement, ce qui suffit pour certains projets mais n’offre pas le même niveau de transparence qu’une publication intégrale.
OLMo 3, développé par l’Allen Institute for AI, va le plus loin dans cette direction : poids, jeux de données, outils de nettoyage, code d’entraînement, évaluations et artefacts des différentes phases sont tous publics. Sa famille compte des variantes à 7 et 32 milliards de paramètres, pour un usage général, la conversation et le raisonnement.
Il faut vérifier la licence avant d’intégrer un modèle dans un produit. Apache 2.0 et MIT permettent généralement d’utiliser, modifier et distribuer le logiciel avec peu de restrictions, en précisant clairement attribution et brevets. Les licences propriétaires, elles, peuvent imposer des limites géographiques, des conditions pour les grandes plateformes ou des restrictions sur l’entraînement de modèles concurrents. Et même au sein d’une même famille, les conditions varient d’une version à l’autre : il ne suffit pas de savoir que « Qwen est ouvert » ou que « Mistral publie ses modèles », il faut lire la licence précise de la version utilisée.
Des modèles adaptés à chaque niveau de matériel
Le haut du marché est dominé par des architectures à mélange d’experts (MoE), qui comptent des centaines de milliards de paramètres mais n’en activent qu’une fraction pour traiter chaque jeton. Cela réduit le calcul par rapport à un modèle dense de même taille, sans simplifier automatiquement le déploiement ni réduire le stockage des poids.
GLM-5.2, de Z.ai, compte parmi les propositions les plus ambitieuses sous licence MIT, avec une fenêtre de contexte d’un million de jetons ciblée sur la programmation, les agents et les tâches longues, dans la lignée de sa montée en puissance face aux agents de code de Databricks. Cette capacité permet d’intégrer de vastes dépôts ou collections documentaires, même si utiliser toute la fenêtre ne garantit pas que le modèle exploite parfaitement chaque information. DeepSeek-V3.2 garde une position forte en raisonnement et en usage d’outils, avec des poids publiés sous licence MIT et un mécanisme d’attention dispersée pensé pour réduire le coût des contextes longs. Avec 685 milliards de paramètres, il reste loin d’une configuration domestique et tourne généralement sur une infrastructure spécialisée ou via un fournisseur.
Mistral Large 3 active environ 41 milliards de paramètres sur 675 milliards au total. Distribué sous Apache 2.0 avec des formats compressés disponibles, il reste recommandé sur des systèmes Blackwell ou des nœuds à huit GPU A100 ou H100, pas sur n’importe quel serveur inutilisé. OpenAI propose de son côté gpt-oss-120b et gpt-oss-20b sous Apache 2.0 : le premier tourne sur une GPU de 80 Go, le second peut se contenter de 16 Go grâce à sa quantification MXFP4, ce qui le rend plus accessible aux stations de travail haut de gamme.
Qwen3.6-35B-A3B se positionne en taille intermédiaire : environ 35 milliards de paramètres, dont une fraction seulement activée par jeton, avec un support texte et image. Distribué par Alibaba sous Apache 2.0, il offre une alternative multimodale sans exiger la puissance des modèles à plusieurs centaines de milliards de paramètres. Google a conçu Gemma 4 pour couvrir tout le spectre, des appareils mobiles aux ordinateurs personnels, avec des variantes E2B et E4B axées sur l’efficacité et des modèles de 12, 26 et 31 milliards pour le raisonnement et le multimodal, plus des versions optimisées par entraînement quantifié pour réduire la consommation mémoire.
Microsoft maintient sa famille Phi pour les scénarios où le volume et l’exécution locale priment sur la performance brute : Phi-4-mini tient en 3,8 milliards de paramètres, gagne en multilinguisme et gère les appels de fonctions, sous licence MIT, pour des applications locales et des appareils sans connexion constante au cloud. Mistral propose aussi Ministral 3 en 3, 8 et 14 milliards de paramètres, avec compréhension d’images et variantes instruct ou raisonnement, toutes sous Apache 2.0, pour des stations de travail ou des systèmes périphériques où un modèle géant ne serait pas rentable, un enjeu de rentabilité que travaille aussi Rebellions avec le rachat de SqueezeBits pour optimiser l’inférence.
Ce spectre montre qu’il n’existe plus un seul modèle ouvert à recommander pour tout. Les petits modèles offrent moins de latence, gèrent plus d’utilisateurs par GPU et se mettent à jour plus facilement. Les grands apportent plus de capacité pour les tâches complexes, mais demandent des investissements en infrastructure, en parallélisation et en systèmes d’inférence spécialisés.
Comment choisir sans transformer le coût en surcharge
Tout commence par un test concret. Une équipe qui veut résumer des contrats doit préparer des documents représentatifs, des questions courantes et des réponses validées par des experts. Pour la programmation, il faut des dépôts réels, des cas concrets, des tests automatisés et des tâches qui exigent de comprendre plusieurs fichiers à la fois. Les benchmarks publiés par les fabricants servent de première sélection, mais ne remplacent pas l’évaluation maison : un modèle peut exceller sur SWE-bench et rester faible pour suivre les conventions d’un code spécifique, tout comme un autre peut briller en anglais et perdre en précision en français ou sur du vocabulaire juridique.
L’évaluation doit couvrir la qualité, la latence, le nombre de tokens par seconde, la mémoire utilisée, le coût par requête et le pourcentage de réponses à corriger, sans oublier la capacité à suivre des instructions, la stabilité du format JSON, l’usage d’outils et la tendance à inventer des réponses. La longueur du contexte mérite aussi un test dédié : charger un million de tokens est techniquement possible, mais parfois lent, coûteux ou peu précis, ce qui pousse beaucoup d’applications vers un système RAG qui ne sélectionne que les fragments pertinents avant de solliciter le modèle.
La quantification permet de réduire la taille des poids via des formats moins précis : un modèle de 20 ou 30 milliards de paramètres peut ainsi tourner sur une GPU grand public, mais au prix d’une qualité parfois moindre en raisonnement, en mathématiques ou en génération structurée. Chaque version quantifiée mérite d’être testée comme un modèle à part entière. La confidentialité locale n’est pas non plus automatique : héberger les poids sur un serveur propre évite d’envoyer des requêtes au fournisseur, mais l’application, l’environnement ou les extensions de télémétrie peuvent continuer à transmettre des données ailleurs. Il faut examiner toute la chaîne, pas seulement le modèle.
Pour expérimenter sur un ordinateur personnel, Ollama ou LM Studio facilitent le démarrage. Sur serveur, vLLM ou SGLang offrent des interfaces compatibles API, la gestion de lots et une meilleure utilisation des GPU. Quand le volume est irrégulier, une API hébergée reste souvent plus économique que plusieurs GPU allumées en permanence ; l’hébergement en propre se justifie surtout quand la charge est constante, la confidentialité prioritaire, ou que la taille du projet permet d’amortir le matériel. Dans tous les cas, mieux vaut découpler l’application de la technologie d’inférence via des interfaces stables, pour pouvoir tester de nouvelles versions ou changer de modèle sans tout reconstruire.
L’opportunité de 2026 ne consiste pas à télécharger le plus gros modèle disponible, mais à savoir choisir entre familles ouvertes, héberger là où c’est pertinent, et changer dès qu’une autre solution offre une meilleure qualité ou un coût moindre. Cette liberté ne génère des économies que si elle s’accompagne de tests internes, d’une vérification des licences et d’une estimation complète de l’infrastructure nécessaire.
Questions fréquentes
Quel est le meilleur modèle ouvert pour un usage sur ordinateur personnel ?
Cela dépend de la mémoire disponible et de la tâche. Phi-4-mini, ainsi que les petites versions de Gemma 4 et Ministral 3, restent légers, tandis que gpt-oss-20b ou Qwen3.6 demandent plus de mémoire et une quantification adaptée.
Les modèles à poids ouverts peuvent-ils s’utiliser à des fins commerciales ?
Souvent oui, mais il faut vérifier la licence de chaque version. Apache 2.0 et MIT autorisent généralement un usage commercial étendu, alors que les licences propriétaires peuvent imposer des restrictions.
Télécharger un modèle supprime-t-il le coût lié à l’IA ?
Non. Même quand le paiement par API disparaît, restent les coûts de GPU, d’électricité, de stockage, de gestion, de sécurité et de maintenance.
Un modèle local vaut-il mieux qu’une API dans le cloud ?
Le modèle local offre plus de contrôle sur les données et la configuration. Une API peut rester plus simple et économique pour un usage faible ou variable. Le choix dépend du volume, de la confidentialité et des ressources techniques disponibles.