L’intelligence artificielle chinoise a concentré en quelques jours trois initiatives majeures. Moonshot AI a dû limiter les nouvelles inscriptions à Kimi K3 faute de capacité, DeepSeek a lancé le déploiement général de sa famille V4, et Alibaba a présenté Qwen 3.8 Max. Ces trois modèles rivalisent avec des propositions américaines telles que GPT-5.6 et Claude Opus 5, mais le véritable terrain de bataille ne se limite plus aux benchmarks : il s’agit aussi de combien coûte chaque réponse et du nombre de GPU disponibles pour faire face à la demande.
Les clés des nouveaux modèles chinois en 20 secondes
- Moonshot a temporairement suspendu les inscriptions à Kimi K3 après avoir saturé une partie de sa capacité d’inférence.
- DeepSeek V4 combine un contexte long, des prix attractifs et deux variantes adaptées à différentes charges.
- Alibaba a présenté Qwen 3.8 Max, un modèle multimodal de 2,4 billions de paramètres.
- GPT-5.6 et Claude Opus 5 conservent une longueur d’avance dans plusieurs tâches professionnelles, bien que leur coût soit plus élevé.
La succession de ces annonces marque un changement essentiel. Lors des premières années de l’intelligence artificielle générative, l’attention se portait sur la capacité à entraîner le plus grand modèle ou atteindre la meilleure performance sur des benchmarks. Désormais, la problématique a évolué : un laboratoire peut disposer d’un modèle performant mais manquer d’infrastructure pour le supporter face à une demande massive.
Kimi K3 en offre un exemple emblématique. Seulement 48 heures après son lancement commercial, Moonshot AI a suspendu nouvelles inscriptions. La société a préféré protéger la stabilité de son service pour ses utilisateurs existants plutôt que de risquer une augmentation de la latence ou des erreurs due à un afflux de demandes.
Kimi K3 illustre les limites d’un service pour un modèle de 2,8 billions
Kimi K3 est un modèle de 2,8 billions de paramètres, construit selon une architecture de mélange d’experts, connue sous le nom de MoE (Mixture of Experts). Cette architecture ne mobilise pas tous les paramètres à chaque requête. Un système de routage désigne les experts les plus adaptés pour traiter chaque token, réduisant ainsi la charge de calcul par rapport à un modèle dense de la même taille.
Cela ne signifie pas pour autant qu’il soit simple ou peu coûteux à déployer.
Moonshot recommande l’utilisation de supernoyaux équipés d’au moins 64 accélérateurs afin que la communication entre experts reste au sein d’un réseau à large bande passante. La version complète du modèle pèserait environ 1,5 To en précision totale, tandis qu’une version quantifiée à 4 bits nécessiterait encore quelque 600 Go de mémoire.
L’architecture Kimi Delta Attention réduit significativement la mémoire requise pour le cache KV, utilisé pour conserver le contexte lors de la génération. Pourtant, cette amélioration ne suffit pas à éliminer les besoins physiques du modèle. La société doit continuer à disposer de grandes quantités de mémoire à haute bande passante, de capacités d’interconnexion et de GPU disponibles à chaque requête.
Ce lancement a entraîné une forte augmentation des ventes quotidiennes et de la consommation de l’API, conduisant Moonshot à diviser son offre en deux produits : l’un destiné à l’application web, aux fonctions de travail et au service général Kimi, et l’autre, Kimi Code, dédié à la programmation.
Cette séparation s’explique sur le plan technique : une simple conversation peut durer quelques minutes, alors qu’un agent dédié à la programmation peut travailler durant des heures, analyser des dépôts entiers, utiliser des outils, et générer des millions de tokens. Considérer ces deux usages comme une seule charge complique la gestion des ressources.
La publication future des poids du modèle devrait également aider Moonshot à répartir plus efficacement ses coûts. Fournisseurs cloud, grandes entreprises et exploitants de data centers pourront ainsi déployer Kimi K3 en interne, bien que la taille du modèle limite son accès aux serveurs classiques.
DeepSeek V4, compétitif par prix et efficacité sur de longues fenêtres contextuelles
Pendant que Moonshot limitait les inscriptions à Kimi K3, DeepSeek déployait en volume V4 Pro et V4 Flash, deux modèles disponibles en preview depuis avril dernier.
V4 Pro dispose de 1,6 billion de paramètres et active 49 milliards par token. V4 Flash, quant à lui, avec 284 milliards de paramètres totaux et 13 milliards actifs, propose un espace mémoire de contexte d’un million de tokens.
Les améliorations depuis la version initiale sont surtout liées au raisonnement, à l’utilisation d’outils et au comportement des agents. Les premiers tests suggèrent moins de réponses inventées et une meilleure clarté en programmation.
DeepSeek a également introduit une tarification dynamique selon l’heure de la journée. Les prix augmentent en périodes de forte demande en Chine et descendent durant les heures creuses. Ce type de modèle coût-efficacité est courant dans l’électricité, le transport ou le cloud, mais reste inédit pour les API d’IA.
En dehors des heures de pointe, le coût par million de tokens se situe autour de 0,87 dollars pour V4 Pro, et environ 0,28 dollars pour V4 Flash. Ces prix sont fortement inférieurs à ceux des modèles américains haut de gamme.
Il est important de ne pas limiter la comparaison au coût par token. Un modèle économique moins cher peut produire des réponses plus longues, nécessiter plus de tentatives ou faire des erreurs qui entraînent des reprises. Néanmoins, la différence de prix reste suffisamment significative pour inciter de nombreuses entreprises à choisir DeepSeek pour des tâches de classification, extraction, génération de code ou automatisation à grande échelle.
Un autre changement notable est la suppression des anciennes identifiants deepseek-chat et deepseek-reasoner. Les développeurs doivent migrer vers les nouveaux noms V4 Pro et V4 Flash pour un contrôle précis des variantes utilisées.
Qwen 3.8 Max, un modèle de 2,4 billions de paramètres avec capacités multimodales
Alibaba a présenté Qwen 3.8 Max Preview, un modèle de 2,4 billions de paramètres utilisant également une architecture MoE. La société n’a pas encore communiqué le nombre de paramètres actifs par token, donc la vitesse et le coût précis de l’inférence restent incertains.
Ce modèle supporte texte, images, vidéos et documents. Il offre une fenêtre de contexte proche de 984 000 tokens et peut produire des réponses jusqu’à 131 072 tokens.
Alibaba a intégré différents niveaux d’effort pour le raisonnement, de faible à très avancé. Cette configuration permet d’ajuster la consommation de ressources en fonction de la complexité de la tâche, tout en laissant le raisonnement actif par défaut.
Qwen 3.8 Max est accessible via les plans de tokens d’Alibaba ainsi que ses plateformes Qoder et QoderWork. Le service supporte les protocoles OpenAI et Anthropic, facilitant la migration des applications vers ce nouveau modèle sans changer d’endpoint.
Alibaba n’a pas encore publié de tarif standard par million de tokens ni de résultats complets sur benchmarks. Il s’agit d’une version encore préliminaire, susceptible d’évoluer dans les semaines à venir. La société a promis de publier les poids, mais la date et la licence restent indéterminées.
Kimi, DeepSeek et Qwen face à GPT-5.6 et Claude Opus 5
Les solutions chinoises arrivent avec des prix faibles, des architectures ouvertes ou en voie d’ouverture, et des fenêtres de contexte pouvant atteindre près d’un million de tokens. En revanche, OpenAI et Anthropic bénéficient d’un avantage distinct : des modèles propriétaires plus matures, des outils intégrés et une infrastructure plus robuste pour le service.
| Modèle | Architecture | Contexte approximatif | Prix de lancement | Disponibilité |
|---|---|---|---|---|
| Kimi K3 | MoE, 2,8 billions de paramètres | 1 million | 15 dollars par million de tokens | API, applications et poids annoncés |
| DeepSeek V4 Pro | MoE, 1,6 billions au total | 1 million | à partir de 0,87 dollars hors heure de pointe | API et poids ouverts |
| DeepSeek V4 Flash | MoE, 284 milliards au total | 1 million | à partir de 0,28 dollars hors heure de pointe | API et poids ouverts |
| Qwen 3.8 Max | MoE, 2,4 billions de paramètres | environ 1 million | Tarif standard non publié | Version préliminaire fermée |
| GPT-5.6 | Propriétaire | Selon version et modalité | Jusqu’à 30 dollars par million | API et services OpenAI |
| Claude Opus 5 | Propriétaire | Jusqu’à 1 million | 25 dollars par million | API et applications Anthropic |
GPT-5.6 conserve une position forte dans la programmation, la recherche, le design et l’automatisation via outils intégrés. OpenAI propose également des variantes et niveaux de raisonnement permettant un compromis entre vitesse, coût et qualité selon chaque projet.
Claude Opus 5 est particulièrement compétitif pour la programmation autonome, l’analyse de dépôts, les agents prolongés ou l’utilisation de l’ordinateur. Anthropic le positionne près de son modèle de plus grande capacité, mais avec un coût inférieur par tâche.
Les tarifs des deux modèles sont plus élevés que ceux de DeepSeek, mais OpenAI et Anthropic disposent de l’avantage de l’échelle : ils contrôlent leur infrastructure, leurs modèles, leurs outils, et une part importante des interfaces clientes.
L’inférence devient le nouveau goulot d’étranglement
L’épisode de Kimi K3 résume l’étape suivante de la course technologique : créer un modèle avancé ne suffit pas. Il faut également pouvoir le servir à des millions d’utilisateurs sans augmenter la latence, le taux d’erreur ou le coût par réponse.
La Chine doit faire face à une difficulté supplémentaire : les restrictions américaines limitent l’accès aux accélérateurs les plus sophistiqués. Cela force ses laboratoires à optimiser chaque GPU, à concevoir des architectures plus efficaces, et à réduire la consommation en évitant certaines charges ou en optimisant la gestion de l’énergie.
Ces contraintes ont encouragé des avancées dans la mixture d’experts, l’attention efficiente, la quantification et la réduction de la cache KV. Cependant, l’efficience ne remplace pas entièrement la puissance physique : un modèle de plusieurs billions de paramètres nécessite toujours de grands clusters, de la mémoire HBM et des réseaux capables de transférer rapidement de gros volumes de données entre les accélérateurs.
Pour les développeurs, cela signifie une offre plus diversifiée : des modèles compétitifs pour différents besoins de coûts, de confidentialité, d’ouverture et de performance. Une entreprise peut réserver GPT-5.6 ou Claude Opus 5 pour les tâches exigeantes, tout en utilisant DeepSeek, Kimi ou Qwen pour des travaux répétitifs ou en masse.
La décision d’achat s’appuiera non plus uniquement sur la position dans une hiérarchie, mais aussi sur le coût par tâche, la vitesse, la consommation de tokens, la stabilité des API, la possibilité de déploiement privé, et la disponibilité réelle de l’infrastructure.
Foire aux questions
Pourquoi Kimi K3 a-t-il arrêté d’accepter de nouveaux abonnements ?
Moonshot AI a temporairement suspendu les inscriptions en raison d’une surcharge de son infrastructure GPU. La demande était trop forte, et les clients existants ont conservé l’accès sans interruption.
Quelle différence entre DeepSeek V4 Pro et V4 Flash ?
V4 Pro active plus de paramètres et vise des tâches complexes, tandis que V4 Flash utilise moins de ressources pour offrir des coûts et des latences inférieurs sur des charges fréquentes.
Qwen 3.8 Max est-il un modèle ouvert ?
Alibaba a annoncé qu’il partagera les poids du modèle, mais n’a pas encore fixé de date, de licence ou de dépôt en open source.
Les modèles chinois surpassent-ils GPT-5.6 et Claude Opus 5 ?
Cela dépend de la tâche. Les modèles chinois offrent un avantage en termes de prix, d’ouverture et de contexte, mais GPT-5.6 et Claude Opus 5 restent plus matures pour de nombreuses applications professionnelles, avec des services plus avancés.