Cloudflare révèle comment Kimi et GLM fonctionnent avec moins de mémoire sans perdre de précision

Cloudflare et Wiz annoncent leur partenariat en matière de sécurité basé sur l'intelligence artificielle

Cloudflare a expliqué certains des changements qu’elle a introduits dans Workers AI pour exécuter des modèles ouverts de grande taille tels que Kimi K2.6 de Moonshot AI et GLM 5.2 de Z.ai, en utilisant des techniques d’optimisation plus efficaces. La société assure avoir réduit la consommation de mémoire GPU et le coût par inférence grâce à de nouvelles méthodes d’optimisation, tout en maintenant une précision presque inchangée des modèles.

Les points clés des optimisations de Cloudflare en 20 secondes

  • Workers AI intègre de nouvelles techniques pour exécuter des modèles ouverts de grande taille avec moins de mémoire GPU.
  • Cloudflare combine le cache KV en FP8, des poids compressés en INT4 et de nouveaux mécanismes de protection de la mémoire.
  • L’entreprise affirme conserver une précision quasiment identique à celle des modèles originaux.
  • L’objectif est d’augmenter le nombre de requêtes simultanées et de réduire le coût par inférence.

La publication offre une vision peu courante du travail nécessaire pour faire fonctionner des modèles de langage à grande échelle. Le défi ne consiste plus seulement à disposer de GPU plus puissants, mais à exploiter au mieux chaque gigaoctet de mémoire disponible.

Le véritable goulot d’étranglement : la mémoire

Cloudflare explique que des modèles comme Kimi K2.6 ou GLM 5.2 se distinguent par leur capacité à gérer des contextes très longs et des architectures Mixture of Experts (MoE), mais ces caractéristiques rendent leur déploiement particulièrement exigeant en termes de mémoire.

Dans de nombreux cas, la limite principale n’est pas seulement les paramètres du modèle, mais la KV Cache, une structure qui stocke les clés et valeurs d’attention générées pendant la conversation afin d’éviter de recalculer tout le contexte à chaque nouvelle réponse.

Avec des échanges longs, cette cache peut occuper plus de mémoire que le modèle lui-même.

Réduire la cache de moitié grâce à FP8

Une des optimisations consiste à stocker la KV Cache en utilisant la précision FP8 au lieu de BF16.

Selon Cloudflare, cette modification diminue d’environ 50 % l’espace nécessaire pour stocker la cache. Ainsi, pour Kimi K2.6, le contexte maximal pouvant être maintenu en mémoire passe de 686 000 tokens à près de 1,37 million de tokens.

Bien que la performance par requête individuelle diminue légèrement en raison des conversions entre formats numériques, les gains deviennent visibles lorsque la charge est plus importante.

Alors qu’avec BF16 le système saturait la mémoire avec 32 demandes simultanées, FP8 permet d’en traiter jusqu’à 64, atteignant environ 2 192 tokens par seconde, soit une hausse d’environ 41 % par rapport à BF16.

Cloudflare ajoute que leurs tests internes ne montrent pas de différences notables en terme de précision sur des benchmarks comme GSM8K, MMLU ou ARC.

GLM diminue aussi la taille du modèle avec INT4

La seconde technique concerne directement les poids du modèle.

Pour GLM 5.2, Cloudflare implémente une quantification INT4, réduisant la taille du modèle d’environ 705 GB à 421 GB, soit près de 40 % de diminution.

Cette réduction permet de libérer de la mémoire sur chaque GPU pour traiter un contexte plus vaste et accélère également la phase de génération du texte.

Les données montrent des améliorations de performance surtout lors de faibles niveaux de charge. Avec une seule requête, GLM passe de environ 60 tokens par seconde avec FP8 à environ 92 tokens par seconde avec INT4.

La société reconnaît que cette technique est moins efficace durant la phase initiale de traitement (prefill), où elle continue d’utiliser FP8, étant principalement limitée par la capacité de calcul plutôt que par la bande passante mémoire.

Mieux d’efficacité nécessite plus de mécanismes de sécurité

Augmenter le nombre de requêtes partageant la mémoire d’un GPU augmente aussi le risque d’erreurs lors de l’utilisation de la KV Cache.

Pour limiter ce risque, Cloudflare a développé un système de vérification d’intégrité de la cache qui s’assure que chaque requête n’accède qu’aux pages de mémoire qui lui sont attribuées.

En cas d’anomalie, la requête est annulée avant que ne soit fournie une réponse potentiellement erronée.

D’après leurs tests, ce mécanisme n’ajoute qu’un impact inférieure à 1 % en termes de performance et de latence. La société considère donc que ce surcoût est justifié pour améliorer la fiabilité du système.

L’enjeu maintenant : augmenter le nombre de modèles au même coût

Cloudflare affirme poursuivre l’expansion de ces optimisations à l’ensemble de son infrastructure.

Parmi ses futurs axes de développement, la société évoque l’extension de l’usage du FP8 pour la KV Cache, de nouvelles techniques de compression comme NVFP4 sur l’architecture Blackwell de NVIDIA, et la généralisation des contrôles d’intégrité mémoire.

Au-delà des aspects techniques, cet article reflète une tendance croissante dans l’industrie de l’IA : la compétition ne se limite plus à la création de modèles plus grands, mais s’oriente aussi vers leur exécution plus efficace pour supporter un volume accru d’utilisateurs sans faire exploser les coûts d’infrastructure.

Questions fréquentes

Quels modèles Cloudflare optimise-t-il ?

L’entreprise mentionne principalement Kimi K2.6, développé par Moonshot AI, et GLM 5.2 de Z.ai, tous deux disponibles dans Workers AI.

Quels avantages à utiliser FP8 pour la KV Cache ?

Il permet de réduire d’environ 50 % la consommation mémoire de la cache, ce qui autorise un traitement plus élevé de requêtes simultanées tout en conservant une précision satisfaisante.

Quel est l’intérêt de la quantification INT4 ?

Elle compresse les poids du modèle pour diminuer la consommation GPU et accélérer la phase de génération lors de la décodification.

La réduction de taille impacte-t-elle la précision ?

Selon les benchmarks présentés par Cloudflare, les différences par rapport aux versions originales sont minimes, sans impact significatif sur la qualité des résultats.

le dernier