
Cloudflare révèle comment Kimi et GLM fonctionnent avec moins de mémoire sans perdre de précision
Cloudflare a expliqué certains des changements qu’elle a introduits dans Workers AI pour exécuter des modèles ouverts de grande taille tels que Kimi K2.6 de Moonshot AI et GLM 5.2 de Z.ai, en utilisant des techniques d’optimisation plus efficaces. La société assure avoir réduit la consommation de mémoire GPU et le coût par inférence grâce à de nouvelles méthodes d’optimisation, tout en maintenant une précision presque inchangée des modèles. Les points clés des optimisations de Cloudflare en 20 secondes Workers AI intègre de nouvelles techniques pour exécuter des modèles ouverts de grande taille avec moins de mémoire GPU. Cloudflare combine le cache KV en FP8, des poids compressés en INT4 et de nouveaux mécanismes de protection de la mémoire. L’entreprise




