HetCCL : la pièce manquante pour entraîner des modèles avec des GPU NVIDIA et AMD dans le même cluster

La course à la formation de modèles de langage de plus en plus grands rencontre un problème moins visible que la taille des paramètres ou la qualité des données : la logistique du matériel informatique. En pratique, déployer une infrastructure de machine learning à grande échelle ne consiste plus seulement à “acheter plus de GPU”, […]