Une GPU fiable ne suffit pas : pourquoi les grands clusters d’IA échouent autant

AWS admet qu'il ne retire pas les Nvidia A100 : la pénurie de GPU prolonge la vie du matériel « ancien » dans le cloud

Un nœud équipé de huit GPU peut fonctionner pendant des semaines sans problème, mais reste une pièce peu fiable pour un entraînement distribué impliquant des milliers de machines simultanément. La contradiction est apparente : lorsqu’une tâche synchronisée dépend de la disponibilité continue de tous ses participants, une faible probabilité de panne individuelle se multiplie pour […]