
D’AWS à GitLab : quand une commande ou une modification correcte casse la production
Une commande mal parameterisée a suffi en 2017 à provoquer l’une des pannes les plus remarquables d’Amazon Web Services (AWS). Amazon S3 a perdu une partie importante de sa capacité dans us-east-1, nécessitant le redémarrage de deux sous-systèmes, entraînant avec eux d’autres services. Cet incident est particulièrement instructif pour les administrateurs système et les développeurs, car il n’était pas exceptionnel en nature : GitLab, Meta, Cloudflare, Fastly et Atlassian ont documenté des incidents où des commandes, scripts, configurations ou codes parfaitement autorisés ont finalement causé d’importantes interruptions. Les clés des erreurs ayant brisé de grandes plateformes en 30 secondes En 2017, AWS a retiré trop de serveurs S3 avec un paramètre incorrect et a dû redémarrer deux sous-systèmes. GitLab a


