Le 20 octobre 2025, une panne majeure d’AWS a paralysé des centaines de services à travers le monde. Au-delà de la défaillance technique, l’incident a montré que la résilience repose d’abord sur les équipes, pas sur les serveurs.

Le 20 octobre 2025, une mise à jour défectueuse de l'API DynamoDB d'Amazon dans la région US-East-1 (Virginie) a déclenché une réaction en chaîne au sein du système DNS interne d'AWS. EC2, S3 et Lambda ont été mis hors ligne en quelques minutes, perturbant des centaines de services dans le monde entier. Le rétablissement complet a pris près de quatre heures. Amazon a confirmé par la suite qu'aucune perte de données ni aucune faille de sécurité n'avaient été constatées.
La leçon était moins technique qu'organisationnelle :
La résilience est autant une question de personnel et de processus que d'architecture. La conception multi-cloud, les exercices de reprise après sinistre et les analyses post-mortem transparentes sont les clés pour réduire la durée de la prochaine panne.
Une mise à jour défectueuse de l'API DynamoDB d'Amazon dans la région US-East-1 (Virginie) aurait déclenché une réaction en chaîne au sein du système DNS interne d'AWS. En quelques minutes, des services essentiels tels qu'EC2, S3 et Lambda ont été mis hors ligne, et le rétablissement complet a pris près de quatre heures.
Non. Amazon a confirmé par la suite qu'aucune perte de données ni aucune faille de sécurité n'avaient eu lieu. C'est la disponibilité qui a fait défaut, et non l'intégrité ; c'est pourquoi cet incident doit être traité comme un problème de continuité d'activité plutôt que comme un problème de sécurité.
Parce qu'une grande partie d'Internet repose sur un petit nombre de fournisseurs et de régions, et que US-East-1 est l'une des plus sollicitées. Lorsque les dépendances se concentrent en un seul point, une défaillance locale se propage à l'échelle mondiale. La dépendance totale envers un seul fournisseur ou une seule région transforme un incident en un événement systémique.
Il répartit les charges de travail entre les régions et les fournisseurs afin qu'une seule défaillance ne puisse pas tout paralyser. Ce n'est pas gratuit : cela ajoute une complexité architecturale, une charge opérationnelle et nécessite un éventail de compétences plus large pour la maintenance. Le compromis honnête est une meilleure résilience en échange de coûts plus élevés et d'une expertise accrue.
En considérant les pannes comme inévitables et en menant des exercices de reprise après sinistre qui testent aussi bien les personnes que les systèmes : temps de réponse, processus d'escalade et prise de décision sous pression. Un plan de reprise que personne n'a répété n'est qu'un document, pas une capacité réelle.
Ingénieurs en fiabilité de site (SRE), ingénieurs CloudOps et DevOps, spécialistes de la cybersécurité et de l'infrastructure, ainsi que profils spécialisés dans les opérations de données et d'IA. Ce sont eux qui conçoivent la redondance, automatisent les flux de travail de récupération et mènent les analyses post-mortem qui empêchent une même panne de se reproduire.
En vous inscrivant à notre newsletter, vous acceptez de recevoir des communications conformément à notre politique de confidentialité.