Op 20 oktober 2025 legde een grote AWS-storing honderden diensten wereldwijd plat. De storing onthulde meer dan een technisch probleem: echte veerkracht begint bij mensen, niet bij machines.

Op 20 oktober 2025 veroorzaakte een foutieve update van de Amazon DynamoDB API in de regio US-East-1 (Virginia) een kettingreactie in het interne DNS-systeem van AWS. EC2, S3 en Lambda gingen binnen enkele minuten offline, wat honderden diensten wereldwijd verstoorde. Het volledig herstel duurde bijna vier uur. Amazon bevestigde later dat er geen sprake was van dataverlies of een inbreuk op de beveiliging.
De les was minder technisch dan organisatorisch:
Resilience is net zozeer een kwestie van personeel en processen als van architectuur. Multi-cloudontwerp, disaster-recovery-oefeningen en open evaluaties zijn wat de volgende storing verkort.
Een foutieve update van de DynamoDB API van Amazon in de regio US-East-1 (Virginia) veroorzaakte naar verluidt een kettingreactie in het interne DNS-systeem van AWS. Binnen enkele minuten gingen kerndiensten zoals EC2, S3 en Lambda offline en duurde het volledig herstel bijna vier uur.
Nee. Amazon bevestigde achteraf dat er geen sprake was van dataverlies of een inbreuk op de beveiliging. Wat faalde was de beschikbaarheid, niet de integriteit; daarom kan dit incident het beste worden behandeld als een probleem van bedrijfscontinuïteit in plaats van een beveiligingsprobleem.
Omdat een groot deel van het internet draait op een klein aantal aanbieders en regio's, en US-East-1 is een van de meest gebruikte. Wanneer afhankelijkheden zich op één plek concentreren, verspreidt een lokaal defect zich wereldwijd. Totale afhankelijkheid van één enkele aanbieder of regio verandert een incident in een systemische gebeurtenis.
Het verdeelt workloads over regio's en aanbieders, zodat één storing niet alles platlegt. Het is niet gratis: het voegt architecturale complexiteit, operationele overhead en een bredere set vaardigheden toe om het te onderhouden. De eerlijke afweging is meer veerkracht in ruil voor hogere kosten en meer expertise.
Door storingen als onvermijdelijk te beschouwen en disaster-recovery-oefeningen uit te voeren die zowel mensen als systemen testen: responstijden, escalatiepaden en besluitvorming onder druk. Een herstelplan dat niemand heeft geoefend, is slechts een document, geen daadwerkelijk vermogen.
Site Reliability Engineers, CloudOps- en DevOps-engineers, cybersecurity- en infrastructuurspecialisten, en profielen in data- en AI-operations. Dit zijn de mensen die redundantie ontwerpen, herstelworkflows automatiseren en de evaluaties uitvoeren die voorkomen dat dezelfde fout twee keer gebeurt.
Door u te abonneren op onze nieuwsbrief, gaat u ermee akkoord om berichten te ontvangen in overeenstemming met ons privacybeleid.