Forside Teknologi Microsoft startede en rutineopgave klokken 14.44 den 23. juli: Et...

Microsoft startede en rutineopgave klokken 14.44 den 23. juli: Et minut senere væltede 19 tjenester

Microsoft startede en rutineopgave klokken 14.44 den 23. juli: Et minut senere væltede 19 tjenester
Illustration af senest.dk

En planlagt vedligeholdelse i et californisk datacenter væltede 19 tjenester i næsten fem timer.

Det skulle have været en helt almindelig arbejdsdag. Klokken 14.44 (koordineret verdenstid) den 23. juli gik Microsofts teknikere i gang med planlagt vedligeholdelse i selskabets Azure-datacenter i West US-regionen i Californien. Lokalt var klokken kun 07.44 om morgenen. Inden for et minut begyndte cloud-tjenester at blive utilgængelige. I alt 19 tjenester blev ramt, og sådan forblev det i knap fem timer.

De færreste danskere skænker det en tanke, men en stor del af de apps og onlinetjenester vi bruger hver dag, hviler på præcis den slags infrastruktur. Da den svigtede, kunne kunder langt uden for Californien mærke det.

Fejlen ramte al trafik ind og ud af regionen. Arbejde der udelukkende foregik inde i West US, kørte videre, mens alt der skulle krydse regionens grænse, løb ind i timeouts og fejl.

En enkelt fejl fjernede for mange ruter

Årsagen var ikke et hackerangreb eller et fysisk sammenbrud, men et stykke software der gjorde for meget. Da et netværksudstyr skulle isoleres for at blive serviceret, ramte fejlen bredere end planlagt.

“En fejl i systemet, der omdanner forespørgsler, markerede fejlagtigt flere enheder som en del af vedligeholdelsen og fik et sæt IP-ruter til at blive fjernet fra flere enheder end tilsigtet,” forklarer Microsoft i selskabets foreløbige hændelsesrapport, gengivet af Network World. IP-ruter er kort sagt de vejvisere, der fortæller datatrafikken, hvordan den kommer frem. Da de forsvandt, mistede regionen kontakten til omverdenen.

Fem timer før alt kørte igen

Teknikerne brugte den første tid på at forstå, hvad der foregik. Først mellem klokken 16 og 17.45 koblede de den unormale trafik sammen med den nylige vedligeholdelse. Klokken 17.45 gik de i gang med at rulle ændringen tilbage, og klokken 18.26 var netværket genoprettet. Azure erklærede alle sine tjenester genoprettet klokken 19.41. Det samlede nedbrud varede fire timer og 57 minutter.

Nedbruddet trak en række eksterne tjenester med sig i faldet. IncidentHub kunne bekræfte 19 berørte tjenester, men det reelle tal er sandsynligvis højere, fordi ikke alle leverandører pegede direkte på Azure. Flere af de ramte tjenester var stadig ikke oppe igen, da Azure erklærede sit eget netværk genoprettet. Microsoft anbefaler selv, at virksomheder spreder deres systemer over flere regioner for at mindske risikoen, næste gang en enkelt fejl breder sig.

To store cloudnedbrud på to dage

Historien står ikke alene. Dagen efter, den 24. juli, gik det galt hos konkurrenten Amazon. Klokken 10.55 mistede AWS’ us-west-2-region i Oregon forbindelsen, og ifølge en teknisk gennemgang af hændelsen lå fejlen i det netværksudstyr, der fører trafikken mellem regionen og Seattle. Den akutte del varede omkring 20 minutter, men efterdønningerne trak ud.

For Microsofts vedkommende var julinedbruddet det andet store i 2026. I februar var både den vestlige og østlige del af USA ramt i omkring ti timer. To gigantiske cloududbydere, to nedbrud på to dage, og i begge tilfælde var udløseren ikke en katastrofe, men en lille fejl i et system, der skulle holde alt kørende. Det er en påmindelse om, hvor meget af den digitale hverdag der hænger på ganske få tekniske knudepunkter.

Ads by MGDK