← Zpět na Fastly

Fastly · 8. června 2021

Výpadek Fastly 8. 6. 2021 — jedna konfigurace shodila půlku internetu

Dormantní softwarová chyba ve Fastly, zavlečená do nasazení 12. května, se 8. června 2021 spustila běžnou změnou konfigurace jednoho zákazníka a způsobila, že 85 % sítě začalo vracet chyby. Během minut zmizely z internetu Amazon, Reddit, The New York Times, Twitch, Spotify i britský vládní web gov.uk.

Datum
2021-06-08
Délka výpadku
49 min
Zasažené regiony
Global
Závažnost
critical
Dopad
85 % sítě Fastly — tisíce velkých webů (Amazon, Reddit, NYT, Twitch, Spotify, gov.uk, Shopify, Stack Overflow)
Provider
Fastly

Časová osa incidentu

  1. 09:47 UTC Začátek globálního výpadku — síť začíná vracet chyby 503.
  2. 09:48 UTC Monitoring Fastly detekuje narušení (do jedné minuty).
  3. 09:58 UTC Status stránka publikuje informaci o incidentu.
  4. 10:27 UTC Identifikována a izolována příčina, vypnuta problematická konfigurace.
  5. 10:36 UTC Služby se začínají zotavovat; do 49 minut od zásahu jede 95 % sítě normálně.
  6. 11:00 UTC Většina provozu obnovena.
  7. 12:35 UTC Incident plně vyřešen.
  1. června 2021 krátce před desátou hodinou ráno SELČ přestala podstatná část internetu fungovat. Návštěvníci velkých webů dostávali místo obsahu chybové stránky 503 Service Unavailable. Společným jmenovatelem byla CDN Fastly, přes kterou tyto weby doručovaly obsah.

Co se přesně stalo

Do nasazení z 12. května 2021 se dostala softwarová chyba, která zůstala dlouho neviditelná. Spustila ji teprve platná změna konfigurace jednoho zákazníka 8. června — ta shodou okolností naplnila přesné podmínky, za kterých se chyba projevila. Výsledkem bylo, že 85 % sítě Fastly začalo vracet chyby prakticky naráz.

Fastly zareagovala rychle: narušení detekovala do jedné minuty a do 49 minut od zásahu měla 95 % sítě zpět v normálu. Na rozsahu dopadu to ale nic nezměnilo — ve špičce evropského dopoledne byly desítky globálních značek nedostupné.

Jak se před podobným výpadkem chránit

Tenhle incident je učebnicovou ukázkou jednoho rizika: když celý web visí na jediné CDN, sdílíte i její chybu. Žádná interní redundance providera vám nepomůže, pokud selže globálně.

  • Nezávislý monitoring z více míst pozná výpadek dřív než status stránka providera — ta v prvních minutách často ještě svítí zeleně.
  • Záložní CDN na jiné síti znamená, že globální chyba jednoho providera neshodí i vás. Klíčové je umět provoz přepnout rychle a automaticky.
  • Krátké TTL na DNS zkracuje dobu, po kterou klienti drží starý (nefunkční) záznam.

Přesně tohle řeší Redundio: hlídá vaše weby nezávisle na providerovi a při výpadku CDN překlopí provoz na zálohu — během minut, bez ručního zásahu uprostřed pracovního dne.

Odhad dopadu

Přesné ztráty nikdo nevyčíslil, ale šlo o jeden z nejviditelnějších výpadků internetu té dekády — desítky globálních značek byly mimo provoz ve špičce evropského i amerického dopoledne.

Co by udělalo Redundio

Redundio by vaši CDN přepnulo během minut.

Nezávislý monitoring pozná výpadek CDN i tehdy, když status stránka providera ještě svítí zeleně, ověří dvojitou kontrolou, co přesně selhalo, a překlopí DNS na zálohu — bez nočního zásahu.

Chci do pilotu

Časté otázky

Globální narušení začalo v 09:47 UTC. Od okamžiku zásahu trvalo zhruba 49 minut, než 95 % sítě jelo normálně; úplné vyřešení Fastly oznámila ve 12:35 UTC.

Neobjevená softwarová chyba zavlečená do nasazení 12. května 2021, která zůstala skrytá až do chvíle, kdy ji 8. června spustila zcela platná změna konfigurace jednoho zákazníka. To vedlo k tomu, že 85 % sítě Fastly začalo vracet chyby.

Mimo provoz byly mimo jiné Amazon, Reddit, The New York Times, Twitch, Spotify, Shopify, Stack Overflow a britský vládní portál gov.uk.