Cloudflare · 21. června 2022
Výpadek Cloudflare 21. 6. 2022 — chyba v síťové konfiguraci shodila 19 datacenter
Chyba v nasazované změně síťové konfigurace narušila pořadí BGP oznámení a stáhla IP adresy Cloudflare z internetu v 19 nejvytíženějších datacentrech. Přestože šlo o malý zlomek lokalit, procházelo jimi zhruba 50 % globálního provozu Cloudflare. Výpadek trval 75 minut a zasáhl mimo jiné Discord.
- Datum
- 2022-06-21
- Délka výpadku
- 1 h 15 min
- Zasažené regiony
- Global
- Závažnost
- major
- Dopad
- 19 klíčových datacenter (Amsterdam, Frankfurt, Londýn, Singapur, Tokio, Sydney a další) — zhruba 50 % globálního provozu Cloudflare
- Provider
- Cloudflare
Časová osa incidentu
- 06:27 UTC Nasazení změny síťové konfigurace stahuje IP adresy z internetu — 19 datacenter padá.
- 06:58 UTC První datacentrum vráceno zpět online.
- 07:42 UTC Všechna datacentra opět online a v pořádku — incident vyřešen.
- června 2022 brzy ráno přestala podstatná část služeb postavených na Cloudflare odpovídat. Nešlo o útok ani o pád celé sítě — výpadek se omezil na 19 datacenter, jenže právě ta patří k nejvytíženějším na světě a teče jimi zhruba polovina globálního provozu Cloudflare.
Co se přesně stalo
Cloudflare v té době zaváděl novou páteřní (spine) vrstvu, která měla zpružnit a zodolnit propojení edge serverů. Součástí byla změna síťové konfigurace, jejíž chyba narušila pořadí BGP oznámení — protokolu, kterým si sítě navzájem říkají, kudy vést provoz. V důsledku toho se IP adresy Cloudflare v dotčených lokalitách stáhly z internetu a datacentra se stala nedosažitelnými.
Náprava byla relativně rychlá: první lokalita se vrátila do 31 minut, všech 19 bylo zpět do 75 minut od začátku.
Jak se před podobným výpadkem chránit
Tenhle incident ukazuje, že i špička v oboru může jednou změnou shodit půlku své kapacity — a že status stránka providera nestačí jako jediný zdroj pravdy.
- Nezávislé sondy z více regionů poznají, že konkrétně vaše weby přes Cloudflare neodpovídají, bez ohledu na to, co hlásí dashboard providera.
- Záložní trasa na jiné CDN udrží web dostupný, i když primární síť globálně zakolísá.
- Automatický failover zkrátí dobu výpadku z desítek minut ručního řešení na minuty.
Redundio dělá přesně tohle: monitoruje nezávisle na Cloudflare a při potvrzeném výpadku překlopí DNS na zálohu — automaticky, i v 6 ráno.
Odhad dopadu
Postiženy byly největší metropolitní uzly. Protože tudy teče polovina provozu Cloudflare, dopad pocítila řada populárních aplikací a webů včetně Discordu.
Co by udělalo Redundio
Redundio by vaši CDN přepnulo během minut.
Nezávislý monitoring pozná výpadek CDN i tehdy, když status stránka providera ještě svítí zeleně, ověří dvojitou kontrolou, co přesně selhalo, a překlopí DNS na zálohu — bez nočního zásahu.
Chci do pilotuZdroje
Časté otázky
Výpadek začal v 06:27 UTC a všechny lokality byly zpět v provozu v 07:42 UTC — celkem přibližně 75 minut.
19 datacenter v nejvytíženějších metropolích světa. I když to je jen malá část všech lokalit Cloudflare, procházelo jimi zhruba 50 % globálního provozu.
Chyba v kódu síťové konfigurace během zavádění nové páteřní (spine) vrstvy. Změna narušila pořadí BGP oznámení a způsobila stažení IP adres Cloudflare z internetu v dotčených lokalitách.