← Zpět na Cloudflare

Cloudflare · 21. června 2022

Výpadek Cloudflare 21. 6. 2022 — chyba v síťové konfiguraci shodila 19 datacenter

Chyba v nasazované změně síťové konfigurace narušila pořadí BGP oznámení a stáhla IP adresy Cloudflare z internetu v 19 nejvytíženějších datacentrech. Přestože šlo o malý zlomek lokalit, procházelo jimi zhruba 50 % globálního provozu Cloudflare. Výpadek trval 75 minut a zasáhl mimo jiné Discord.

Datum
2022-06-21
Délka výpadku
1 h 15 min
Zasažené regiony
Global
Závažnost
major
Dopad
19 klíčových datacenter (Amsterdam, Frankfurt, Londýn, Singapur, Tokio, Sydney a další) — zhruba 50 % globálního provozu Cloudflare
Provider
Cloudflare

Časová osa incidentu

  1. 06:27 UTC Nasazení změny síťové konfigurace stahuje IP adresy z internetu — 19 datacenter padá.
  2. 06:58 UTC První datacentrum vráceno zpět online.
  3. 07:42 UTC Všechna datacentra opět online a v pořádku — incident vyřešen.
  1. června 2022 brzy ráno přestala podstatná část služeb postavených na Cloudflare odpovídat. Nešlo o útok ani o pád celé sítě — výpadek se omezil na 19 datacenter, jenže právě ta patří k nejvytíženějším na světě a teče jimi zhruba polovina globálního provozu Cloudflare.

Co se přesně stalo

Cloudflare v té době zaváděl novou páteřní (spine) vrstvu, která měla zpružnit a zodolnit propojení edge serverů. Součástí byla změna síťové konfigurace, jejíž chyba narušila pořadí BGP oznámení — protokolu, kterým si sítě navzájem říkají, kudy vést provoz. V důsledku toho se IP adresy Cloudflare v dotčených lokalitách stáhly z internetu a datacentra se stala nedosažitelnými.

Náprava byla relativně rychlá: první lokalita se vrátila do 31 minut, všech 19 bylo zpět do 75 minut od začátku.

Jak se před podobným výpadkem chránit

Tenhle incident ukazuje, že i špička v oboru může jednou změnou shodit půlku své kapacity — a že status stránka providera nestačí jako jediný zdroj pravdy.

  • Nezávislé sondy z více regionů poznají, že konkrétně vaše weby přes Cloudflare neodpovídají, bez ohledu na to, co hlásí dashboard providera.
  • Záložní trasa na jiné CDN udrží web dostupný, i když primární síť globálně zakolísá.
  • Automatický failover zkrátí dobu výpadku z desítek minut ručního řešení na minuty.

Redundio dělá přesně tohle: monitoruje nezávisle na Cloudflare a při potvrzeném výpadku překlopí DNS na zálohu — automaticky, i v 6 ráno.

Odhad dopadu

Postiženy byly největší metropolitní uzly. Protože tudy teče polovina provozu Cloudflare, dopad pocítila řada populárních aplikací a webů včetně Discordu.

Co by udělalo Redundio

Redundio by vaši CDN přepnulo během minut.

Nezávislý monitoring pozná výpadek CDN i tehdy, když status stránka providera ještě svítí zeleně, ověří dvojitou kontrolou, co přesně selhalo, a překlopí DNS na zálohu — bez nočního zásahu.

Chci do pilotu

Časté otázky

Výpadek začal v 06:27 UTC a všechny lokality byly zpět v provozu v 07:42 UTC — celkem přibližně 75 minut.

19 datacenter v nejvytíženějších metropolích světa. I když to je jen malá část všech lokalit Cloudflare, procházelo jimi zhruba 50 % globálního provozu.

Chyba v kódu síťové konfigurace během zavádění nové páteřní (spine) vrstvy. Změna narušila pořadí BGP oznámení a způsobila stažení IP adres Cloudflare z internetu v dotčených lokalitách.