返回档案库

案例库 · 软件与 IT · 运营决策 · 2024

达美航空的 CrowdStrike 中断取消 5000 多架航班,造成 5 亿美元损失

一家供应商的一次糟糕安全更新,让达美航空的整个 IT 栈瘫痪,迫使 40000 台服务器被手工重置。

Delta Air Lines · 2024-07-19

怎么回事

2024 年 7 月 19 日,一次有缺陷的 CrowdStrike Falcon 安全更新让全球 850 万台 Windows 电脑蓝屏。达美航空在所有美国航空公司中受创最重:到 7 月 25 日它取消了 5000 多架航班,让数十万乘客滞留,用了好几天才恢复正常。

达美之所以比任何其他航空公司都更久地受苦,是因为它构建 IT 的方式。机组排班、飞行员追踪、登机口分配和航班规划全部运行在一个深度集成、由 CrowdStrike 保护的 Microsoft Windows 栈上,几乎没有跨厂商冗余。当共享的安全层崩溃时,达美运营一趟航班所依赖的系统全部一起失效,毫无后备路径。

恢复是手工且缓慢的。达美不得不一台一台地重置约 40000 台服务器,运营才重新上线。CEO 埃德·巴斯蒂安把直接成本定为 5 亿美元,涵盖收入损失、付给滞留客户的补偿和恢复工作,并表示航司将向 CrowdStrike 和 Microsoft 索赔。达美聘请了知名诉讼律师大卫·博伊斯来追讨索赔。

达美的账单远高于同行:美国航空和联合航空表示,这次中断只让它们各自损失几位数亿美元。差距不是运气而是架构——区别在于一支能在备用系统上重启的机队,和一支运营活在一家供应商栈里的机队。

为什么会这样

  • 达美把最关键的航班运营运行在一个单一供应商的 Windows 加 CrowdStrike 栈上,几乎没有冗余,所以一次糟糕的更新就把它们全部打垮
  • 共享的安全层位于每个排班和追踪系统之下,崩溃时达美没有任何替代路径
  • 恢复花了数天,因为 40000 台服务器必须手工重置,而不是通过设计好的故障转移恢复
  • 这 5 亿美元的账单很大程度上是自找的:IT 更模块化的竞争对手几小时内就恢复,成本只有几位数亿美元
代价5 亿美元,5000 多架航班取消,40000 台服务器手工重置代价高昂

教训

如果每个关键系统都共享一家供应商的栈,那个栈就是没有任何 SLA 能保护的单点故障——韧性预算应该花在解耦的后备方案上,而不是花在供应商的保证上。

资料来源

发现哪里写错了?告诉我们。

Comments · 0

    登录 后就能评论。

    类似的案例

    这家公司栽倒的地方,别处有人漂亮地解开过。 第二意见 →