案例库 · 软件与 IT · 技术决策 · 2025
AWS 美国东部 1 区一处 DNS 记录故障,让大半个互联网瘫痪了一天
一个 AWS 区域的 DNS 记录问题,连锁波及迪士尼+、Reddit、Lyft、Coinbase、GOV.UK 以及亚马逊自身。
Amazon Web Services · 2025-10-20
怎么回事
2025 年 10 月 20 日,AWS 美国东部 1 区(US-East-1,北弗吉尼亚)的一处 DNS 记录问题,导致其自有服务超过 70 个瘫痪,并连锁波及同一基础设施上的客户。故障于美国东部时间凌晨 3:11 首次上报,受影响名单包括 Amazon.com、迪士尼+、Lyft、麦当劳 App、纽约时报、Reddit、Ring、Robinhood、Snapchat、美联航、Venmo、Canva、Roblox、Fortnite、Coinbase 与 Perplexity 等众多服务。
根本原因不是数据库宕机,而是 DNS 记录出错——这些记录告诉其他系统到哪里去找 DynamoDB(AWS 的数据库服务,支撑其许多其他应用)。圣母大学(Notre Dame)教授 Mike Chapple 对 CNBC 表示:“数据看起来是安全的。出问题的是那些告诉其他系统在哪里找到数据的记录。”
美国东部时间 6:35,AWS 称 DNS 问题已“完全缓解”,但随着客户尝试启动新实例,EC2 的错误率和连接问题持续到下午。AWS 表示约在 1:30 打起了 EC2 恢复的“早期迹象”。直到傍晚 6 点多,距离首次上报约十五个小时后,AWS 才宣布“所有 AWS 服务恢复正常运行”。
这笔账单落在 AWS 的客户而非亚马逊身上。英国政府网站 GOV.UK 和 HMRC、劳埃德银行集团以及多家航空公司都在受扰之列;由于内部系统和 Anytime Pay 应用下线,亚马逊自有的仓库和配送员工被要求待命。AWS 控制着约三分之一的市场份额(Synergy Research),因此用 Chapple 的话说,这次故障提醒人们:“主要云服务商打个喷嚏,整个互联网都会感冒。”
为什么会这样
- 一个共享的 DNS 依赖,意味着某个区域的一处记录故障,会变成其上每个服务和每个客户的故障。
- AWS 在一个控制面板上运行着数万家企业,所以 US-East-1 的 DNS 问题蔓延的速度,比团队绕开它还要快。
- 恢复是串行的:6:35 缓解了 DNS,EC2 却要到傍晚才恢复,爆炸半径因此在一天中的大部分时间里都敞开着。
- 亚马逊和它的卖家拥有同一个依赖——它自己的仓库、Flex 和 Anytime Pay 系统,与 Seller Central 一起瘫痪了。
教训
当少数几家公司托起整个互联网时,一处 DNS 记录故障就是跨整个大陆的宕机——把共享依赖当作单点故障来审计。
资料来源
- AWS services recover after daylong outage hits major sites — CNBC, October 2025
- Amazon Web Services outage takes down major websites — BBC, October 2025
发现哪里写错了?告诉我们。
类似的案例
这家公司栽倒的地方,别处有人漂亮地解开过。 第二意见 →

Comments · 0
登录 后就能评论。