案例库 · 软件与 IT · 技术决策 · 2025
Cloudflare 的 1.1.1.1 DNS 解析器在全球宕机 62 分钟
预生产服务里一条休眠的配置项,让全世界使用最广的公共 DNS 解析器陷入宕机。
Cloudflare · 2025-07-14
怎么回事
2025 年 7 月 14 日,Cloudflare 的公共 DNS 解析器 1.1.1.1 从 21:52 到 22:54(UTC)在全球范围内不可用——这条互联网上使用最广的公共解析器完整宕机了 62 分钟,Gateway DNS 也间或降级。
触发原因是一次配置错误,而非攻击。6 月 6 日,一项对预生产 Data Localization Suite 服务的改动无意间带入了对 1.1.1.1 Resolver 及其前缀的引用。它在数周里一直处于休眠状态。7 月 14 日,对同一服务的第二次、不相关的改动触发了全网配置刷新,把 1.1.1.1 Resolver 的所有前缀从全球生产数据中心撤下。
Cloudflare 把根本故障追溯到易出错的旧系统:它们把明确的数据中心清单硬编码到前缀上,而且缺乏渐进、分阶段的部署。Tata Communications 播发 1.1.1.0/24 的一次巧合性 BGP 劫持在宕机两分钟后被发现——它被这次宕机暴露出来,却不是宕机的原因。
回滚配置后,流量恢复到事件前水平的大约 77%,到 22:55(UTC)路由完全恢复。Cloudflare 表示将淘汰旧的此前缀映射系统,转向带健康监控的分阶段地址部署。
为什么会这样
- 加进预生产配置的对 1.1.1.1 的引用休眠了数周,随后在一次无关的刷新中生效。
- 硬编码前缀清单、又缺乏分阶段部署的旧系统,把一行配置变成了一次全球撤网。
- 这条全世界使用最广的公共 DNS 解析器,在前缀被撤走时没有任何体面的退路。
- 一次巧合的 BGP 劫持让宕机看起来像攻击,但损失其实是自己造成的。
代价1.1.1.1 解析器全球宕机 62 分钟代价高昂
教训
今天什么都不改变的一行配置,可能在一次无关的改动把它唤醒时搞垮整个系统——分阶段部署和健康检查是唯一的防线。
资料来源
- Cloudflare 1.1.1.1 Incident on July 14, 2025 — Cloudflare blog
- Cloudflare 1.1.1.1 DNS Outage — Cybersecurity News
发现哪里写错了?告诉我们。
类似的案例
这家公司栽倒的地方,别处有人漂亮地解开过。 第二意见 →

Comments · 0
登录 后就能评论。