软件Bug让谷歌云平台再次出现故障

作者：Simon Sharwood

软件bug让SSD误以为自己在维护期间已经没有剩余空间了，这就导致了谷歌云平台再次出现故障。

ZD至顶网软件频道消息：谷歌承认自己的云出问题了。而且是“再一次”。

最近的发生混乱发生于6月28日，us-central1-a 中的Google Compute Engine SSD Persistent Disks“在一个区域内经历了高层写入延迟和错误，这种情况持续了211分钟。”这场混乱意味着磁盘可能停止接受写入，而将SSD作为根分区的实例有可能会挂起。

虽然，谷歌云平台除了故障，但是谷歌对故障的披露方面还算令人信服。对于此次问题，谷歌表示：“两个并发的日常维护事件触发了Persistent Disk底层的分布式存储系统中的数据再平衡。”

不过用户不用担心这种“再平衡”，因为“这种再平衡旨在让维护时间对用户不可见，通过在不可用的存储设备和机器上平均地重新分布数据来实现。”

这正是云平台应该做到的：很多部件都在后台运行，对你来说是不可见的，它们维持着服务器的正常运转。

但是这一次，“一个以前没有发现的软件bug，由两个并发的维护事件触发，意味着因为再平衡变得不可用的磁盘块没有释放供随后再度使用，消耗了这个区域中的可用SSD空间，直到写操作被拒绝才被发现。”

一旦磁盘认为它们已经用光了所有的空间，就没有更聪明的机制在后台纠正这一错误了，以至于谷歌花了211分钟才找到问题并且解决问题。

和往常一样，谷歌承诺未来会做得更好，并且表示其“工程师正在改进自动监控，这样如果问题再次出现，工程师将会在用户受到影响之前就得到预警。我们还改进了我们的自动化，以更好地协调同一区域内不同的维护操作，减少必要情况下还原此类操作所需要的时间。”

正如我们在之前提到的，谷歌在面临故障及其产生原因的时候，比其竞争对手更加坦率。但是这家公司似乎也有更多的故障需要披露：《The Register》监测了三大云平台的故障通告，谷歌发布的问题数量比AWS和微软都要多，而这两家公司的云平台规模更大，产品也更多。

来源：ZD至顶网软件频道

0赞

好文章，需要你的鼓励

软件Bug让谷歌云平台再次出现故障

来源：ZD至顶网软件频道

2016

07/14

05:44

分享

点赞

数智时代，openGauss Summit 2025即将发布哪些技术创新破局

“算力+储能”深度融合：超智算发布分布式算力超级节点储能解决方案

联想推出DE6600系列：更智能的存储解决方案

创业公司如何在严格监管行业中实现生死攸关的创新

OpenAI发布GPT-5.2-Codex模型，软件工程自动化能力大幅提升

Waterfox浏览器宣布拒绝AI功能，瞄准Firefox忠实用户

TikTok美国业务出售交易将于下月完成

破局AI数据中心安全瓶颈：Fortinet联合NVIDIA引领隔离式加速新航向

智算中心进化论，科华数据如何做到“更懂”

更高负载、更快建设：2026年数据中心六大趋势

Snowflake数据库更新引发全球大规模服务中断

AI编程初创公司Lovable融资3.3亿美元，英伟达等科技巨头支持

对话谷歌副总裁Karen Teo：“短剧”“AI应用”现象级出海，我们看到中国开发者的三种内核

构建智能时代数据基石，闪迪带着系统级创新奔赴而来

专访DeepMind CEO：我们距离实现AGI只需5-10年

谷歌被罚款35位数！

变电站设备巡视基本要求

与生成式AI同行，存储的未来要义

数据中心正常运行时间的最大威胁及其应对方法

Gemini Live：足以秒杀Siri，却仍有明显瑕疵

为AI数据提供加速度，Solidigm全新超高速PCIe 5.0 SSD来了！

IEEE发布报告：SSD与HDD技术路线图向何处去，成本说了算

如果您非常迫切的想了解IT领域最新产品与技术信息，那么订阅至顶网技术邮件将是您的最佳途径之一

2025 re:Invent ：亚马逊云科技把Agentic AI生态梳理明白了

电子竞技瞬息万变，Team Liquid的“数据+AI”制胜秘籍

中国移动呼和浩特数据中心：只有高效存力先行，AI才能跑出全力

从“支撑工具”到“智能中枢”，AI原生ERP进化

关注官方公众号

关注官方微博

关注官方喜马拉雅

友情链接

业界热点: