
9月3日晚上10时后 ,孩子突然告诉我,说几个人工智能(AI)服务同时出事了。基于好奇,我也上网去和AI聊聊。OpenAI的ChatGPT、Anthropic的Claude,就连马斯克SpaceX的Grok都宕机了。当时,我也上谷歌的Gemini以及深度求索(DeepSeek),感觉它们的回应速度好像比平时慢了点,不过基本上没发现什么问题。隔天看新闻才知道,全球AI服务故障延续大概三小时。
三大AI领军平台在同一时段发生故障,是一件极不寻常的事。这令人立刻想到可能是受到大规模的网络攻击,或是支撑这些大佬背后的同一超级云端服务如微软的Azure、亚马逊的AWS等系统出了问题,才会同时把大家一窝端。但各平台在恢复服务后所分别发布的消息,却另有乾坤。
Grok称它位于孟菲斯市为AI提供算力的计算中心发生故障,但没进一步披露具体是什么故障。OpenAI则把ChatGPT和写代码的Codex出错和宕机,归咎于“路由错误”(routing error)。也就是说大模型大脑没有问题,只是收不到客户的问题,或者把答案输出到别的用户处,听起来就是一个相当低级的基础设施的小错误而已。Anthropic当天很快就在服务状态网页上表明,已识别Claude模型错误率升高的原因,并已随后修复,不过也没有把完整的原因公开讲清楚。三大高科技公司因为三个不同的技术问题,同时出状况,真不寻常!
AI宕机发生在本地的夜晚,看来受影响的用户不多。或者他们也和笔者一样,只是找AI聊天,就算全部瘫痪也无所谓,就关机提前去找周公好了。不过,当时在美洲虽还没到办公繁忙时间,根据AI服务追踪网络的记录,在那个时段来自美国的投诉就有数万条。
在很多运用AI的企业和公司,AI已不只是一个聊天网站那么简单,程序员每天靠AI在编码优化产品、回应客户问询、编写制作各种多媒体内容,甚至起草文档和来往电邮、研究和搜索各类资料以供作决策,所以AI宕机必定造成一定的损失。
这次的集体宕机至少显示两大风险。首先是AI发展和系统实施的稳定性。当用户从电脑或终端机发出一个讯息要求后,它通过网络送到服务入口。系统要确认你的账号权限和配套,判断你在用哪个模型,再把请求送到合适的计算资源,让数据中心里的图形处理器(GPU)开始工作。
如果这个任务还需要联网、搜索、写代码、打开文件或者调用别的工具,其间又会继续连接其他系统,最后答案才再沿着网络返回你的屏幕。在短短几十秒里,只要链条里有一个(软件或硬件)关键环节掉链子,再聪明快捷的超强AI电脑,也无法满足客户要求。现在AI算力不断竞争和提升,什么智能体、逻辑推理计算、类人智慧等等,听起来特别科幻,不过却没甚注意朴实的基础设施的同步提升。小问题如服务器突然掉线、电力不稳定、网络容量超载、晶片跟不上,都能令AI系统随时面对断链的风险。
另一个是利用这些科技智能化的风险。这次被影响的还有如Cursor这类依赖Claude和Grok后端的AI编程工具,以及它们衍生的产品和服务。如果企业和公司在智能化时用上这些工具,又再用这些工具和服务发展和提供客服产品,一旦背后的大模型平台发生故障,造成公司客户的损失,问责和赔偿等问题该如何处理?
此外,提供产品的服务品质、备用方案和系统、延续服务等等,这些都是新的商业模式要考虑的问题。
一次偶然的集体服务中断突发事件,肯定造成短期运营中断,但目前尚未出现重大可量化的经济损失估计。受影响的AI平台都信誓旦旦宣布,会进行内部纠正措施,确保同样的事故不会再发生。这次事件把目前AI集中发展资源和单点故障等风险具体化,未来的系统发展应重视新的模式如多模型、多提供商架构、自动故障转移、备用方案,以及电力和云服务等基建领域。这次的服务中断来得及时,可能就是一只雏形的黑天鹅,为我们先敲响警钟。
作者是电子工程师