高可用不是技术问题,是钱的问题

2026年的八分钟故障,戳破高可用的神话

今年大年初三,返程票抢购高峰,12306移动端突然挂了八分钟。微博热搜半个小时掉不下来,我当时攥着手机在高铁站候车,连刷六次都是服务繁忙,身边好几个拎着行李的年轻人骂骂咧咧,说这么大的系统怎么还崩。

这事第二天,技术圈吵翻了。有人说12306十年前就能扛住百亿并发,怎么现在还崩?有人扯是上游云节点故障背锅,有人暗戳戳说,是平台为了省钱砍了冗余资源。

2026年春节12306服务故障热搜截图
2026年春节12306服务故障热搜截图

现在不管是做云计算的,还是做企业服务的,开口就是高可用,五个九九个九,仿佛少一个九,整个架构就是垃圾。

但是没人愿意说真话。

高可用从诞生第一天起,就不是纯技术问题。你要堆多少可用性,本质上就是你愿意拿多少钱买安全感,这个道理,太多人揣着明白装糊涂。

预备队悖论:高可用的成本陷阱

说个跨行业的比喻,高可用其实就像战争里的预备队。养预备队要常年发军饷管吃喝,没仗打的时候一分钱产出都没有,真到前线崩盘的时候,没有预备队就是全线溃退,一点翻盘的机会都没有。

那你养多少预备队合适?养一个军当然稳,但是整个国家的粮饷都给你预备队耗了,别的地方不用活了?不养又不行,一波打穿直接亡国。

国内现在的云计算厂商,刚好把这个悖论做成了生意。把高可用包装成高级技术服务,溢价卖得飞起。我上个月帮一个创业朋友算过账,某头部公有云的异地多活高可用方案,整体报价是单区域单节点部署的2.7倍,但是官方给出的极端故障可用性提升,不到12%。

2025年双十一大促,国内某头部直播电商为了把可用性从三个九拉到四个九,额外砸了1.2亿买冗余服务器做弹性资源池,这笔钱相当于河南周口市全市政务系统一整年的IT投入预算。

说实话,大部分人这辈子都碰不到需要四个九可用性的场景。三个九的可用性,意味着一年允许停机不到九个小时,五个九就是不到五分钟。绝大多数普通互联网项目,五分钟的故障根本不会死,用户不会因为你五分钟刷不出来就永远卸载你。但是大家就是愿意为了这看不见的五分钟,多花几百万甚至上亿买安心。

云计算异地多活架构部署拓扑图
云计算异地多活架构部署拓扑图

我去年接触过杭州一个做跨境SaaS的创业团队,拿了A轮,投资人要求他们必须做异地多活高可用架构,不然下一轮不投。结果整个团队花了八个月重构,前前后后花了快四百万,上线快两年,一次需要切流量的核心故障都没遇到。那四百万本来够他们招三个核心开发,推两个能赚真钱的新功能,现在全砸进了连电都很少耗的冗余服务器里。

不过话说回来,厂商卖高可用焦虑本来就是生意,人家要赚钱,天经地义。愿打愿挨的事,只是太多中小玩家被绑上了牌桌,手里没那么多筹码,还得硬着头皮跟注。

被高可用绑架的普通人

被高可用绑架的普通人
被高可用绑架的普通人

这场高可用的狂欢,最难受的其实是普通从业者。

你现在随便拉一个互联网后端开发的招聘JD,十有八九会写要求具备高可用架构设计经验,你要是没做过多可用区容灾,没碰过分层熔断降级,第一轮简历直接就给你筛掉。很多刚毕业的年轻人,为了凑简历上的项目经验,不惜在自己几万日活的个人小项目里硬塞异地多活架构,就为了找工作的时候能吹一句,我做过高可用系统。

实际上呢?进了公司你会发现,你负责的模块,一年流量波动都不到十倍,所谓的高可用设计,从上线到你换工作,一次都没触发过。我前几天和一个大厂的后端架构师吃饭,他说他管电商平台的一个边缘模块,做高可用改造花了三个月,上线六年,熔断机制只触发过两次,还是内部压力测试的时候触发的。

所有人都在说高可用重要,所有人都在卷高可用的简历,但是没人问一句,我们真的需要这么高的可用性吗?

很多技术人被PUA坏了,觉得追求高可用就是政治正确,你说要算成本,就是你技术不行,就是你不负责任。但是我见过太多项目,为了多零点一个九的可用性,砍掉了给用户做新功能的预算,最后产品做死了,可用性再高又有什么用?连用户都没了,九个九的可用性也救不了你。

对产业链来说,这个游戏只会让马太效应越来越强。头部公司有足够的钱堆高可用,能扛住任何峰值任何故障,用户舒舒服服留得住;中小公司掏不起这个钱,一次突发故障掉十分之一的用户,直接就没了翻身的机会。用户永远会用脚投票,只会留在那个永远不崩的产品里。

你为你的项目,为你的简历,多花出去的时间和钱,真的换来了你想要的安全感吗?

作者|大讲堂

排版|大讲堂

审核|阿辰

免责声明:市场有风险,选择需谨慎!此文仅供参考,不作买卖依据。如有侵权请联系删除。
文章名称:高可用不是技术问题,是钱的问题
文章链接:https://m.lfdjt.com/info_23_23619.html