一杯咖啡的时间,聊聊技术与成长
流量漏斗:把百万请求筛成千级订单
100 万请求抢 50 件商品,99.995% 注定失败——秒杀架构的核心任务不是满足所有请求,而是让它们体面地、便宜地失败。五层漏斗逐层收窄,越早过滤越便宜,这是整个系列的骨架。
一场秒杀崩掉的三层系统:为什么秒杀是设计天花板
晚上八点开抢,三秒后数据库 CPU 100%,下单接口全线超时,50 台手机超卖了 32 台。秒杀的三重属性——瞬时洪峰、稀缺热点、作弊对抗——决定了它不是把下单接口调调参数就能扛的。这一系列从崩掉的这一晚讲起。
收官:微服务治理全景图
注册、配置、网关、调用、观测、容错、发布——七个板块互相咬合成一张治理全景图。治理的本质是控制变量:给自由度配上闸门。演进路线、能力清单与回望,本篇收官。
事故集锦:六个微服务故障复盘
保护阈值没开导致全站空列表、配置全量推送改崩线程池、Feign 重试放大三倍流量、全量采样拖垮业务进程……六个真实故障,现象、定位、根因与修复,一次讲透。
服务网格:Sidecar 到底解决了什么
熔断、重试、追踪的客户端,每个服务都要带一套,跨语言团队升级 SDK 要齐步走——治理逻辑下沉到 Sidecar 是终极答案,但账单也不小。什么时候值得上 Mesh,什么时候 SDK 更划算。
发布策略:滚动、蓝绿与金丝雀
全量发布十分钟,回滚一小时——爆炸半径失控是发布最大的风险。滚动是默认选项,蓝绿换的是切流速度,金丝雀买的是提前发现问题。选哪个,先看你的回滚有多快。
分布式事务的微服务落位:Seata 与最终一致
拆掉的不只是代码,还有事务——下单扣库存跨了服务,@Transactional 失效了。第一问永远是能不能不用分布式事务;真要用,AT、TCC、消息最终一致各有各的账单,决策树帮你选。
指标监控与告警:四大黄金指标
两百张图的监控大盘,故障时却找不准该看哪张。延迟、流量、错误、饱和度——四个指标回答"用户有没有受影响"。PromQL 三行起步,告警的三条纪律比指标本身更重要。
统一日志:散落在二十个容器里的报错
排障要 grep 二十个容器,日志格式一人一个写法,机器时钟还不齐。统一日志的三件事:格式让机器可读、TraceId 把散落日志串成一条线、采集链路把成本管住。