Bufan Resume

蒋承宇 · Web Backend Developer

中文·tech #后端开发 #资深
蒋承宇
资深后端工程师
186 6666 6666zhouba@example.comzhouba杭州
github.com/username
1985-05在职-看机会30K-50K
汉族中共党员福建厦门已婚

个人总结

资深后端工程师,约 5 年经验。从大厂基础架构岗起步,深耕高并发交易链路与核心中间件,已成长为主导核心链路架构演进的资深骨干,并持续向架构师方向迈进。主导过峰值 12 万 QPS 交易链路的稳定性建设,以「分级限流 + 熔断降级 + 分库分表 + 分布式事务(Seata / RocketMQ 事务消息)」系统化治理数据一致性与系统容量,连续三届大促零重大故障扛住峰值流量;牵头核心服务由单体向微服务演进,沉淀统一服务治理与 Metrics + Tracing + Logging 三位一体可观测性体系,将核心接口可用性由 99.9% 提升至 99.99%、故障 MTTR 由约 40 分钟压降至 8 分钟内。

  • 核心专长:高并发交易链路稳定性、分库分表与分布式事务 / 幂等设计、限流降级与服务治理、Redis 多级缓存(热点探测)与 Kafka / RocketMQ 消息可靠投递。

  • 平台与中间件建设:作为发起人 / 技术负责人自研统一多级缓存、分布式任务调度等公司级基础组件并推动数十个团队复用;具备带 5–6 人小组攻坚、落地技术规范与故障演练的团队经验。

工作经历

后端开发工程师某互联网大厂
2021-07 - 2023-02
后端开发工程师|基础架构部
  • 作为核心开发从零参与某内部协作工具后端建设,基于 Go 搭建文档、任务、通知等核心模块,半年内支撑 5+ 业务线、日活万级内部员工稳定使用。

  • 主导服务由单体向微服务拆分,用 gRPC 定义 40+ 内部接口并统一超时、重试与错误码规范,跨服务调用 P99 稳定控制在 50ms 内。

  • 针对列表与详情接口做 MySQL 索引与慢查询治理,补充复合索引、消除 N+1 查询,核心接口 P99 由 800ms 降至 120ms,日均慢查询量下降约 90%。

  • 引入 Redis 缓存高频读路径并设计分级失效与防穿透兜底策略,热点接口缓存命中率稳定在 92%,数据库读 QPS 下降约 60%。

  • 用 Kafka 将通知下发、操作审计等非核心流程异步化解耦,写接口平均响应从 180ms 降至 60ms,瞬时高峰可平滑削峰至数千 QPS。

GogRPCMySQLRedisKafka
高级后端工程师头部电商平台
2023-03 - 2024-08
高级后端工程师|交易中台
  • 面对大促期间交易链路峰值 QPS 冲至 12 万、热点商品集中下单的稳定性压力,主导基于 Spring Cloud 的限流降级体系建设,落地分级限流 + 自动熔断 + 柔性降级预案,将核心交易接口大促超时率从 2.3% 压降至 0.4%,连续三届大促零重大故障扛住峰值流量。

  • 针对单库订单表数据量突破 8 亿、写入热点导致主库 CPU 长期 90%+ 的瓶颈,设计并落地交易库分库分表方案(16 库 256 表,用户 + 时间双维度路由),配合灰度迁移平滑切换,下单接口 P99 从 480ms 降至 120ms,单库写入压力下降约 70%。

  • 引入基于 Seata 的分布式事务治理,统一「下单—扣减库存—核销优惠」跨服务一致性,并以本地消息表做最终兜底,将大促资金类数据不一致工单从月均 60+ 压到个位数,对账差异率控制在万分之一以内。

  • 牵头交易链路全链路压测与容量规划,搭建影子库 + 流量回放压测平台,提前定位并优化 7 处性能瓶颈,大促扩容成本下降约 30%,容量评估周期由两周缩短至 3 天。

  • 作为资深骨干带 5 人小组推进交易核心稳定性专项,沉淀限流降级、故障定级与预案演练 SOP 并推动季度演练常态化,团队线上事故环比下降约 45%。

JavaSpring Cloud分库分表分布式事务限流降级
资深后端工程师 / 技术负责人T-Corp
2024-09 - 至今
资深后端工程师 / 技术负责人|核心平台研发
  • 牵头核心链路从单体向微服务的架构演进,主导领域边界拆分与依赖治理,将耦合严重的核心服务拆为 30+ 边界清晰的微服务,核心链路平均改动影响面收敛约 60%,需求平均交付周期缩短约 35%。

  • 从零搭建统一服务治理体系,沉淀限流、熔断、降级与超时重试的标准化中间件并推动 80+ 服务接入,核心接口可用性由 99.9% 提升至 99.99%,链路级雪崩类故障下降约 70%。

  • 落地 Metrics + Tracing + Logging 三位一体可观测性体系,全链路追踪覆盖核心调用链 95% 以上,关键告警接入根因关联,线上故障平均定位时间(MTTR)由约 40 分钟降至 8 分钟内。

  • 建立容量规划与常态化压测机制,基于流量模型对核心服务做容量基线评估与水位预警,提前识别多处隐性瓶颈,在保障 SLA 前提下整体资源成本优化约 25%。

  • 作为技术负责人带领 6 人后端小组攻坚疑难问题,建立技术评审、代码规范与故障演练(混沌工程)机制,牵头复盘并根治多起历史顽疾,季度重大线上事故归零。

微服务服务治理高可用容量规划可观测性

项目经历

后端核心开发内部 IM 系统
2021-09 - 2022-08
后端核心开发|基础架构部
  • 基于 Go + WebSocket 自研内部 IM 长连接网关,替换原有 HTTP 轮询方案,支撑单机 3 万+、集群 5 万+ 并发长连接稳定在线,连接建立 P99 从 600ms 降至 120ms 内,同等在线规模下服务器资源占用下降约 40%。

  • 设计基于 Redis 的在线状态与连接路由表,集中管理用户在各 gateway 节点的落点,跨节点消息投递成功率从 98.2% 提升至 99.95%,状态同步延迟稳定在 50ms 以内。

  • 构建「客户端 ACK + 服务端重传 + seq 去重」的消息可靠投递链路,端到端消息丢失率从约 5‰ 降至 0.1‰ 以下,重复消息率趋近于 0,彻底消除聊天记录丢消息投诉。

  • 优化长连接保活:引入分级心跳与空闲连接探测回收,将无效 / 僵尸连接占比从 12% 降至 2% 以内,单机连接内存占用降低约 30%。

  • 针对万人大群消息扩散设计写扩散 + 读扩散混合模型与离线消息队列,群消息推送 P95 延迟从 800ms 降至 200ms,高峰时段消息积压清零耗时缩短约 60%。

WebSocket长连接GoRedis消息可靠投递
后端模块负责人订单履约平台
2023-05 - 2024-03
后端模块负责人|交易中台
  • 牵头重构订单履约链路,针对大促期间服务重试导致的重复发货与超卖,落地 RocketMQ 事务消息 + 本地消息表的最终一致性方案,跨服务数据不一致工单由月均 200+ 降至个位数。

  • 设计履约全链路幂等机制(幂等键 + 状态机流转校验),覆盖下单、库存扣减、发货、回滚等 12 个关键节点,重复请求误处理率从 0.5% 压降至 0.001% 以下。

  • 主导订单库分库分表改造(按用户 ID 哈希拆 64 库 1024 表),平滑迁移 2 亿+ 历史订单零停机,核心履约查询 P99 由 320ms 降至 45ms。

  • 针对消息乱序与积压,基于 RocketMQ 顺序消息 + 死信兜底 + 延迟重投构建可靠投递,大促高峰下履约状态推进零丢失、零错乱,端到端时延稳定在 200ms 内。

  • 作为模块负责人推动履约对账体系建设,T+0 自动对账覆盖率达 99.9%,资损可疑订单由人工排查转为分钟级自动告警,大促累计拦截潜在资损订单 3000+ 笔。

分布式事务幂等设计分库分表RocketMQ
项目发起人 / 核心开发统一缓存中间件
2024-10 - 2025-06
项目发起人 / 核心开发|核心平台研发
  • 作为项目发起人主导自研统一多级缓存中间件,针对核心读链路热点 key 频繁击穿 DB 的痛点,设计「本地 Caffeine + 远端 Redis」两级缓存架构并定义统一接入 SDK,最终在 8+ 核心服务落地,整体缓存命中率提升至约 98%,读链路 P99 从 45ms 降至 8ms。

  • 基于一致性哈希 + 160 虚拟节点实现缓存分片与负载均衡,将节点扩缩容时的缓存失效迁移量从 50%+ 压降至 5% 以内,扩容期间回源 DB 的 QPS 抖动基本消除。

  • 设计滑动窗口 topK 热点探测模块,秒级识别热点 key 并自动提升至本地缓存层,使单一热点 key 可承载峰值 12 万 QPS,大促压测下未再出现单点缓存被打穿。

  • 引入 singleflight 合并回源 + 逻辑过期方案治理缓存击穿,将热点 key 失效瞬间的 DB 回源请求由数千 QPS 收敛至个位数,彻底消除击穿引发的 DB 抖动。

  • 配套建设缓存穿透布隆过滤与多级 TTL 打散策略,缓解缓存雪崩风险,中间件上线后核心库读 QPS 整体下降约 70%。

  • 将中间件沉淀为公司级标准组件并输出接入文档与监控看板,支持 5 分钟接入,半年内被 10+ 团队复用,成为团队基础设施的统一缓存方案。

多级缓存一致性哈希Redis热点探测
架构设计与核心开发分布式任务调度平台
2025-07 - 至今
架构设计与核心开发|核心平台研发
  • 主导从 0 到 1 设计分布式任务调度引擎架构,支撑 8 个业务线、日均约 1200 万次定时任务触发,调度触发延迟 P99 由秒级压降至 50ms 以内。

  • 基于 Raft 实现调度集群选主与元数据强一致复制,主节点异常时自动切换控制在 3s 内完成,全年调度可用性达 99.99%(年累计不可用 < 1 小时)。

  • 设计任务分片 + 一致性哈希的负载分配机制,单集群可水平扩展至 30+ 节点、峰值调度吞吐 5 万 QPS,扩缩容过程中保证任务零丢失、零重复触发。

  • 引入幂等执行令牌与分布式锁兜底,将任务重复执行率从 0.5% 降至百万分之一以内,根除重复触发引发的资损类故障。

  • 搭建调度全链路可观测性体系(Metrics + Tracing + 分级告警),核心异常平均发现时间由 30 分钟缩短至 2 分钟,故障 MTTR 下降约 60%。

  • 作为技术负责人带 5 人小组沉淀调度接入规范与统一 SDK,业务接入成本从 3 天降至 0.5 天,半年内推动 20+ 业务线平滑迁移上线。

分布式调度选主一致性高可用可观测性

教育经历

浙江大学计算机科学与技术学院计算机科学与技术本科GPA: 3.7/4.0
2017-09 - 2021-06

专业技能

Go
9/10
精通
Java / Spring Cloud
7/10
熟练
微服务与服务治理(限流降级)
7/10
熟练
gRPC / WebSocket 长连接
7/10
熟练
MySQL 分库分表
9/10
精通
Redis 多级缓存(热点探测)
9/10
精通
Kafka / RocketMQ 消息可靠投递
7/10
熟练
分布式事务与幂等设计
7/10
熟练
分布式协调(选主 / 一致性哈希 / 调度)
7/10
熟练
高可用与可观测性(容量规划)
7/10
熟练

荣誉奖项

公司年度技术贡献奖honor
2024

主导大促期间交易链路稳定性保障工作,因突出贡献获评公司年度技术贡献奖。

ACM-ICPC 亚洲区域赛 银奖honor
2019

在校期间参加 ACM-ICPC 亚洲区域赛并获银奖,体现扎实的算法与工程基础。

Sample data, for reference only