赵昱 · web后端开发工程师
个人总结
拥有 8 年横跨高并发电商到 AI 基础设施的资深后端经验,专注分布式系统设计与交付,坚持以技术驱动业务增长。
极致性能与高可用:主导对象存储网关、微服务治理、模型推理网关等核心项目,单机吞吐达 2.5 Gbps,推理 P99 延迟压至 6 ms,多次将服务可用性提升至 99.99%,日支撑数十亿次对象读写与超亿次模型调用。
成本与稳定性双轮驱动:通过冷热数据分层、GPU 弹性调度等手段将存储成本降低 35%,年化硬件成本节省约 260 万元;基于混沌工程与 Raft 多活容灾实现机房级故障切换 < 8 秒、数据零丢失,RPO < 100 条,RTO < 30 秒。
工作经历
设计并实现基于 C++ 的高性能对象存储网关,自研异步网络编程框架处理大规模并发上传与下载,通过零拷贝与连接复用将单机吞吐提升至 2.5 Gbps,支撑日均数十亿次对象读写。
构建实时图片处理服务,集成裁剪、缩放与水印等常用流水线,利用共享内存缓存热点文件减少重复解码开销,将图片变换 P99 延迟控制在 50 ms 以内,日处理图片超 3 亿张。
主导冷热分层存储策略设计,结合访问频率与文件年龄自动将对象迁移至低成本存储层,冷数据沉降准确率超过 92%,存储成本降低约 35%。
对底层存储引擎进行 Linux 内核参数及 I/O 调度优化,消除高负载下的写放大与长尾延迟,将突发流量场景下服务可用性从 99.9% 提升至 99.99%。
作为核心开发参与构建微服务治理平台,基于 Java 与 Spring Cloud 生态设计并落地分布式限流熔断体系,在统一网关日均数百亿次调用场景下,将突发流量引发的系统雪崩恢复时间从分钟级压缩至 30 秒以内。
主导分布式全链路追踪系统建设,通过定制化 SDK 与中间件改造实现跨 2,000+ 服务节点的调用链透传,追踪覆盖率由 40% 提升至 98%,推动跨服务平均故障定位时间从 25 分钟降至 5 分钟。
引入 Redis + 滑动窗口实现动态扩缩容的流量控制策略,支撑核心链路季度内零重大故障,并在多次大促中保障系统 SLO 达标率 99.99%。
基于追踪数据构建服务依赖拓扑与实时性能视图,反向驱动 30+ 高延迟节点治理与循环依赖解耦,整体 P99 延迟下降约 40%。
主导基于 Java 的事件驱动订单状态引擎重构,将原先 MySQL 强耦合的同步状态机改造为消息队列异步解耦架构,支撑日均 1500 万+ 订单平稳流转,状态更新 P99 延迟从 200 ms 降至 50 ms。
针对订单热点表的读写瓶颈,设计 Caffeine + Redis 多级缓存与异步批量刷盘策略,将核心服务单机吞吐从 1200 TPS 提升至 8000 TPS,同时降低数据库写压力 70%。
主持分库分表平滑迁移项目,设计基于 Binlog 监听与灰度路由的在线迁移方案,完成数十亿历史订单数据的无感切换,全程零停机、零数据不一致。
构建准实时的分布式状态对账与自动补偿框架,实现 5 分钟内全量扫描与不一致修复,订单状态异常率控制在十万分之一以下,保障高并发下的最终一致性。
从零主导机器学习 Pipeline 服务化平台建设,基于 FastAPI 与 gRPC 设计统一推理接入网关,支撑日均超 1.2 亿次异构模型调用,P99 推理延迟由上线初 200 ms 降至 6 ms 以内。
借助 Kubernetes 与 Docker 构建模型服务容器化编排体系,实现推理节点秒级弹性伸缩与混合部署,GPU 集群资源利用率提升 35%,年化硬件成本降低约 260 万元。
设计多阶段流水线编排引擎与灰度发布流程,串联模型注册、验证、部署与切换,将模型上线周期从平均 3 天压缩至 4 小时,发布效率提升 18 倍。
落地全链路监控与根因定位体系,结合 Pod 级健康探针与自动摘流策略,平台上线后持续保持 99.99% 推理服务可用性,关键业务零 SLA 违约。
针对跨地域多活容灾需求,基于 Raft 共识协议设计并落地多数据中心状态同步架构,统一管理风控规则与配置的强一致性分发,经混沌工程全链路注入验证,实现机房级故障自动切换 < 8 秒、数据零丢失。
主导分布式风控系统核心链路架构升级,使用 Go 重构规则评估与特征聚合服务,引入一致性哈希与本地缓存,单节点处理能力提升至 8 万 QPS,P99 决策延迟从 35 ms 降至 3 ms。
构建混沌工程演练平台与标准流程,沉淀网络分区、时钟偏移、磁盘故障等 30+ 原子场景,集成 Prometheus 多维度红线告警,常态化演练中发现并根治 9 个深层次分布式时序与共识缺陷,系统季度不可用时长减少 98%。
设计基于消息日志的异步复制与自动冲突解决策略,实现多数据中心间风控事件与黑名单数据的秒级同步,非计划停机场景下 RPO < 100 条,RTO < 30 秒。
建立面向容灾架构的可观测体系,自定义 Prometheus 指标与 Grafana 看板量化各数据中心健壮度得分,推动全链路压测与容灾预案自动化,支撑系统平稳通过 3 次大规模突发流量冲击。
项目经历
主导从 0 到 1 设计公司级实时日志与可观测平台,构建 Kafka + Flink + Elasticsearch 流式处理链路,统一接入 200+ 微服务日均 60 TB 级日志,将全链路日志检索延迟从分钟级降至秒级。
基于 Flink CEP 与多维指标动态基线重构业务告警引擎,联动 Prometheus 与 Grafana,使核心交易异常检测到通知触达延迟缩短至 200 ms 以内,误报率较传统阈值规则降低 80%。
设计并落地基于 Prometheus 指标驱动的自动扩缩容体系,通过 Flink 流式预聚合与自定义 Controller 协同,在流量突发 10 倍时实现服务副本 30 秒内自动弹性扩容,资源利用率提升 35%。
搭建全局可观测驾驶舱,深度整合 Elasticsearch 日志与 Prometheus 指标,实现毫秒级根因关联定位,并将系统 SLA 提升至 99.99%。
面对算法团队日均数十次模型迭代与多版本并行验证需求,主导设计高可扩展的模型部署平台,将 TensorFlow Serving 封装为标准化 gRPC 推理服务,并利用 Redis 实现模型版本元数据与路由规则的实时分发,使模型上线时长从 18 小时压缩至 30 分钟。
基于 Kubernetes 与 Istio 构建多版本推理服务网格,通过 Istio DestinationRule 定制按权重、请求特征及用户群的智能流量调度,支撑 40+ 模型版本同时在线,实现自动化金丝雀发布与灰度切流,模型变更故障率降低 85%。
设计多维弹性伸缩体系,将推理 QPS、GPU 利用率等自定义指标接入 Prometheus 并驱动 HPA,配合节点亲和策略优化混合负载调度,将集群平均资源利用率从 42% 提升至 68%,同时 P99 推理延迟稳定在 80 ms 以内。
沉淀模型上线治理规范与流量回滚预案,在无需人工介入的情况下实现异常版本 30 秒内自动回切,年支撑超 2000 次模型上线,保障推荐与 NLP 主线业务的高可用迭代。
教育经历
专业技能
荣誉奖项
主导订单引擎重构,将系统可用性提升至99.99%。
向Apache Kafka等中间件提交多项优化补丁并被社区合并。
示例数据,仅供参考
换个风格试试
挑一个喜欢的风格,一键创建你的简历









































