不繁简历

林远 · web后端开发工程师

中文·tech #后端开发 #资深后端工程师
林远
资深Web后端开发工程师
188 8888 8888zhangsan@example.comzhangsan杭州
github.com/username
1986-06在职-看机会30K-50K
汉族中共党员浙江杭州已婚

个人总结

拥有 5 年从金融科技到 AI 创新业务的后端研发经验,长期专注于高可用分布式系统与数据密集型后端架构,习惯从业务价值出发,拆解复杂问题并交付确定性结果。技术栈覆盖 Go、Java、Kubernetes、流式计算及高性能中间件,在千卡级 AI 训练平台、千万并发信令中台、百亿级实时数据管道等场景中,多次将核心链路延迟压缩一个数量级,并把系统可用性稳定在 99.99%。

  • 在头部 AI 公司主导训练平台微服务重构与故障自愈体系,将 GPU 利用率从 62% 提升至 88%,千卡训练有效时长占比提升至 99.5%,并推动可观测性建设,年均节省算力成本约 320 万。

  • 主导实时数据管道架构升级,基于 Flink + ClickHouse 落地存算分离方案,单集群承载日均 120 亿事件,处理成本降低 60%,端到端可观测延迟从分钟级压缩至秒级,管道可用性达到 99.99%。

工作经历

后端开发工程师头部AI公司
2022-04 - 至今
后端开发工程师|AI平台研发部
  • 主导训练平台后端微服务化重构,将单体调度与存储模块拆分为 20+ 个 Go 微服务,基于 gRPC 与 Kubernetes 原生调度扩展,实现千卡级训练任务的毫秒级调度决策,GPU 利用率由 62% 提升至 88%,单集群最大并行训练任务数翻倍。

  • 设计并落地大规模模型存储分层架构,结合高性能分布式文件系统与元数据缓存中间件,将千亿参数模型的保存与加载吞吐从 1.2 GB/s 提升至 4.8 GB/s,同时支撑 100+ 开发者并发读写,训练中断恢复时间缩短 70%。

  • 自研训练生命周期管理器与故障自愈中间件,基于 Kubernetes Operator 模式实现任务自动重调度、节点漂移与断点续训,将千卡训练任务的月均非计划中断次数从 12 次降至 1 次以内,有效训练时长占比提升至 99.5%。

  • 构建训练平台统一 API 网关与熔断限流体系,基于 Go 与 Envoy 扩展自定义过滤器,压制突发流量对调度器冲击,保障 5000+ QPS 调度请求在 P99 耗时 < 200ms,全年零严重调度延迟事故。

  • 推动基础设施即代码与可观测性建设,基于 OpenTelemetry 与 Prometheus 构建全链路追踪与 GPU 细粒度指标监控,协助资源治理团队识别并回收低效 GPU 配额,年均节省算力成本约 320 万。

GoKubernetesgRPC分布式存储高性能中间件训练平台
后端开发工程师知名在线教育平台
2020-07 - 2022-03
后端开发工程师|基础架构组
  • 从零主导设计实时音视频交互中台整体架构,基于 Java/Spring Cloud 构建微服务集群与 Netty 自研信令网关,实现千万级直播并发下海量长连接稳定接入,单机连接数突破 15 万。

  • 运用 DDD 梳理信令调度、房间状态与媒体协商等核心域,划分限界上下文并基于 Redis Cluster 落地分布式会话,将跨节点状态同步延迟控制在 5ms 以内,保障高并发下房间状态强一致。

  • 引入 Kafka 构建信令流异步解耦与可靠分发链路,设计分区有序消费与端到端重试策略,达成超千万消息/秒的吞吐能力,信令端到端延迟稳定低于 50ms。

  • 设计包含信号风暴自适应限流、故障节点自动摘除及跨区容灾切换的全链路高可用方案,系统全年可用性达到 99.99%,平稳支撑多次千万级直播高峰流量。

  • 搭建中台统一接入规范与标准化 API,推动多业务线迁移接入,互动类业务研发成本降低约 70%,典型交付周期由周级缩短至天级。

JavaSpring CloudNettyRedis ClusterKafkaDDD
后端开发工程师某金融科技公司
2019-07 - 2020-06
后端开发工程师|支付核心研发部
  • 负责账务与清算模块的分布式事务设计,基于 RocketMQ 事务消息与本地事件表构建跨服务最终一致方案,支撑系统稳定承接日均 3000 万+ 核心流水,上线后零资损故障。

  • 针对流水表数据量急剧增长,设计并落地基于交易日期与商户维度的分库分表策略,结合 Spring Boot 与 ShardingSphere,将单表数据量控制在 2000 万以内,账务写入吞吐从 2500 TPS 提升至 15000+ TPS,平稳度过大促洪峰。

  • 重构日终清算流程,引入 Spring Boot 异步任务与 RocketMQ 解耦,将串行批处理升级为多级并行的准实时清算,使单日清算耗时从 4 小时降至 15 分钟内,大幅缩短资金结算周期。

  • 搭建高可靠自动化对账与差异修复体系,通过 Spring Boot 编排对账服务实现 T+0 自动勾销与冲正,将每日千万级明细的人工对账介入比例降低 95%,差异处理时效从天级压缩至分钟级。

JavaSpring BootMySQL分布式事务RocketMQ分库分表

项目经历

核心开发者分布式任务调度平台(内部开源)
2023-01 - 2023-06
核心开发者
  • 主导平台核心架构设计,基于 etcd 实现 Leader 选举与任务分片,自研秒级 Cron 解析器并内置工作流 DAG 引擎,使平台原生支持定时、依赖编排与回调等复杂调度模式。

  • 设计 Executor 弹性扩缩容机制,依据 CPU/内存/任务堆积等负载指标动态增减 Worker 实例,千台规模下平均资源利用率从 45% 提升至 72%,同时保障百万级任务并发调度延迟 P99 < 200ms。

  • 构建基于 etcd lease 与重试队列的故障自动转移链路,Worker 宕机后任务快速重新分配,转移完成时间控制在 5s 以内,平台全年可用性达 99.99%。

  • 作为核心开发者推动项目在公司内部开源,统一 AI 训练、数据管道与在线服务三个业务线的任务编排方案,累计落地 20+ 场景,节省各团队重复建设投入约 8 人月/年。

GoetcdCron解析器Leader选举工作流引擎
技术负责人实时数据管道
2022-09 - 2022-12
技术负责人
  • 主导某BU日志与指标平台重构,针对Elasticsearch集群写入吞吐瓶颈与存储成本飙升痛点,设计Kafka Streams分流+Flink流式计算+ClickHouse分层存储的存算分离架构,用流式预聚合替代全量索引,将日增数百TB日志的处理资源成本降低60%,端到端可观测延迟从分钟级压缩至秒级。

  • 基于Flink构建高可用日志解析与多维指标聚合引擎,实现动态Schema推断、乱序重排与流表关联,单集群稳定承载日均120亿条事件、峰值300万条/秒的写入,通过端到端exactly-once语义保障关键业务指标零丢失。

  • 利用ClickHouse物化视图与稀疏索引,设计分钟级预聚合宽表,并将聚合结果以Prometheus Remote Write兼容格式透出,无缝对接Grafana看板,支撑业务团队自定义多维度实时监控,核心指标查询P99延迟从原方案20秒降至50毫秒。

  • 建设管道级全链路监控体系,自研Prometheus Exporter暴露Flink算子级背压、Kafka Consumer Lag及ClickHouse Merges性能指标,结合Grafana统一告警,实现从“用户投诉发现”到“亚健康自动预警”的转变,上线后数据管道可用性达到99.99%。

Kafka StreamsFlinkClickHousePrometheusGrafana
后端架构师智能推荐引擎后端服务
2021-04 - 2021-09
后端架构师
  • 针对推荐链路中召回环节向量检索缺失、在线特征服务耦合严重等问题,主导设计并落地基于 Milvus 的分布式向量检索服务,构建十亿级物品向量索引与实时近邻查询能力,将召回层 P99 延迟从 120ms 降至 50ms 以内。

  • 搭建统一特征平台(Feature Store),抽象用户实时行为与离线画像特征的生产、存储与在线服务,利用 Redis 缓存热点特征并通过 FastAPI 发布低延迟查询接口,将特征获取平均耗时降低 70% 以上。

  • 重构排序服务链路,将模型推理与特征拼接拆分为异步流水线,引入本地缓存与多级降级策略,在业务高峰 QPS 翻倍的情况下,端到端推荐服务 P99 延迟下降 40%。

  • 协同算法团队构建全链路 AB 实验框架,实现从流量分层、实验参数配置到效果指标自动回收的闭环,支撑同时在线 20+ 实验,使推荐策略迭代周期从周级缩短至天级。

PythonFastAPIMilvusRedis特征存储AB实验平台
后端核心开发订单履约平台
2019-10 - 2020-03
后端核心开发
  • 参与核心履约状态机设计与重构,将原本分散在多个服务中的隐式流转逻辑统一为可扩展的显式状态图模型,并基于SAGA编排器驱动跨服务事务补偿,使订单在支付、分仓、出库等环节的一致性与异常恢复效率大幅提升,状态同步延迟从秒级压缩到 <100ms。

  • 主导履约主体查询优化,针对大促期间千亿级流水索引与多条件检索瓶颈,设计基于Elasticsearch的二级索引方案,定制索引路由与字段预处理策略,将订单状态、时效等多维组合查询的P99延迟从 >800ms 降至 50ms 以内。

  • 深度参与履约微服务化拆分,将单体“履约中心”解耦为异步消息驱动的订单受理、履单调度与状态同步服务,通过本地消息表与事务反查保证至少一次投递,支撑大促峰值下日均亿级订单流转,单链路吞吐量提升约4倍。

  • 结合性能压测发现状态机持久化热点,通过引入批量写入、状态变更缓存合并与JVM GC调优,将状态演进环节的写TPS从不足5,000提升至20,000+,保障极端流量洪峰时系统零拒绝、零雪崩。

JavaState MachineSAGA事务Elasticsearch性能调优

教育经历

浙江大学计算机科学与技术学院计算机科学与技术硕士GPA: 3.8/4.0
2017-09 - 2019-06

专业技能

Go
9/10
精通
Kubernetes
7/10
熟练
Java
9/10
精通
分布式系统设计
9/10
精通
高性能中间件开发
7/10
熟练
流式计算与实时分析
7/10
熟练
特征工程与向量检索
7/10
熟练
性能调优与可观测性
7/10
熟练

荣誉奖项

公司年度技术突破奖honor
2023

主导开发的分布式任务调度平台大幅提升公司资源利用率。

优秀新人奖honor
2019

入职首年独立交付支付核心模块,并主导双11保障实现全程零故障。

示例数据,仅供参考