陈启铭 · C/C++ Developer

中文·tech #后端开发 #技术专家
陈启铭
资深C++后端开发专家
150 0000 1111zhaoliu@example.comzhaoliu杭州
github.com/username
1987-03在职-看机会30K-50K
汉族中共党员江苏南京已婚

个人总结

9 年 C++ 后端开发经验,专注高性能分布式系统与 AI 推理工程化,从核心算子优化到大规模调度架构,持续驱动系统吞吐量提升与稳定性保障。

  • 主导 AI 推理服务核心重构,通过计算图编译优化与 CUDA Kernel 融合,使端到端推理延迟降低 40%,集群吞吐量提升至 2.5 倍,平稳支撑日均百亿级请求。

  • 设计并落地统一异构资源框架与 GPU 显存管理器,消除硬件碎片化瓶颈,GPU 利用率从不足 45% 提升至 70% 以上,新硬件接入周期从天级压缩至小时级。

工作经历

高级C++开发工程师某互联网大厂
2023-05 - 至今
高级C++开发工程师|AI平台部
  • 主导 AI 推理服务平台核心模块 C++17 重构,设计计算图编译期多级优化与算子融合策略,结合 TensorRT 与手写 CUDA Kernel,将主流模型端到端推理延迟降低 40%,平稳支撑日均超百亿级请求。

  • 搭建基于 gRPC 异步流式调用的分布式调度层,实现跨节点模型副本的智能路由与弹性扩缩,消除热点与长尾,推动集群整体吞吐量较重构前提升 2.5 倍。

  • 构建 Python 驱动的自动化性能回归与模型交付流水线,集成量化校准、精度对比与压测,将新模型从调试到生产上线的周期由数周压缩至半天。

  • 设计大页内存池与请求动态批处理机制,结合显存-主机内存零拷贝路径,单卡 GPU 显存占用降低约 30%,在同等硬件下支撑更高并发与更大模型实例。

  • 推动推理服务可观测性体系建设,搭建基于 Prometheus 的分级指标与分布式追踪体系,精准定位并修复 10 余个系统级性能瓶颈,保障 99.9% 服务可用性。

C++17TensorRTCUDAgRPC分布式调度性能优化Python
资深C++后端开发某AI计算平台
2020-08 - 2023-04
资深C++后端开发|分布式计算组
  • 针对异构设备(CPU/GPU/NPU)编程模型碎片化问题,主导设计并落地统一资源抽象框架,采用 C++14/17 结合 CUDA 驱动封装,将设备内存、计算队列与算子调用标准化为设备无关的图描述,使业务接入新硬件周期从天级缩短至小时级。

  • 为支撑大规模混部调度,构建基于异步消息队列的分布式协同通道,结合 Linux 内核参数调优(巨页、SO_REUSEPORT、CPU 隔离)与零拷贝通信,将任务分发与节点间协调时延控制在亚毫秒内。

  • 自研 GPU 显存与流管理器,实现多级缓存、分块预取与复用策略,消除频繁分配与碎片化瓶颈,使得典型在线/离线混合负载下 GPU 核心利用率从不足 45% 提升至 70% 以上。

  • 引入多维度资源画像与动态负载感知,通过内核 cgroup/NUMA 绑核强制隔离关键路径,结合优先级抢占与碎片在线整理,最终推动集群整体资源利用率提升 35%(从 40% → 54%),并保证高优任务 P99 时延稳定。

C++14/17CUDA分布式系统消息队列Linux内核调优
C++开发工程师头部电商平台
2018-06 - 2020-07
C++开发工程师|基础架构部
  • 诊断订单履约链路串行阻塞点,重构状态机并引入 C++11 线程池与无锁队列,将核心路径处理时延从 >2s 降至 50ms 以内,支撑大促峰值平稳。

  • 设计基于 Kafka 的实时事件管道,解耦订单、库存与通知模块,实现消息异步投递与多消费者协同,日均处理数十亿消息且端到端延迟 <100ms。

  • 利用 Redis 构建库存热点缓存与分布式锁,结合 Pipeline 批量操作,将库存扣减 QPS 上限从 3 万提升至 12 万以上,保障抢购场景数据强一致。

  • 针对 Linux 环境进行深度性能调优,通过 perf/eBPF 定位 STL 容器与内存分配瓶颈,优化数据局部性,整体 CPU 占用降低约 35%。

  • 主导模块多线程模型改造,规避锁竞争与伪共享,使系统吞吐量提升 4 倍,P99 延迟波动控制在 ±5% 以内,并沉淀为团队编码规范。

C++11STL多线程RedisKafkaLinux
C++软件工程师某通信设备集团
2016-07 - 2018-05
C++软件工程师|核心网研发部
  • 主导 IMS 核心网元 SIP 协议栈重构,采用 C++11 与多线程模型重写事务管理层,将单板呼叫处理能力从 800 CAPS 提升至 5000 CAPS 以上,满足运营商现网高并发要求。

  • 设计并实现基于对象池与零拷贝的内存管理策略,消除 SIP 消息频繁解析引发的内存碎片与分配开销,将控制面单条消息处理时延控制在 200 微秒以内。

  • 负责核心网元主备容灾倒换模块开发,通过会话状态实时同步与异常检测机制,实现主备切换时零呼叫中断,连续通过现网 72 小时严苛拷机与故障注入测试。

  • 深入解决现网偶发信令风暴场景下的对话状态机死锁缺陷,引入超时仲裁与状态回滚机制,将系统长时间运行可用性从 99.9% 提升至 99.999%。

  • 为满足运营商现网协议一致性测试,开发可扩展 SIP 头域解析引擎与合规校验框架,覆盖 200+ 测试用例,一次性通过中国电信现网入网认证测试。

C++98/11SIP协议多线程网络编程内存管理
C++初级开发某金融科技公司
2015-03 - 2016-06
C++初级开发|交易系统部
  • 针对订单匹配模块在集中撮合时产生的时延尖刺,重构核心订单簿数据结构,采用红黑树与哈希表混合索引替代原有线性扫描,将平均匹配耗时从 120μs 压缩至 35μs,保障单日千万级交易平稳处理。

  • 基于 Linux 实时调度与 CPU 亲和性绑定,设计多生产者单消费者无锁订单队列,消除高并发下锁竞争导致的尾延迟抖动,将匹配链路 P99 延迟从 800μs 降至 180μs 以内。

  • 为交易引擎搭建订单回放与微基准测试框架,利用 C++ 模板和策略模式实现多市场规则快速切换,将新策略的验证上线周期从 2 天缩短至 4 小时。

  • 自研内存管理组件,引入对象池与预分配机制消除高频路径上的动态分配,降低 L3 cache miss 率并减少内存碎片,推动整体吞吐量提升 15%。

C++算法STLLinux低延迟

项目经历

技术负责人分布式异构计算框架
2021-02 - 2023-01
技术负责人|某AI计算平台
  • 针对 AI 平台推理任务在多 GPU/NPU 间手动分区效率低下的痛点,从零设计异构任务调度器,基于 C++17 与 CUDA 抽象统一资源池,对接 TensorFlow Serving 并实现算子级自动并行编排,消除硬件差异带来的部署瓶颈。

  • 主导调度算法设计,构建代价模型驱动的图分割策略,结合计算-通信开销估算和拓扑感知,将模型自动拆解为最优并行子图并动态分发至不同加速器,彻底摆脱人工负载评估,部署流程从“多天专家调参”压缩为“一键提交数小时内完成”。

  • 落地后典型千亿参数模型部署效率提升约 3.2 倍(上线耗时从 8.3 小时降至 2.5 小时),同时在线推理性能波动显著收窄,保障生产级 SLA 并有效控制硬件碎片化损耗。

  • 作为技术负责人带领 3 人小组制定调度器演进路线,沉淀可复用算子库与自适应策略框架,支撑平台快速纳管多代次加速芯片,使模型上线新硬件的适配人力降低 70% 以上。

C++17CUDA异构计算调度算法TensorFlow Serving
核心开发者实时流处理引擎
2019-03 - 2020-05
核心开发者|头部电商平台
  • 针对流计算拓扑中算子频繁创建临时对象与虚函数调用开销,基于 C++11 移动语义与模板特化重构算子执行链,消除堆分配与动态派发,核心算子吞吐量提升至原来的 3.2 倍,CPU 占有率下降约 30%。

  • 主导状态后端由纯内存存储迁移至 RocksDB,设计分级冷热数据缓存及增量 Checkpoint 机制,在保障 Exactly-Once 语义的前提下将可用状态空间扩展至 TB 级,故障恢复时间从分钟级压缩至 20 秒内。

  • 重新设计 Kafka 多源流接入模块,采用分区绑定与无锁队列实现多线程并行消费,结合水位线对齐消除数据倾斜,支撑双 11 峰值百万条/秒消息处理,全链路端到端延迟稳定在 50ms 以下。

  • 实现一套基于滑动窗口的增量聚合与可容错去重算子,利用 C++11 chrono 与定长环形缓冲区精准控制窗口推进,使大促实时看板中数百项业务指标的更新延迟低于 1 秒,全程零数据丢失。

  • 构建算子级背压控制与资源隔离策略,通过异步状态写入流水线和 Kafka 消费限流动态匹配下游处理能力,避免大促流量冲击下的 OOM 与消息积压,集群吞吐抖动从 ±40% 收窄至 ±5%。

C++11流计算KafkaRocksDB性能调优
后端主程内部IM系统网关
2017-01 - 2018-04
后端主程|某通信设备集团
  • 针对原网关单机仅承载数千连接且频繁 OOM 的问题,主导设计基于 epoll + 非阻塞 I/O 的单线程事件驱动架构,用 C++11 实现异步 TCP/UDP 通信层,单机稳定支撑 10 万+ 同时在线长连接,连接建立耗时下降 60%。

  • 自研轻量级二进制应用层协议,引入零拷贝与对象池机制,替代 JSON 文本协议,单消息平均处理延迟从 2.1ms 压缩至 180μs,千兆网卡带宽利用率提升至 92%。

  • 设计多级时间轮定时器与心跳状态机,结合平滑断线重连策略,将网络抖动场景下的会话假死率控制在 0.02% 以下,系统平均无故障运行时间提升至 99.99%。

  • 构建链路级监控与异步日志子系统,以无损采样方式采集每连接收发队列深度、系统调用耗时等指标,使毛刺定位耗时从天级缩短至分钟级,全年零 P0 事故。

C++11epollTCP/UDP协议设计异步IO

教育经历

浙江大学计算机科学与技术学院计算机科学与技术硕士GPA: 3.8/4.0
2013-09 - 2016-03

专业技能

C++
9/10
精通
CUDA/异构计算
9/10
精通
分布式系统设计
9/10
精通
高性能网络编程
9/10
精通
系统性能调优
9/10
精通
流计算与消息中间件
7/10
熟练
机器学习推理部署
7/10
熟练

荣誉奖项

某互联网大厂年度技术突破奖honor
2024

主导AI推理框架优化,使服务成本降低30%,获公司级技术突破个人奖。

开源贡献者奖章honor
2022

向开源分布式项目提交核心PR,被社区评选为年度活跃贡献者。

头部电商平台优秀工程师honor
2019

因实时流处理引擎性能优化成绩显著,获事业部年度优秀工程师称号。

Sample data, for reference only