陈启铭 · C&C++
个人总结
9 年 C++ 后端开发经验,专注高性能分布式系统与 AI 推理工程化,从核心算子优化到大规模调度架构,持续驱动系统吞吐量提升与稳定性保障。
主导 AI 推理服务核心重构,通过计算图编译优化与 CUDA Kernel 融合,使端到端推理延迟降低 40%,集群吞吐量提升至 2.5 倍,平稳支撑日均百亿级请求。
设计并落地统一异构资源框架与 GPU 显存管理器,消除硬件碎片化瓶颈,GPU 利用率从不足 45% 提升至 70% 以上,新硬件接入周期从天级压缩至小时级。
工作经历
主导 AI 推理服务平台核心模块 C++17 重构,设计计算图编译期多级优化与算子融合策略,结合 TensorRT 与手写 CUDA Kernel,将主流模型端到端推理延迟降低 40%,平稳支撑日均超百亿级请求。
搭建基于 gRPC 异步流式调用的分布式调度层,实现跨节点模型副本的智能路由与弹性扩缩,消除热点与长尾,推动集群整体吞吐量较重构前提升 2.5 倍。
构建 Python 驱动的自动化性能回归与模型交付流水线,集成量化校准、精度对比与压测,将新模型从调试到生产上线的周期由数周压缩至半天。
设计大页内存池与请求动态批处理机制,结合显存-主机内存零拷贝路径,单卡 GPU 显存占用降低约 30%,在同等硬件下支撑更高并发与更大模型实例。
推动推理服务可观测性体系建设,搭建基于 Prometheus 的分级指标与分布式追踪体系,精准定位并修复 10 余个系统级性能瓶颈,保障 99.9% 服务可用性。
针对异构设备(CPU/GPU/NPU)编程模型碎片化问题,主导设计并落地统一资源抽象框架,采用 C++14/17 结合 CUDA 驱动封装,将设备内存、计算队列与算子调用标准化为设备无关的图描述,使业务接入新硬件周期从天级缩短至小时级。
为支撑大规模混部调度,构建基于异步消息队列的分布式协同通道,结合 Linux 内核参数调优(巨页、SO_REUSEPORT、CPU 隔离)与零拷贝通信,将任务分发与节点间协调时延控制在亚毫秒内。
自研 GPU 显存与流管理器,实现多级缓存、分块预取与复用策略,消除频繁分配与碎片化瓶颈,使得典型在线/离线混合负载下 GPU 核心利用率从不足 45% 提升至 70% 以上。
引入多维度资源画像与动态负载感知,通过内核 cgroup/NUMA 绑核强制隔离关键路径,结合优先级抢占与碎片在线整理,最终推动集群整体资源利用率提升 35%(从 40% → 54%),并保证高优任务 P99 时延稳定。
诊断订单履约链路串行阻塞点,重构状态机并引入 C++11 线程池与无锁队列,将核心路径处理时延从 >2s 降至 50ms 以内,支撑大促峰值平稳。
设计基于 Kafka 的实时事件管道,解耦订单、库存与通知模块,实现消息异步投递与多消费者协同,日均处理数十亿消息且端到端延迟 <100ms。
利用 Redis 构建库存热点缓存与分布式锁,结合 Pipeline 批量操作,将库存扣减 QPS 上限从 3 万提升至 12 万以上,保障抢购场景数据强一致。
针对 Linux 环境进行深度性能调优,通过 perf/eBPF 定位 STL 容器与内存分配瓶颈,优化数据局部性,整体 CPU 占用降低约 35%。
主导模块多线程模型改造,规避锁竞争与伪共享,使系统吞吐量提升 4 倍,P99 延迟波动控制在 ±5% 以内,并沉淀为团队编码规范。
主导 IMS 核心网元 SIP 协议栈重构,采用 C++11 与多线程模型重写事务管理层,将单板呼叫处理能力从 800 CAPS 提升至 5000 CAPS 以上,满足运营商现网高并发要求。
设计并实现基于对象池与零拷贝的内存管理策略,消除 SIP 消息频繁解析引发的内存碎片与分配开销,将控制面单条消息处理时延控制在 200 微秒以内。
负责核心网元主备容灾倒换模块开发,通过会话状态实时同步与异常检测机制,实现主备切换时零呼叫中断,连续通过现网 72 小时严苛拷机与故障注入测试。
深入解决现网偶发信令风暴场景下的对话状态机死锁缺陷,引入超时仲裁与状态回滚机制,将系统长时间运行可用性从 99.9% 提升至 99.999%。
为满足运营商现网协议一致性测试,开发可扩展 SIP 头域解析引擎与合规校验框架,覆盖 200+ 测试用例,一次性通过中国电信现网入网认证测试。
针对订单匹配模块在集中撮合时产生的时延尖刺,重构核心订单簿数据结构,采用红黑树与哈希表混合索引替代原有线性扫描,将平均匹配耗时从 120μs 压缩至 35μs,保障单日千万级交易平稳处理。
基于 Linux 实时调度与 CPU 亲和性绑定,设计多生产者单消费者无锁订单队列,消除高并发下锁竞争导致的尾延迟抖动,将匹配链路 P99 延迟从 800μs 降至 180μs 以内。
为交易引擎搭建订单回放与微基准测试框架,利用 C++ 模板和策略模式实现多市场规则快速切换,将新策略的验证上线周期从 2 天缩短至 4 小时。
自研内存管理组件,引入对象池与预分配机制消除高频路径上的动态分配,降低 L3 cache miss 率并减少内存碎片,推动整体吞吐量提升 15%。
项目经历
针对 AI 平台推理任务在多 GPU/NPU 间手动分区效率低下的痛点,从零设计异构任务调度器,基于 C++17 与 CUDA 抽象统一资源池,对接 TensorFlow Serving 并实现算子级自动并行编排,消除硬件差异带来的部署瓶颈。
主导调度算法设计,构建代价模型驱动的图分割策略,结合计算-通信开销估算和拓扑感知,将模型自动拆解为最优并行子图并动态分发至不同加速器,彻底摆脱人工负载评估,部署流程从“多天专家调参”压缩为“一键提交数小时内完成”。
落地后典型千亿参数模型部署效率提升约 3.2 倍(上线耗时从 8.3 小时降至 2.5 小时),同时在线推理性能波动显著收窄,保障生产级 SLA 并有效控制硬件碎片化损耗。
作为技术负责人带领 3 人小组制定调度器演进路线,沉淀可复用算子库与自适应策略框架,支撑平台快速纳管多代次加速芯片,使模型上线新硬件的适配人力降低 70% 以上。
针对流计算拓扑中算子频繁创建临时对象与虚函数调用开销,基于 C++11 移动语义与模板特化重构算子执行链,消除堆分配与动态派发,核心算子吞吐量提升至原来的 3.2 倍,CPU 占有率下降约 30%。
主导状态后端由纯内存存储迁移至 RocksDB,设计分级冷热数据缓存及增量 Checkpoint 机制,在保障 Exactly-Once 语义的前提下将可用状态空间扩展至 TB 级,故障恢复时间从分钟级压缩至 20 秒内。
重新设计 Kafka 多源流接入模块,采用分区绑定与无锁队列实现多线程并行消费,结合水位线对齐消除数据倾斜,支撑双 11 峰值百万条/秒消息处理,全链路端到端延迟稳定在 50ms 以下。
实现一套基于滑动窗口的增量聚合与可容错去重算子,利用 C++11 chrono 与定长环形缓冲区精准控制窗口推进,使大促实时看板中数百项业务指标的更新延迟低于 1 秒,全程零数据丢失。
构建算子级背压控制与资源隔离策略,通过异步状态写入流水线和 Kafka 消费限流动态匹配下游处理能力,避免大促流量冲击下的 OOM 与消息积压,集群吞吐抖动从 ±40% 收窄至 ±5%。
针对原网关单机仅承载数千连接且频繁 OOM 的问题,主导设计基于 epoll + 非阻塞 I/O 的单线程事件驱动架构,用 C++11 实现异步 TCP/UDP 通信层,单机稳定支撑 10 万+ 同时在线长连接,连接建立耗时下降 60%。
自研轻量级二进制应用层协议,引入零拷贝与对象池机制,替代 JSON 文本协议,单消息平均处理延迟从 2.1ms 压缩至 180μs,千兆网卡带宽利用率提升至 92%。
设计多级时间轮定时器与心跳状态机,结合平滑断线重连策略,将网络抖动场景下的会话假死率控制在 0.02% 以下,系统平均无故障运行时间提升至 99.99%。
构建链路级监控与异步日志子系统,以无损采样方式采集每连接收发队列深度、系统调用耗时等指标,使毛刺定位耗时从天级缩短至分钟级,全年零 P0 事故。
教育经历
专业技能
荣誉奖项
主导AI推理框架优化,使服务成本降低30%,获公司级技术突破个人奖。
向开源分布式项目提交核心PR,被社区评选为年度活跃贡献者。
因实时流处理引擎性能优化成绩显著,获事业部年度优秀工程师称号。
示例数据,仅供参考
换个风格试试
挑一个喜欢的风格,一键创建你的简历

















































