张明 · C&C++
个人总结
张明,资深C/C++后端开发工程师,拥有5年从底层网络库到AI推理引擎的全栈高性能系统构建经验,始终以极致性能与系统稳定性为追求。主导设计基于epoll/io_uring的无锁事件队列与work-stealing线程池,实现单机12万并发连接、RPC延迟降至1.8ms;在分布式KV存储与AI推理领域,通过零拷贝、SIMD、CUDA量化等手段将随机写入QPS提升至25万、推理延迟压缩67%。擅长C++并发编程、高性能网络与存储引擎优化,精通性能调优与GPU加速,多次在千亿级请求场景下实现吞吐量倍增与资源成本显著降低。
核心成就:重构多路复用I/O模型,并发连接突破12万,RPC延迟降低64%;主导AI推理引擎,INT8量化使延迟从45ms降至12ms,吞吐提升4.2倍。
关键技术:C++14/17、无锁数据结构、RocksDB优化、CUDA/TensorRT、零拷贝、eBPF性能分析。
工作经历
主导基于epoll的多路复用I/O模型重构,设计无锁事件队列与work-stealing线程池,使单机并发连接数突破12万,平均RPC延迟从5ms降至1.8ms,吞吐量提升2.3倍。
引入零拷贝序列化机制(共享内存+内存映射),结合C++11移动语义消除冗余拷贝,序列化/反序列化耗时减少65%,框架在高负载下CPU使用率下降30%。
实现自适应连接池与加权负载均衡策略,基于实时延迟和错误率动态调整路由,服务可用性从99.5%提升至99.995%,线上故障自动恢复时间缩短至秒级。
重构框架核心链路,采用C++14泛型编程与RAII封装底层epoll操作,用户代码量减少40%,同时单次RPC调用内存分配次数从10次降至1次。
设计并实现支持多协议扩展的编解码层,兼容Protobuf与自定义二进制协议,通过编译期多态将协议切换开销降低至纳秒级,迭代效率提升3倍。
针对分布式KV存储系统的RocksDB存储引擎,通过gperftools定位写入放大瓶颈,重构Compaction策略并引入分层缓存机制,将随机写入吞吐量从12万QPS提升至25万QPS,P99延迟降低58%。
基于一致性哈希算法设计动态数据分片模块,解决集群扩缩容时的数据倾斜问题,在16节点下线场景下实现单次迁移数据量不超过总数据量的3%,且服务无中断。
主导核心读写路径的零拷贝优化,利用RDMA与多线程无锁队列,将跨机房读取延迟从8ms压缩至2.3ms,并支撑日均千亿次请求的稳定运行。
为RocksDB实现定制化Bloom过滤器与前缀压缩,在8核CPU环境下将热点数据查询的P999延迟从120μs降至45μs,同时降低20%的磁盘I/O开销。
设计基于gperftools的自动化性能监控与火焰图分析工具,定位并发控制中的锁竞争热点,通过细粒度读写锁重构将整体系统吞吐量提升110%。
主导AI推理引擎C++实现,基于CUDA与TensorRT重构核心算子并引入INT8量化,将模型推理延迟从45ms降至12ms,吞吐量提升4.2倍,支撑线上业务QPS突破30万。
设计分级内存池管理方案,通过预分配与线程本地缓存减少显存碎片,GPU显存碎片率从28%降至3%,支持同一节点同时承载6个不同模型实例的稳定部署。
利用SIMD指令集重写CPU端前/后处理流水线(图像预处理、张量归一化),单核处理能力从800 QPS提升至2400 QPS,整体推理端到端延迟降低37%。
实现自适应动态批处理器,结合请求到达率与GPU剩余显存实时合并批次,在P99延迟<50ms约束下将GPU平均利用率从45%拉升至92%,硬件成本节约55%。
研发混合精度自动量化校准算法,在模型精度损失<0.5%条件下压缩模型体积65%,同时将INT8/FP16混合推理速度提升3.8倍,加速模型迭代上线周期。
项目经历
针对IM系统日均百亿级消息量且要求端到端延迟<10ms的场景,主导设计基于异步IO(epoll+io_uring)的消息队列内核,采用无锁环形缓冲区与细粒度分区锁消除热点竞争,最终支撑200万并发长连接,P99延迟从15ms降至4ms。
为解决定时消息与延迟投递的高精度需求,引入层级时间轮算法替代传统定时器堆,通过多级时间轮桶减少锁争用并降低定时器插入/取消的时间复杂度至O(1),在百万级并发下定时任务触发误差控制在±1ms内,系统吞吐量提升2.5倍。
针对消息持久化与消费确认的可靠性要求,实现基于预写日志(WAL)与批量化刷盘的异步写入策略,结合零拷贝技术减少用户态与内核态切换,使得单节点写入吞吐突破80万TPS(消息大小1KB),同时保证宕机恢复后消息不丢失。
通过自研内存池与对象池减少动态分配开销,重构锁机制为读写锁+RCU方案,在消息路由分发环节将CPU缓存命中率从62%优化至89%,单机QPS从30万提升至72万,资源消耗降低40%。
针对订单履约平台原有延迟任务调度器因大量定时任务堆积导致吞吐瓶颈(约800 TPS),主导其C++17重构:采用最小堆定时器管理任务过期队列,并借鉴Go调度器模型实现多线程工作窃取与协作式抢占,将任务调度粒度从毫秒级降至微秒级。
重新设计任务优先级与超时触发机制,利用C++17的
std::variant与std::optional统一管理延迟/周期两种任务类型,消除动态内存分配带来的锁竞争,使单机吞吐量从800 TPS提升至2400 TPS(3倍)。引入分层时间轮与最小堆组合结构,将定时器插入与取消操作的均摊时间复杂度从O(log n)优化至O(1),同时保持超时扫描的精确性,使得在50万并发任务场景下调度延迟稳定低于5μs。
通过自研基于eBPF的CPU profiling工具定位调度器内部瓶颈,将goroutine风格的任务窃取逻辑改为无锁双端队列(LCRQ),最终达到85%的CPU利用率,相比旧版提升45个百分点,且P99延迟从120ms降至28ms。
为开源高性能日志库设计并实现基于mmap的异步写入架构,引入多级环形缓冲区与无锁队列,在16核服务器上实现每秒500万条日志写入,写入延迟降低52%。
集成LZ4压缩算法并优化分片存储策略,压缩比达到4:1,存储占用减少70%,同时写入性能仅下降不到5%,满足高吞吐与低成本双重要求。
开发模块化的API与自定义过滤器,支持多目标输出和动态配置,项目被3个内部团队采用,日志集成开发时间缩短40%。
实现异步刷盘与故障恢复机制,通过模拟断电和压力测试验证,在异常场景下实现零数据丢失,成为团队日志基础设施的核心组件。
为支撑实时数据清洗与特征工程,基于DAG模型设计流式处理引擎,通过共享内存区域实现零拷贝跨节点传递,结合MPSC无锁队列消除锁竞争,单节点峰值吞吐达120万条/秒,延迟抖动低于5微秒。
引入动态拓扑能力,支持在线增删处理节点而无需停服,利用版本化DAG快照与两阶段提交保证数据一致性,实现毫秒级拓扑切换,生产环境中连续运行30天无数据丢失。
针对CPU流水线特性,将算子拆分为预取、计算、提交三级流水线,并通过CPU亲和性与NUMA感知绑定核心,减少缓存颠簸,使同规格机器吞吐提升2.8倍。
设计共享内存池与环形缓冲区管理器,复用内存块避免频繁分配/释放,内存碎片率降至0.3%以下,同时支持自适应水位调控,在背压场景下保证系统稳定。
基于无锁原子操作实现节点间状态同步与负载均衡,在64核服务器上线性扩展到满核,吞吐随核心数线性增长,P99延迟始终控制在10毫秒以内。
教育经历
专业技能
荣誉奖项
表彰在分布式存储系统性能优化中的突出贡献
独立开发的高性能日志库获得社区认可
示例数据,仅供参考
换个风格试试
挑一个喜欢的风格,一键创建你的简历

















































