张逸轩 · 算法工程师

中文·tech #人工智能 #算法专家
张逸轩
算法专家
186 6666 6666zhangsan@example.comzhangsan北京
github.com/username
1986-06在职-看机会30K-50K
汉族中共党员山东青岛已婚

个人总结

拥有8年互联网与AI算法研发经验,覆盖搜索推荐、NLP、大模型分布式训练与推理优化等方向。主导千亿参数混合并行训练框架,训练吞吐提升2.1倍,千卡训练可用性达99.5%;设计实时推荐与流式对话系统,全链路延迟分别压缩至300ms与80ms以内,驱动GMV与自助解决率大幅提升;从零组建团队打造云端AutoML平台,将交付周期从60天缩短至7天,带来逾2000万年经常性收入。精通MLOps与AutoML体系建设,兼具算法创新与大规模工程落地能力。

工作经历

算法工程师某头部电商平台
2016-07 - 2018-06
算法工程师|搜索推荐事业部
  • 主导搜索排序模型从LR+GBDT升级为注意力双塔深度网络,融合商品标题语义与用户实时行为序列特征,上线后移动端搜索点击率相对提升6.8%,成交转化率提升4.2%。

  • 构建推荐特征工程闭环,设计上线200+维用户多窗口行为与商品属性交叉特征,驱动离线AUC提升3.5%,推荐入口GMV季度环比增长8.3%。

  • 基于TensorFlow实现搜索排序训练加速与模型热更新,将全量训练时长由12小时压缩至2.5小时,支撑每日多轮迭代与策略优化。

  • 搭建搜索推荐A/B实验分析平台,主持40+组排序策略实验,沉淀出从特征筛选、模型增益评估到全量发布的标准流程,推动全年搜索GMV累计提升15.2%。

PythonTensorFlow推荐系统排序学习特征工程
高级算法工程师AI独角兽企业
2018-07 - 2020-08
高级算法工程师|自然语言处理组
  • 主导客服意图识别升级,基于预训练语言模型与PyTorch重构意图分类与槽填充联合模型,多领域意图识别准确率达94.7%,槽位F1达90.2%,驱动机器人自助解决率绝对值提升9个百分点。

  • 设计序列记忆网络的多轮对话状态追踪与策略管理,跨场景任务完成率从63%提升至81%,错误恢复交互轮次平均减少2.3轮。

  • 通过结构化剪枝与知识蒸馏将模型体积压缩至1/5,保持精度97%+,推理延迟降至12ms,支撑日均千万级调用。

  • 搭建Transformer与图神经网络的上下文理解实验范式,统一单轮/多轮意图训练流程,将新场景意图冷启动周期由3周缩短至1周。

深度学习NLPPyTorch序列模型模型压缩
资深算法工程师某互联网大厂
2020-09 - 2022-10
资深算法工程师|基础架构-机器学习平台
  • 主导设计基于PyTorch与C++的混合并行训练框架,融合数据、模型、流水线并行策略,突破显存与通信瓶颈,支撑单模型规模达3000亿参数,端到端训练吞吐较社区最优方案提升2.1倍,成为部门统一训练底座。

  • 针对千卡集群训练可用性仅92%的痛点,研发弹性容错与动态扩缩容机制,实现故障自动恢复,平均恢复时间<3分钟,全年可用性提升至99.5%。

  • 自研通信与算子库,通过NCCL调优、梯度稀疏压缩及计算-通信重叠,将千亿模型单轮耗时降低42%,单季度实验量从200次增至500+次,加速策略迭代。

  • 构建模型并行透明工具链,屏蔽分布式细节,提供一键并行脚本,新模型接入耗时从2周降至3天,已赋能推荐、广告、搜索等10余条业务线。

  • 针对万亿级稀疏特征实时训练,设计分布式Embedding子系统,结合参数服务器与GPU缓存,日均PB级数据下读写延迟<0.5ms,支撑核心特征近实时更新。

分布式训练C++PyTorch模型并行GPU集群
算法专家全球云计算服务商
2022-11 - 至今
算法专家|人工智能与机器学习事业部
  • 作为算法团队负责人,从零组建10人团队打造云端AutoML平台,集成大模型微调、评估与部署,提供Java SDK与低代码编排,将典型方案交付周期从60天压缩至7天,上线首年落地金融、零售等领域60+客户。

  • 主导模型优化引擎,引入量化感知训练、算子融合与动态批处理,在指标无损前提下将大模型推理延迟降低70%,单卡吞吐提升3倍,降低客户算力成本,带动月均活跃付费客户增长35%。

  • 构建全链路MLOps体系,打通特征存储、实验追踪与模型注册,迭代速度从周级提升至日级,月实验量超500次,上线模型缺陷逃逸率下降40%。

  • 提炼行业需求,打造金融核保、零售导购等低代码方案,通过模板与拖拽将概念验证周期从4周缩至1周,推动平台ARR突破2000万元,客户留存率超90%。

AutoML大规模语言模型模型优化JavaMLOps

项目经历

核心贡献者某头部电商平台
2017-01 - 2018-05
核心贡献者
  • 针对大促批处理推荐延迟高、个性化弱,主导基于Flink的实时推荐引擎重构,全链路延迟从分钟级降至300ms以内,实现实时感知与即时响应。

  • 构建流式样本拼接与在线学习环路,整合多源实时数据流,实现模型小时级增量更新,上线后CTR相对离线日更提升11%,大促峰值GMV同比提升8%。

  • 设计实时热度与短期兴趣信号,融合双塔召回与轻量级排序模型,新商品冷启曝光效率提升2.3倍,热门商品库存消耗均匀度优化25%。

  • 推动引擎灰度到全量发布,支撑亿级用户高并发推理,服务P99延迟<50ms,全年零重大故障。

实时计算Flink在线学习推荐算法
项目负责人AI独角兽企业
2019-03 - 2020-06
项目负责人
  • 主导千万级日活流式多轮对话平台架构,针对流式语音断句模糊与意图跳变,提出低延迟增量解码与动态注意力掩码,平均语义理解延迟<80ms,端到端流式P99<120ms。

  • 将意图识别与槽填充模型基于TensorRT INT8量化部署至T4,单卡实现2000+QPS,推理成本降低60%,支撑春节期间日调用峰值3亿次。

  • 构建流式上下文管理与状态追踪,引入自适应记忆压缩与长程分片,在50款混合部署场景中长会话准确率提升9.8%,服务可用性达99.99%。

  • 搭建全链路流式压测与灰度体系,开发延迟拆解工具与自动退化策略,平台覆盖7条核心产品线,合作业务次日留存平均提升1.2pp。

流式处理NLPTensorRT在线推理
架构师全球云计算服务商
2023-04 - 至今
架构师
  • 主导设计基于Kubernetes的统一多模态训练平台,抽象文本、图像、语音三类数据流与编排接口,构建统一Pipeline,新模态接入成本由周级降至2天。

  • 引入弹性扩缩容与GPU拓扑感知调度,融合梯度累积、混合精度、ZeRO-3优化,将千卡多模态预训练集群利用率从62%提升至89%,等效年省数百万计算成本。

  • 自研多维训练加速引擎,针对图文对比与语音-文本联合建模,通过算子融合与通信计算重叠,全局Batch吞吐提升3.2倍,30B模型训练由14天压缩至5天。

  • 构建覆盖预训练、SFT、RLHF的端到端微调工作流,沉淀标准化适配模块,支撑5条业务线30+场景模型研发上线周期缩短60%。

  • 打通框架与MLOps体系,统一元数据,推动多模态模型迭代由月级提升至周级,孵化3项跨模态标杆案例。

多模态大规模预训练Kubernetes训练加速

教育经历

北京大学信息科学技术学院计算机应用技术硕士GPA: 3.8/4.0
2014-09 - 2016-07

专业技能

Python
9/10
精通
C++
7/10
熟练
深度学习(PyTorch/TensorFlow)
9/10
精通
推荐系统
9/10
精通
自然语言处理与大规模预训练
7/10
熟练
分布式训练与训练加速
9/10
精通
模型优化与推理(TensorRT/模型压缩)
7/10
熟练
实时计算与流式处理(Flink)
7/10
熟练
MLOps与AutoML
4/10
了解

荣誉奖项

年度最佳技术创新奖honor
2020

因对话理解系统突破获得公司级技术创新肯定

ACL最佳论文提名honor
2019

多轮对话状态追踪研究成果获国际顶会认可

全国人工智能算法大赛金奖honor
2017

在商品推荐赛道以深度排序模型夺得冠军

示例数据,仅供参考