张逸轩 · Algorithm Engineer
个人总结
拥有8年互联网与AI算法研发经验,覆盖搜索推荐、NLP、大模型分布式训练与推理优化等方向。主导千亿参数混合并行训练框架,训练吞吐提升2.1倍,千卡训练可用性达99.5%;设计实时推荐与流式对话系统,全链路延迟分别压缩至300ms与80ms以内,驱动GMV与自助解决率大幅提升;从零组建团队打造云端AutoML平台,将交付周期从60天缩短至7天,带来逾2000万年经常性收入。精通MLOps与AutoML体系建设,兼具算法创新与大规模工程落地能力。
工作经历
主导搜索排序模型从LR+GBDT升级为注意力双塔深度网络,融合商品标题语义与用户实时行为序列特征,上线后移动端搜索点击率相对提升6.8%,成交转化率提升4.2%。
构建推荐特征工程闭环,设计上线200+维用户多窗口行为与商品属性交叉特征,驱动离线AUC提升3.5%,推荐入口GMV季度环比增长8.3%。
基于TensorFlow实现搜索排序训练加速与模型热更新,将全量训练时长由12小时压缩至2.5小时,支撑每日多轮迭代与策略优化。
搭建搜索推荐A/B实验分析平台,主持40+组排序策略实验,沉淀出从特征筛选、模型增益评估到全量发布的标准流程,推动全年搜索GMV累计提升15.2%。
主导客服意图识别升级,基于预训练语言模型与PyTorch重构意图分类与槽填充联合模型,多领域意图识别准确率达94.7%,槽位F1达90.2%,驱动机器人自助解决率绝对值提升9个百分点。
设计序列记忆网络的多轮对话状态追踪与策略管理,跨场景任务完成率从63%提升至81%,错误恢复交互轮次平均减少2.3轮。
通过结构化剪枝与知识蒸馏将模型体积压缩至1/5,保持精度97%+,推理延迟降至12ms,支撑日均千万级调用。
搭建Transformer与图神经网络的上下文理解实验范式,统一单轮/多轮意图训练流程,将新场景意图冷启动周期由3周缩短至1周。
主导设计基于PyTorch与C++的混合并行训练框架,融合数据、模型、流水线并行策略,突破显存与通信瓶颈,支撑单模型规模达3000亿参数,端到端训练吞吐较社区最优方案提升2.1倍,成为部门统一训练底座。
针对千卡集群训练可用性仅92%的痛点,研发弹性容错与动态扩缩容机制,实现故障自动恢复,平均恢复时间<3分钟,全年可用性提升至99.5%。
自研通信与算子库,通过NCCL调优、梯度稀疏压缩及计算-通信重叠,将千亿模型单轮耗时降低42%,单季度实验量从200次增至500+次,加速策略迭代。
构建模型并行透明工具链,屏蔽分布式细节,提供一键并行脚本,新模型接入耗时从2周降至3天,已赋能推荐、广告、搜索等10余条业务线。
针对万亿级稀疏特征实时训练,设计分布式Embedding子系统,结合参数服务器与GPU缓存,日均PB级数据下读写延迟<0.5ms,支撑核心特征近实时更新。
作为算法团队负责人,从零组建10人团队打造云端AutoML平台,集成大模型微调、评估与部署,提供Java SDK与低代码编排,将典型方案交付周期从60天压缩至7天,上线首年落地金融、零售等领域60+客户。
主导模型优化引擎,引入量化感知训练、算子融合与动态批处理,在指标无损前提下将大模型推理延迟降低70%,单卡吞吐提升3倍,降低客户算力成本,带动月均活跃付费客户增长35%。
构建全链路MLOps体系,打通特征存储、实验追踪与模型注册,迭代速度从周级提升至日级,月实验量超500次,上线模型缺陷逃逸率下降40%。
提炼行业需求,打造金融核保、零售导购等低代码方案,通过模板与拖拽将概念验证周期从4周缩至1周,推动平台ARR突破2000万元,客户留存率超90%。
项目经历
针对大促批处理推荐延迟高、个性化弱,主导基于Flink的实时推荐引擎重构,全链路延迟从分钟级降至300ms以内,实现实时感知与即时响应。
构建流式样本拼接与在线学习环路,整合多源实时数据流,实现模型小时级增量更新,上线后CTR相对离线日更提升11%,大促峰值GMV同比提升8%。
设计实时热度与短期兴趣信号,融合双塔召回与轻量级排序模型,新商品冷启曝光效率提升2.3倍,热门商品库存消耗均匀度优化25%。
推动引擎灰度到全量发布,支撑亿级用户高并发推理,服务P99延迟<50ms,全年零重大故障。
主导千万级日活流式多轮对话平台架构,针对流式语音断句模糊与意图跳变,提出低延迟增量解码与动态注意力掩码,平均语义理解延迟<80ms,端到端流式P99<120ms。
将意图识别与槽填充模型基于TensorRT INT8量化部署至T4,单卡实现2000+QPS,推理成本降低60%,支撑春节期间日调用峰值3亿次。
构建流式上下文管理与状态追踪,引入自适应记忆压缩与长程分片,在50款混合部署场景中长会话准确率提升9.8%,服务可用性达99.99%。
搭建全链路流式压测与灰度体系,开发延迟拆解工具与自动退化策略,平台覆盖7条核心产品线,合作业务次日留存平均提升1.2pp。
主导设计基于Kubernetes的统一多模态训练平台,抽象文本、图像、语音三类数据流与编排接口,构建统一Pipeline,新模态接入成本由周级降至2天。
引入弹性扩缩容与GPU拓扑感知调度,融合梯度累积、混合精度、ZeRO-3优化,将千卡多模态预训练集群利用率从62%提升至89%,等效年省数百万计算成本。
自研多维训练加速引擎,针对图文对比与语音-文本联合建模,通过算子融合与通信计算重叠,全局Batch吞吐提升3.2倍,30B模型训练由14天压缩至5天。
构建覆盖预训练、SFT、RLHF的端到端微调工作流,沉淀标准化适配模块,支撑5条业务线30+场景模型研发上线周期缩短60%。
打通框架与MLOps体系,统一元数据,推动多模态模型迭代由月级提升至周级,孵化3项跨模态标杆案例。
教育经历
专业技能
荣誉奖项
因对话理解系统突破获得公司级技术创新肯定
多轮对话状态追踪研究成果获国际顶会认可
在商品推荐赛道以深度排序模型夺得冠军
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































