李思远 · Algorithm Engineer

中文·modern #后端开发 #初级算法工程师
李思远
算法工程师
188 8888 8888zhaoliu@example.comzhaoliu杭州
github.com/username
2000-03离职-随时到岗12K-18K
汉族群众江苏南京未婚

个人总结

计算机科班出身的算法工程师,具备从模型研发到后端工程落地的完整闭环能力。在推荐系统、自然语言处理与运筹优化方向均有实战成果:主导的CTR预估模型AUC提升2.3%、线上点击率提升1.8%,推理P99延迟从120ms降至45ms,QPS提升至2100;并在BERT分类、Seq2Seq对话生成及多标签用户画像建模方面取得业界领先水平。擅长将算法创新与工程优化结合,在特征工程、模型压缩(知识蒸馏、TensorRT)、高并发服务(RESTful API、Spark管道)等方面均有显著成效,能够独立承担复杂系统从0到1的搭建与迭代。

教育经历

浙江大学计算机学院计算机科学与技术学士GPA: 3.7/4.0
2019.09 - 2023.06

专业技能

Python
9/10
精通
深度学习框架
7/10
熟练
推荐系统
7/10
熟练
自然语言处理
7/10
熟练
机器学习
7/10
熟练
图论与优化
4/10
了解
C++
4/10
了解
大数据处理
7/10
熟练

荣誉奖项

全国大学生数学建模竞赛省级一等奖honor
2022

该奖项表彰在数学建模竞赛中运用数学与算法思维解决实际问题的能力

工作经历

算法工程师某科技公司
2023.07 - 至今
算法工程师|算法部
  • 负责推荐系统CTR预估模型开发,基于TensorFlow搭建DeepFM架构并设计用户行为与物品属性交叉特征,经离线A/B测试AUC提升2.3%,线上点击率提升1.8%。

  • 构建面向亿级用户日志的特征工程流水线,引入时间衰减与序列聚合特征,将模型Top-100召回率从62%提升至68%,覆盖更多长尾商品。

  • 优化模型推理服务,将特征预处理与模型预测合并为单进程异步管道,使P99延迟从120ms降至45ms,QPS从800提升至2100。

  • 设计基于物品内容相似度的冷启动召回策略,结合新物品属性向量聚类,使新上架商品日均曝光量增长35%,有效缓解冷启漏斗问题。

PythonTensorFlow推荐算法CTR预估特征工程
算法实习生AI创业公司
2023.01 - 2023.06
算法实习生|算法组
  • 在某AI创业公司实习期间,负责开发基于BERT的文本分类模型,使用PyTorch框架对5万条客服对话数据进行清洗与标注,测试集准确率达92.3%,F1达0.89,较基线提升6.7个百分点。

  • 针对类别分布不均问题,引入Focal Loss并优化训练策略,将少数类别的召回率从0.62提升至0.81,宏平均F1提升8.5%。

  • 设计数据增强流程,通过同义词替换与回译技术将有效训练数据扩展至12万条,模型泛化能力显著增强,交叉验证波动降低30%。

  • 将训练后的模型导出为ONNX格式,并封装成RESTful API,将推理延迟优化至15ms内,支持200 QPS并发,成功上线服务每日处理约2万次请求。

  • 参与模型迭代,采用知识蒸馏将BERT-base压缩为6层Transformer,参数量减少40%,推理速度提升2.3倍,精度仅下降0.5%。

NLPPyTorch文本分类BERT数据处理

项目经历

核心开发者内部IM系统
2023.04 - 2023.08
核心开发者|算法组
  • 针对企业内部IM系统日均50万条消息的对话场景,主导设计基于Transformer的Seq2Seq对话生成模型,通过引入注意力机制与Beam Search解码,使回复连贯性评分提升32%,用户人工评分平均4.2/5.0。

  • 为提升对话响应速度,将模型参数量从1.2亿压缩至4500万,并部署在GPU集群上通过TensorRT优化推理,实现端到端推理延迟从580ms降至120ms,满足实时聊天需求。

  • 构建基于BERT的意图识别模块,覆盖12类常见办公意图(如请假、审批、查询),在自标注的8万条样本上训练,准确率达94.7%,召回率91.2%,误触发率环比降低67%。

  • 设计对话日志回传与在线评估Pipeline,每周采集用户反馈数据自动微调模型,三轮迭代后对话满意度从78%提升至89%,无效对话占比由15%降至6%。

Seq2SeqTransformer对话生成意图识别
算法工程师订单履约平台
2023.09 - 2024.01
算法工程师|算法组
  • 针对多车场、多约束的城市配送场景,基于图论建模运输网络,设计并实现Dijkstra与A*混合的最短路径引擎,使用C++重构核心计算模块,单次路径规划耗时从120ms降至45ms。

  • 为优化车辆调度与路径利用率,引入遗传算法与局部搜索的混合运筹优化策略,在模拟测试中总配送距离减少12%,车辆空驶率降低18%。

  • 利用OpenMP对路径计算进行并行化加速,支持日均处理50万+条订单的路径规划,系统吞吐量提升3.2倍。

  • 联合业务团队构建配送时效预测模型,基于历史ETA偏差校准,将预计到达时间平均误差从±15分钟缩小至±5分钟。

图论最短路径运筹优化C++
算法工程师用户画像平台
2024.02 - 2024.06
算法工程师|数据组
  • 在用户画像平台中,基于每日TB级用户行为日志,使用Spark构建300余项原始特征(点击、浏览、收藏等),通过XGBoost特征重要性排序筛选出Top 50核心特征,将模型训练时间从8小时降至2小时,特征维度减少83%,AUC仍保持在0.91。

  • 针对用户性别、年龄段、消费偏好等8个标签的多标签分类任务,采用XGBoost的OneVsRest策略训练8个二分类器,在百万级测试集上平均F1达到0.82,较逻辑回归基线提升7个百分点,线上A/B测试用户画像准确率提升12个百分点。

  • 设计基于Spark MLlib的在线特征计算管道,每日增量处理200万活跃用户行为数据,实现标签预测模型每小时更新,系统延迟控制在50ms以内,支撑实时推荐策略调用。

  • 通过特征交叉与业务规则挖掘“高购买力+低频访问”等复合标签,补充原始XGBoost模型盲区,使高价值用户召回率提升15%,推动运营活动转化率提升5%。

XGBoost特征重要性多标签分类Spark

Sample data, for reference only