李思远 · 算法工程师

中文·tech #人工智能 #初级算法工程师
李思远
算法工程师
188 8888 8888sunqi@example.comsunqi上海
github.com/username
1998-04应届毕业生12K-18K
汉族共青团员广东深圳未婚

个人总结

2 年算法研发与落地经验,聚焦推荐系统与大模型应用,擅长从数据到模型的全链路实践。在互联网大厂主导短视频召回通道与 DeepFM 多任务排序升级,通过特征工程与工程提效实现人均观看时长 +5.3%、次日留存 +0.8pp;同时具备从 0 到 1 构建企业知识库问答系统及端侧语音助手的经历,兼顾业务效果与高效工程交付能力。核心能力包括:百亿级实时特征生产与小时级更新,支撑召回命中率 +4.2% 等核心收益;大模型 RAG 管线落地,基于对比学习微调、LoRA、GPTQ 量化与 vLLM 推理加速,实现问答正确率 89%、延迟 620ms,稳定支撑日均 12 万次请求。

工作经历

算法工程师某互联网大厂
2023-07 - 2024-08
算法工程师|数据智能部
  • 负责短视频召回通道优化,针对粗排阶段召回粒度粗放的问题,引入用户实时行为序列与内容主题特征,基于 Spark 构建多窗口兴趣画像,设计向量化召回与 XGBoost 粗排组合策略;通过 A/B 验证,召回池命中率提升 4.2%,曝光多样性提高 3.8%。

  • 主导排序模型从单任务 LR 升级为 DeepFM 多任务架构,联合预估点击率、完播率与互动率,设计 CGC 式共享底层与任务专属塔结构,并引入多尺度时间衰减特征与交叉特征;离线 AUC 提升 2.1%,在线人均视频观看时长增加 5.3%。

  • 构建全链路特征工程体系,利用 Spark SQL 与 DataFrame 完成百亿级行为日志的自动化特征生成与回溯填充,开发实时统计特征与序列特征算子,将特征生产延迟从 T+1 缩短至小时级,支撑模型迭代效率提升 60% 以上。

  • 设计并实施多目标融合排序的 A/B 测试方案,通过贝叶斯优化平衡时长与互动指标,在核心流量分段上线后,全站次日留存率相对提升 0.8 个百分点,视频互动渗透率提升 11%。

DeepFMXGBoost多任务学习特征工程A/B测试Spark
算法工程师T-Corp
2024-09 - 至今
算法工程师|AI平台部
  • 面向企业内部知识库问答场景,基于 LangChain 搭建多源文档 RAG 管线,设计混合检索与重排序策略,将端到端问答正确率从 71% 提升至 89%。

  • 针对向量检索领域适配不足,采用对比学习微调嵌入模型并优化索引结构,在百万级文本库中实现 Top-10 召回率由 78% 提高至 93%。

  • 为抑制生成幻觉,构建检索片段验证自检提示模板,并结合 LoRA 微调生成模型,使答案的事实一致性人工评分提升 42%。

  • 部署 GPTQ 量化与 vLLM 推理加速框架,优化 CUDA 内存与 KV Cache 策略,单次问答平均延迟降至 620ms,稳定支撑日均 12 万次请求。

LangChainRAG大语言模型向量检索模型微调推理加速

项目经历

核心开发者VideoTag
2023-10 - 2024-02
核心开发者
  • 针对新发布短视频内容特征极度稀疏、冷启动分发困难的问题,主导设计多模态自动标签系统,利用 CLIP 提取视觉语义特征并与 BERT 文本表征进行跨模态对齐,为千万级视频自动生成多维内容标签,新内容冷启动曝光点击率提升约 15%。

  • 面对原始标签粒度粗、覆盖面窄的瓶颈,重构层次化标签体系并引入语义关联约束,以少量人工标注样本结合半监督学习迭代微调,将可用标签从原有 300+ 粗粒度扩展至 2000+ 细粒度,标签平均准确率达 91%。

  • 为实现大规模实时打标,在 PyTorch 框架下重构模型推理流水线,引入动态批处理与 FP16 推理,单视频平均处理耗时压缩至 28ms,支撑日均百万级新增视频的在线标签生成任务。

  • 建立基于主动学习的标签质量闭环机制,周期性挖掘预测置信度低与边界样本进行定向标注与模型更新,使高频错误标签占比下降 38%,为后续分发召回与安全审核提供了更可靠的标签底座。

多模态CLIPBERT标签体系PyTorch
算法负责人ConoKB
2024-09 - 2025-03
算法负责人
  • 主导企业级知识库问答系统从 0 到 1 建设,设计融合 Elasticsearch 倒排索引与双塔语义匹配的混合检索链路,将长尾问题的 Top-5 召回率从 68% 提升至 89%,问答覆盖率提高 21 个百分点。

  • 针对领域知识结构化不足导致的幻觉,构建轻量级企业知识图谱并实现实体链接,在图谱增强的 Prompt 工程下,生成答案的事实一致性评分由 72% 提升至 91%。

  • 建立“检索-生成”双阶段评估体系,设计包含语义保真、关键词覆盖与人工抽检的自动化评估流水线,驱动 12 轮 Prompt 迭代,最终答案可用率稳定在 87% 以上。

  • 通过日志分析与主动数据挖掘,识别高频未覆盖的长尾意图,沉淀 FAQ 并扩充知识库,推动端到端解决率从 61% 增长至 83%。

知识图谱语义匹配Prompt工程Elasticsearch模型评估
独立开发者SpeechEdge
2023-01 - 2023-06
独立开发者
  • 独立设计离线端侧语音指令识别系统 SpeechEdge,自采并标注 5,000 条中文指令,通过 SpecAugment、变速与噪声注入等增强策略将数据集扩增至 3 万条,缓解小样本过拟合并提升噪声鲁棒性。

  • 基于深度可分离卷积构建轻量级 CNN 声学模型,结合量化感知训练与结构化剪枝,将模型体积压缩至 800KB 以内,算力消耗降低约 40%,适配 ARM Cortex-M7 等低功耗芯片。

  • 使用 TensorFlow Lite 完成模型转换与端侧部署,实现从音频采集、端点检测到指令识别的全链路闭环,单次指令端到端响应时间控制在 200ms 以下。

  • 在厨房、客厅等典型家居噪声环境中实测,系统对 20 条日常指令的离线识别准确率达 96.5%,可稳定运行于无网络连接的嵌入式设备。

语音识别模型压缩TensorFlow Lite数据增强嵌入式部署

教育经历

上海交通大学电子信息与电气工程学院计算机科学与技术硕士GPA: 3.8/4.0
2021-09 - 2023-06

专业技能

推荐系统算法与工程
9/10
精通
大语言模型应用与优化
9/10
精通
多模态模型开发
7/10
熟练
知识图谱与语义搜索
7/10
熟练
模型压缩与嵌入式部署
7/10
熟练
语音识别
4/10
了解

荣誉奖项

优秀新人奖honor
2024

因短视频推荐模型核心指标提升显著,获某互联网大厂数据智能部年度优秀新人。

全国大学生数学建模竞赛上海赛区一等奖honor
2021

基于集成学习的时间序列预测模型,完成建模、求解与论文撰写。

示例数据,仅供参考