李思远 · Algorithm Engineer
个人总结
2 年算法研发与落地经验,聚焦推荐系统与大模型应用,擅长从数据到模型的全链路实践。在互联网大厂主导短视频召回通道与 DeepFM 多任务排序升级,通过特征工程与工程提效实现人均观看时长 +5.3%、次日留存 +0.8pp;同时具备从 0 到 1 构建企业知识库问答系统及端侧语音助手的经历,兼顾业务效果与高效工程交付能力。核心能力包括:百亿级实时特征生产与小时级更新,支撑召回命中率 +4.2% 等核心收益;大模型 RAG 管线落地,基于对比学习微调、LoRA、GPTQ 量化与 vLLM 推理加速,实现问答正确率 89%、延迟 620ms,稳定支撑日均 12 万次请求。
工作经历
负责短视频召回通道优化,针对粗排阶段召回粒度粗放的问题,引入用户实时行为序列与内容主题特征,基于 Spark 构建多窗口兴趣画像,设计向量化召回与 XGBoost 粗排组合策略;通过 A/B 验证,召回池命中率提升 4.2%,曝光多样性提高 3.8%。
主导排序模型从单任务 LR 升级为 DeepFM 多任务架构,联合预估点击率、完播率与互动率,设计 CGC 式共享底层与任务专属塔结构,并引入多尺度时间衰减特征与交叉特征;离线 AUC 提升 2.1%,在线人均视频观看时长增加 5.3%。
构建全链路特征工程体系,利用 Spark SQL 与 DataFrame 完成百亿级行为日志的自动化特征生成与回溯填充,开发实时统计特征与序列特征算子,将特征生产延迟从 T+1 缩短至小时级,支撑模型迭代效率提升 60% 以上。
设计并实施多目标融合排序的 A/B 测试方案,通过贝叶斯优化平衡时长与互动指标,在核心流量分段上线后,全站次日留存率相对提升 0.8 个百分点,视频互动渗透率提升 11%。
面向企业内部知识库问答场景,基于 LangChain 搭建多源文档 RAG 管线,设计混合检索与重排序策略,将端到端问答正确率从 71% 提升至 89%。
针对向量检索领域适配不足,采用对比学习微调嵌入模型并优化索引结构,在百万级文本库中实现 Top-10 召回率由 78% 提高至 93%。
为抑制生成幻觉,构建检索片段验证自检提示模板,并结合 LoRA 微调生成模型,使答案的事实一致性人工评分提升 42%。
部署 GPTQ 量化与 vLLM 推理加速框架,优化 CUDA 内存与 KV Cache 策略,单次问答平均延迟降至 620ms,稳定支撑日均 12 万次请求。
项目经历
针对新发布短视频内容特征极度稀疏、冷启动分发困难的问题,主导设计多模态自动标签系统,利用 CLIP 提取视觉语义特征并与 BERT 文本表征进行跨模态对齐,为千万级视频自动生成多维内容标签,新内容冷启动曝光点击率提升约 15%。
面对原始标签粒度粗、覆盖面窄的瓶颈,重构层次化标签体系并引入语义关联约束,以少量人工标注样本结合半监督学习迭代微调,将可用标签从原有 300+ 粗粒度扩展至 2000+ 细粒度,标签平均准确率达 91%。
为实现大规模实时打标,在 PyTorch 框架下重构模型推理流水线,引入动态批处理与 FP16 推理,单视频平均处理耗时压缩至 28ms,支撑日均百万级新增视频的在线标签生成任务。
建立基于主动学习的标签质量闭环机制,周期性挖掘预测置信度低与边界样本进行定向标注与模型更新,使高频错误标签占比下降 38%,为后续分发召回与安全审核提供了更可靠的标签底座。
主导企业级知识库问答系统从 0 到 1 建设,设计融合 Elasticsearch 倒排索引与双塔语义匹配的混合检索链路,将长尾问题的 Top-5 召回率从 68% 提升至 89%,问答覆盖率提高 21 个百分点。
针对领域知识结构化不足导致的幻觉,构建轻量级企业知识图谱并实现实体链接,在图谱增强的 Prompt 工程下,生成答案的事实一致性评分由 72% 提升至 91%。
建立“检索-生成”双阶段评估体系,设计包含语义保真、关键词覆盖与人工抽检的自动化评估流水线,驱动 12 轮 Prompt 迭代,最终答案可用率稳定在 87% 以上。
通过日志分析与主动数据挖掘,识别高频未覆盖的长尾意图,沉淀 FAQ 并扩充知识库,推动端到端解决率从 61% 增长至 83%。
独立设计离线端侧语音指令识别系统 SpeechEdge,自采并标注 5,000 条中文指令,通过 SpecAugment、变速与噪声注入等增强策略将数据集扩增至 3 万条,缓解小样本过拟合并提升噪声鲁棒性。
基于深度可分离卷积构建轻量级 CNN 声学模型,结合量化感知训练与结构化剪枝,将模型体积压缩至 800KB 以内,算力消耗降低约 40%,适配 ARM Cortex-M7 等低功耗芯片。
使用 TensorFlow Lite 完成模型转换与端侧部署,实现从音频采集、端点检测到指令识别的全链路闭环,单次指令端到端响应时间控制在 200ms 以下。
在厨房、客厅等典型家居噪声环境中实测,系统对 20 条日常指令的离线识别准确率达 96.5%,可稳定运行于无网络连接的嵌入式设备。
教育经历
专业技能
荣誉奖项
因短视频推荐模型核心指标提升显著,获某互联网大厂数据智能部年度优秀新人。
基于集成学习的时间序列预测模型,完成建模、求解与论文撰写。
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































