林若曦 · AI Trainer

中文·dashboard #人工智能 #AI训练专家
林若曦
AI训练专家
150 0000 1111zhouba@example.comzhouba杭州
github.com/username
1985-05在职-看机会30K-50K
汉族中共党员福建厦门已婚

个人总结

拥有 8 年算法工程与 AI 训练体系搭建经验,专精数据管线与模型全生命周期,以工程化视角贯通多源数据治理与业务洞察。核心壁垒:大规模数据处理与训练加速——自研框架融合 ZeRO 优化、梯度压缩与计算通信重叠,支撑超 90 万步零人工值守连续训练;实时特征管线与 TensorFlow Serving 容器化部署,峰值 QPS 超 5 万。业务成果:主导千亿参数多模态预训练数据体系,训练数据良品率 98%、有效数据利用率 94%;信贷风控双层 Stacking 融合架构将 KS 从 0.28 提升至 0.35,30+ 逾期率下降 15%;电商推荐引擎实时化,端到端延迟降至 18ms 以内,CTR 提升 17.8%,人均浏览商品数增长 12.3%;数十轮 A/B 实验中无效实验占比低于 15%,核心转化稳定增益 0.5% 以上。

教育经历

3.8/4.0
浙江大学
硕士·计算机科学与技术·计算机科学与技术学院2015.09 - 2017.06

专业技能

Python编程90%
精通
机器学习建模90%
精通
数据工程70%
熟练
深度学习70%
熟练
推荐系统70%
熟练
信贷风控70%
熟练
A/B测试70%
熟练

荣誉奖项

年度技术突破奖
2022.01
Kaggle 金牌 (NLP赛道)
2020.01
AI训练创新奖
2024.01

工作经历

2017
8mo
2017.07 → 2018.02
初级算法工程师某互联网大厂
初级算法工程师
  • 为某头部互联网平台构建亿级用户画像体系,基于海量行为日志与属性数据,独立设计 PySpark 特征加工与自动衍生脚本,将基础画像标签维度从 50+ 扩充至 300+,特征产出周期由天级压缩至小时级。

  • 针对用户分群需求,应用 K-Means 与 GMM 聚类算法构建用户分层模型,通过特征筛选与标准化提升聚类质量,模型轮廓系数达 0.72,成功划分出 5 个可解释性强的价值群体。

  • 优化大规模特征回填与日常批处理任务,利用 Spark 广播变量与内存调优,将单日全量特征更新耗时从 4 小时降至 1.5 小时,计算资源消耗降低约 40%。

  • 将聚类分群结果输出至运营平台,支撑差异化触达策略;随后的 A/B 测试中,消息推送打开率相对提升 20%,该项目成为团队特征构建与模型训练规范化的标杆。

#用户画像#Python#Spark#特征工程#聚类分析
2018
27mo
2018.03 → 2020.05
机器学习工程师某金融科技公司
机器学习工程师
  • 主导构建面向小额信贷产品的数据清洗与特征工程体系,系统梳理多源征信与行为数据,建立缺失值诊断、异常标签校正与多维度交叉验证流程,将高质量训练样本可用率从 78% 提升至 96%,支撑后续十余轮模型迭代。

  • 设计并迭代基于 XGBoost 与逻辑回归的信用评分卡模型,引入贝叶斯超参搜索与分层交叉验证策略,在多个产品线上将模型 KS 稳定在 0.35–0.40,AUC 提升约 0.07,并推动模型封装部署至实时风控决策引擎。

  • 搭建模型全生命周期评估与监控框架,定义 KS、PSI、LIFT 等指标,结合 A/B 测试跟踪线上衰减;通过定期诊断与特征漂移预警,将模型月均性能衰减率降低约 40%,保障业务风险可控。

  • 推进特征可解释性与风控策略联动,利用 SHAP 值量化关键变量影响,协同策略团队优化拒绝规则与额度矩阵,在维持通过率基本不变的前提下,使 30+ 逾期率下降约 15%。

#风控模型#数据清洗#XGBoost#模型评估#逻辑回归
2020
31mo
2020.06 → 2022.12
资深算法工程师头部电商平台
资深算法工程师
  • 在头部电商平台负责推荐系统核心模型迭代,针对粗排-精排链路中点击率预估瓶颈,主导特征体系升级与深度模型选型,基于 TensorFlow 重构训练框架,将用户行为序列、多模态内容特征纳入模型;上线后首页猜你喜欢场景 CTR 相对提升 9.8%,人均点击量提升 6.2%。

  • 设计并推动推荐特征工程标准化,搭建实时、离线、预计算三层特征生产管线,新增 200+ 高质量业务特征,特征覆盖度提升 35%;同时开发特征质量监控与服务治理工具,使特征数据异常发现时间从小时级缩短至分钟级。

  • 建立严格的在线 A/B 测试与效果归因体系,主导数十轮模型策略实验,通过多臂老虎机流量分配与离在线指标一致性校验,将无效实验占比控制在 15% 以内,保障每次模型更迭均可稳定带来 0.5% 以上的核心转化增益。

  • 从模型训练到部署全链路推动工程化提效,将单模型训练时间由 8 小时压缩至 3 小时,并构建自动化效果分析与模型诊断看板,将算法迭代周期从双周缩短到单周,大幅提升团队实验吞吐量。

#推荐系统#TensorFlow#点击率预估#特征提取#A/B测试
2023
45mo
2023.01 → 至今
高级AI训练师某AI实验室
高级AI训练师
  • 针对实验室预训练项目数据源复杂、质量参差不齐的痛点,主导设计覆盖采集、清洗、去重与多维质量评估的全链路数据管线,将有效数据利用率从 67% 提升至 94%,支撑模型在 SuperGLUE 基准得分提高 2.9 个百分点。

  • 面对千亿参数模型分布式训练效率瓶颈,基于 PyTorch 自研训练加速框架,融合 ZeRO 优化、梯度压缩与计算通信重叠等策略,在 1024 卡集群上将训练吞吐提升 2.3 倍,单轮迭代耗时缩短 58%。

  • 构建大规模训练稳定性监控与自愈体系,集成损失尖峰抑制、梯度异常检测与自动回滚机制,实现连续训练超 90 万步零人工值守,训练中断频次降低 95% 以上。

  • 建立数据配比-训练-评估的闭环驱动机制,通过下游任务反馈反向优化数据配方与超参,迭代十余版后使模型在少样本场景下的平均性能提升 11%,同时实验迭代周期由周级压缩至天级。

  • 推动训练工程化升级,引入动态分批、早期止损与容错续训策略,在不损失模型性能的前提下,将总训练算力成本降低 34%,节省约数百万美元量级预算。

#数据工程#预训练模型#分布式训练#PyTorch#模型优化

项目经历

2019
9mo
2019.03 → 2019.11
项目负责人某金融科技公司
项目负责人
  • 针对公司存量信贷模型 KS 长期停滞在 0.28 的瓶颈,主导发起违约预测专项优化,重新梳理全量特征池,通过分箱 WOE 编码与 IV 值迭代筛选,从 2000+ 候选变量中提炼出 34 个高稳定、强解释性特征,奠定性能跃升基础。

  • 引入 LightGBM 作为核心基学习器,结合 Focal Loss 自定义损失函数增强对少数逾期样本的拟合,并采用贝叶斯优化在复杂超参空间中高效逼近全局最优,单模型 KS 即突破 0.32。

  • 设计并落地“LightGBM+CatBoost+LR”双层 Stacking 融合架构,使不同模型在融合层自动学习对违约与非违约样本的互补置信度分配,整体 KS 从 0.28 提升至 0.35,相对提升 25%,同期逾期 30+ 召回率提升 16%。

  • 配套构建模型性能在线监测看板,加入特征漂移 PSI 阈值告警与逐月稳定性审计流程,上线后连续 6 个月 KS 稳定在 0.34 以上,未发生静默衰减,为全场景信贷审批提供了更可靠的主评分卡。

#特征筛选#LightGBM#模型融合#信贷风控
2021
9mo
2021.04 → 2021.12
核心开发者头部电商平台
核心开发者
  • 主导推荐引擎从近线批处理升级为基于 DeepFM 的实时推理架构,将 TensorFlow Serving 部署于容器化集群并接入自研特征服务,端到端延迟从 200ms 降至 18ms 以内,支撑大促峰值 QPS 超 5 万。

  • 设计多级实时特征管线,融合用户 30 分钟行为序列、商品语义向量与上下文特征,通过在线 A/B 验证推动 CTR 提升 17.8%,人均浏览商品数增加 12.3%。

  • 针对 DeepFM 在线推理瓶颈,裁剪冗余交叉特征并量化 Embedding 层,使单容器吞吐量提升 2.7 倍,高峰期资源成本下降 35%。

  • 搭建模型灰度发布与热更新通道,结合分流策略与自动回滚机制,将模型迭代周期从天级压缩至小时级,上线过程零宕机。

  • 建立实时模型监控与特征漂移告警体系,覆盖预测延迟、特征分布与空值率等指标,上线后月均故障次数下降 91%。

#DeepFM#实时特征#TensorFlow Serving#推荐系统
2024
9mo
2024.01 → 2024.09
技术负责人某AI实验室
技术负责人
  • 主导千亿参数多模态预训练模型数据清洗体系重构,针对图文、视频、音频等 6 类模态设计分层去噪与主动学习策略,训练数据良品率从 82% 提升至 98%,下游模型收敛速度提升 40%。

  • 基于 Airflow 编排百余个清洗与质量校验任务,实现每日 500TB 级多源数据自动化调度,引入流式去重与异常检测机制,数据吞吐量提升 4 倍,管线故障恢复时间缩短至分钟级。

  • 构建大规模自动化标注与持续质量监控平台,集成弱监督学习与人在回路审核,将人工标注成本削减 60%,同时支撑每月新增超 2 亿条高质量样本的生产节奏。

  • 沉淀多模态数据质量分级规范与可复用算子库,将新场景数据清洗管线的搭建周期从 3 周压缩至 3 天,并输出到 3 个跨团队项目中,形成组织级数据基础设施标准。

#数据标注#多模态#数据清洗#Airflow#预训练

Sample data, for reference only