林晚晴 · AI Trainer
个人总结
AI训练师,1年经验,专注推荐系统与多模态场景,擅长从数据到决策的全链路优化。主导某头部短视频平台推荐系统迭代,重构数据管道、优化深度兴趣网络并实现模型蒸馏,点击率提升2.7%、人均观看时长提升1.9%,轻量模型推理延迟降低45%且精度保持97%。在多模态有害内容识别竞赛中,构建10万+对齐样本,设计协同增强管道并结合可解释分析,违规识别精确率达90.5%,较纯文本基线提高12个百分点。在医疗问诊意图分类项目中,面对200+类长尾分布,采用分阶段采样、动态阈值校准与图注意力标签建模,宏平均F1从0.62提升至0.71,小样本类别F1提升9个百分点,标签冲突错误减少35%。
核心能力:深耕推荐系统与多模态,精通特征工程、模型蒸馏、数据增强及A/B实验闭环,以可解释方法驱动高效、可泛化的AI落地。
技术栈:PyTorch、Hugging Face、CV、NLP、迁移学习,将数据信号转化为业务增量。
工作经历
承担推荐数据管道重构,设计多窗口行为序列与内容属性交叉特征,高质量训练样本覆盖度提升21%,为模型迭代注入更丰富信号。
基于PyTorch优化深度兴趣网络的特征交叉层,引入自适应注意力机制,上线A/B实验后短视频点击率提升2.7%、人均观看时长提升1.9%。
主导排序模型蒸馏,以复杂教师网络指导轻量学生网络训练,在保持97%预估精度的前提下,推理延迟降低45%,单次请求资源开销下降30%。
搭建自动化特征评估与线上指标监控看板,打通A/B测试平台与特征日志,新特征上线周期缩短约30%,并快速捕捉两次数据漂移引发的指标异常。
协同算法团队优化多任务样本权重策略,动态调整完播、点赞等辅助任务的损失贡献,人均播放进度提升1.5%,辅助目标一致性损失降低18%。
项目经历
负责多模态样本构建与对齐,从原始竞赛数据中抽取图像、短文本和用户行为序列,形成超10万条高质量训练集,为模型提供统一的多模态输入。
针对违规类别极度稀疏的挑战,设计图像变换与文本回译、同义词替换的协同增强管道,将少样本稀有类别样本量扩充至3倍,有效缓解过拟合。
采用多模态对比学习框架联合微调视觉与文本编码器,并引入用户行为统计特征进行注意力融合,在官方测试集上将违规内容识别精确率提升至90.5%,较纯文本基线提高12个百分点。
借助可解释分析工具量化各模态特征贡献,识别并剔除2项冗余行为特征,保持精度的同时单次推理耗时降低约20%。
针对医学问诊对话中200+细粒度意图标签的长尾分布,使用Hugging Face Transformers加载BioBERT进行迁移学习,设计分阶段采样策略(先充分训练头部类别,再用过采样与欠采样组合微调尾部),将整体宏平均F1从0.62提升至0.71。
构建多标签动态阈值校准流程,在验证集上基于各类别PR曲线自动搜索最优分类阈值,取代固定0.5阈值,尾部类别召回率平均提升18%,误报率控制在5%以内。
针对部分类别正样本极少(< 10条)的极端不平衡,实现基于标签共现图的数据增强:对每条样本进行同义词替换与随机遮蔽,根据共现关系合成新多标签组合,训练集有效规模扩充1.8倍,小样本类别F1提升约9个百分点。
引入标签依赖关系建模,在BERT输出层之上附加轻量图注意力网络,传播标签共现先验,引导模型学习一致性预测分布,汉明损失从0.031降至0.024,测试集标签排布冲突错误减少35%。
教育经历
专业技能
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































