林晚晴 · AI Trainer

中文·terminal #人工智能 #初级AI训练师
林晚晴
AI训练师
186 6666 6666zhaoliu@example.comzhaoliu杭州
github.com/username
2000-03离职-随时到岗12K-18K
汉族群众湖北武汉未婚

个人总结

whoami --long

AI训练师,1年经验,专注推荐系统与多模态场景,擅长从数据到决策的全链路优化。主导某头部短视频平台推荐系统迭代,重构数据管道、优化深度兴趣网络并实现模型蒸馏,点击率提升2.7%、人均观看时长提升1.9%,轻量模型推理延迟降低45%且精度保持97%。在多模态有害内容识别竞赛中,构建10万+对齐样本,设计协同增强管道并结合可解释分析,违规识别精确率达90.5%,较纯文本基线提高12个百分点。在医疗问诊意图分类项目中,面对200+类长尾分布,采用分阶段采样、动态阈值校准与图注意力标签建模,宏平均F1从0.62提升至0.71,小样本类别F1提升9个百分点,标签冲突错误减少35%。

  • 核心能力:深耕推荐系统与多模态,精通特征工程、模型蒸馏、数据增强及A/B实验闭环,以可解释方法驱动高效、可泛化的AI落地。

  • 技术栈:PyTorch、Hugging Face、CV、NLP、迁移学习,将数据信号转化为业务增量。

工作经历

cat work/ai.md
# AI训练工程师
某头部短视频平台//AI训练工程师2024-07 - 至今
  • 承担推荐数据管道重构,设计多窗口行为序列与内容属性交叉特征,高质量训练样本覆盖度提升21%,为模型迭代注入更丰富信号。

  • 基于PyTorch优化深度兴趣网络的特征交叉层,引入自适应注意力机制,上线A/B实验后短视频点击率提升2.7%、人均观看时长提升1.9%。

  • 主导排序模型蒸馏,以复杂教师网络指导轻量学生网络训练,在保持97%预估精度的前提下,推理延迟降低45%,单次请求资源开销下降30%。

  • 搭建自动化特征评估与线上指标监控看板,打通A/B测试平台与特征日志,新特征上线周期缩短约30%,并快速捕捉两次数据漂移引发的指标异常。

  • 协同算法团队优化多任务样本权重策略,动态调整完播、点赞等辅助任务的损失贡献,人均播放进度提升1.5%,辅助目标一致性损失降低18%。

[PyTorch][特征工程][模型蒸馏][A/B测试]

项目经历

cat work/entry.md
# 核心成员
多模态有害内容识别竞赛//核心成员2024-09 - 2024-11
  • 负责多模态样本构建与对齐,从原始竞赛数据中抽取图像、短文本和用户行为序列,形成超10万条高质量训练集,为模型提供统一的多模态输入。

  • 针对违规类别极度稀疏的挑战,设计图像变换与文本回译、同义词替换的协同增强管道,将少样本稀有类别样本量扩充至3倍,有效缓解过拟合。

  • 采用多模态对比学习框架联合微调视觉与文本编码器,并引入用户行为统计特征进行注意力融合,在官方测试集上将违规内容识别精确率提升至90.5%,较纯文本基线提高12个百分点。

  • 借助可解释分析工具量化各模态特征贡献,识别并剔除2项冗余行为特征,保持精度的同时单次推理耗时降低约20%。

[多模态学习][计算机视觉][自然语言处理][数据增广]
cat work/entry.md
# 模型调优负责人
医疗问诊意图分类项目//模型调优负责人2025-02 - 2025-03
  • 针对医学问诊对话中200+细粒度意图标签的长尾分布,使用Hugging Face Transformers加载BioBERT进行迁移学习,设计分阶段采样策略(先充分训练头部类别,再用过采样与欠采样组合微调尾部),将整体宏平均F1从0.62提升至0.71。

  • 构建多标签动态阈值校准流程,在验证集上基于各类别PR曲线自动搜索最优分类阈值,取代固定0.5阈值,尾部类别召回率平均提升18%,误报率控制在5%以内。

  • 针对部分类别正样本极少(< 10条)的极端不平衡,实现基于标签共现图的数据增强:对每条样本进行同义词替换与随机遮蔽,根据共现关系合成新多标签组合,训练集有效规模扩充1.8倍,小样本类别F1提升约9个百分点。

  • 引入标签依赖关系建模,在BERT输出层之上附加轻量图注意力网络,传播标签共现先验,引导模型学习一致性预测分布,汉明损失从0.031降至0.024,测试集标签排布冲突错误减少35%。

[BERT][Hugging Face][迁移学习][类别不平衡处理]

教育经历

ls -la education/
drwx2020-09 - 2024-06
浙江大学学士
计算机科学与技术//计算机科学与技术学院//GPA=3.8/4.0

专业技能

stack --verbose
PyTorch90%
计算机视觉70%
自然语言处理70%
多模态学习70%
迁移学习70%
模型蒸馏70%
特征工程70%
数据增广70%
A/B测试70%

Sample data, for reference only