林一朴 · AI Trainer
个人总结
专注从数据清洗到模型部署的全链路NLP落地。独立构建自动化数据处理管线,覆盖52万级对话,将高质量样本占比从72%提升至91%;设计多维度自动评估模块,使单轮评测耗时压缩至约5秒。作为负责人统筹团队,微调7B模型将多轮对话连贯性提升12.6%,蒸馏方案将推理延迟降至20ms以内,带队在130+支区域队伍中跻身Top5。清洗、微调与评估方案沉淀为开源工具,发布当月即获230+ Star,被多个下游应用集成,验证了高质量数据与模型优化驱动智能应用落地的工程能力。
项目经历
独立设计并实现基于Pandas的数据清洗流水线,覆盖去重、低质过滤与格式标准化,处理约52万条原始对话,将可用高质量样本比例从72%提升至91%,数据准备效率提高约3倍。
基于Hugging Face Transformers与PEFT框架,为7B基座模型编写LoRA微调脚本,定向优化多轮上下文理解,多轮对话连贯性人工评估得分相较基线提升12.6%,同时保持单轮回复质量不下降。
构建融合流畅度、语义连贯性与话题保持三大指标的自动化评估模块,实现批量评测,将每轮评估耗时从分钟级压缩至约5秒,支撑每周两次快速迭代。
将清洗流水线、微调脚本与评估模块封装为可复现工具集,社区发布当月获230+ Star,被3个下游对话应用集成,并基于20+条反馈持续迭代优化。
面向课程问答定义7类意图与4类实体标签体系,主导3,200+条语料的标注与质检,搭建基于PyTorch的数据集及训练评估流水线。
针对样本稀疏问题,引入回译与课程实体替换等数据增强策略,将有效训练样本扩充至约7,400条,意图分类准确率提升至93.2%。
基于预训练BERT分别微调意图识别与命名实体识别模型,实体识别F1值达87.5%,并通过规则后处理提升复合问句的解析稳定性。
集成双模型构建端到端问答,在计科等3门课程的封闭测试集上正确答案召回率达89.7%,累计支撑校内超2,000次查询。
作为模型训练负责人统筹3人团队,制定3轮标注-训练-评估迭代计划,最终上线版本意图识别错误率较基线降低41%。
统筹团队分工与短周期迭代,围绕细粒度情感分析赛题,设计从数据清洗、特征工程到模型蒸馏与部署的全链路流水线,按期交付。
构建融合N-gram、情感词典、依存句法等200+维组合特征,利用Scikit-learn完成特征选择与基线验证,将验证集Macro-F1从0.74提升至0.82。
设计BERT-Base至轻量BiLSTM的蒸馏方案,在保持教师模型95%精度的前提下,压缩参数量91%,单次推理耗时从85ms降至18ms。
基于ONNX进行算子融合与INT8量化,封装CPU推理服务,使端到端平均响应延迟稳定在20ms以内,满足实时分析要求。
带领团队在130+支区域队伍中夺得Top5(第4名),方案因兼顾精度与推理效率被选为典型工业落地案例进行展示。
教育经历
主修课程:数据结构与算法、计算机组成与设计、操作系统、计算机网络、数据库系统
毕业设计:基于图神经网络的社交推荐系统研究(获校级优秀毕业论文)
获浙江大学一等奖学金、省政府奖学金
全国大学生数学建模竞赛浙江省一等奖
专业技能
荣誉奖项
凭借利用强化学习优化对话策略以实现自适应交互的项目,在C4-AI大学生人工智能创新赛中获区域二等奖。
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































