林睿 · Bioinformatics Engineer
个人总结
计算机科学与分子生物学交叉背景,致力于将算法与统计建模应用于精准医学与药物靶点发现。在实习中主导重构肿瘤体细胞变异注释管线,基于Nextflow并行与断点续跑、Docker封装,将单例外显子组注释从约4小时压缩至25分钟,并开发自动解析引擎及交互式可视化报告,支撑200+例样本稳定交付、注释一致率达98.6%。独立构建RNA‑seq全自动差异分析管道(12小时缩短至25分钟一键执行)与基于膨胀卷积的蛋白质二级结构预测模型(Q3准确率85.0%,较基线提升6.8个百分点),并编写标准化文档,使无生信背景人员亦可独立完成端到端分析。熟练运用Python、R、Nextflow/Snakemake、Docker及深度学习框架,具备从原始数据到生物学解读的工程化交付能力。
工作经历
基于Nextflow重构肿瘤体细胞变异注释流程,引入多任务并行与断点续跑机制,将单例外显子组注释耗时从约4小时压缩至25分钟,支撑每周50+样本的稳定交付。
使用Docker封装VEP、注释数据库及依赖环境,实现一键部署与版本锁定,消除系统差异导致的注释结果漂移,环境切换成本降为零。
开发Python自动解析引擎,融合VEP输出与ClinVar、COSMIC等公共知识库,提取致病性证据并生成结构化变异摘要,使关键变异的人工判定周期缩短约50%。
设计交互式HTML可视化报告模板,动态呈现突变全景、致病性评级与等位基因频率,帮助临床解读团队单报告阅读时间平均减少35%。
参与建立注释结果自动化质控规则,累计处理200+例真实肿瘤样本,注释与人工复核一致率达98.6%,并实现从VCF到解读报告的无缝对接。
项目经历
基于Snakemake构建自动化RNA‑seq分析管道,整合FastQC质控、STAR比对与featureCounts定量,将DESeq2差异表达分析与GSEA富集分析串联为单条可复现命令,使原本需手动分步操作近12小时的流程缩短至25分钟一键执行。
利用R与clusterProfiler开发自动化富集解析模块,对差异基因集合同时执行GO、KEGG及MSigDB的GSEA分析,平均每次输出约40个显著富集条目(FDR<0.05),并自动生成火山图、热图与GSEA山峦图,实现“结果-解释-图表”一站式交付。
将管道应用于合作课题组(代号“G-Onco”)的36对肿瘤/正常组织配对样本,在FDR<0.01且|log2FC|>1标准下稳定识别约1100个差异基因,通路富集结果成功复现与该癌症亚型高度相关的3条已知信号通路,验证了分析流程的生物学可靠性。
编写标准化操作文档,为课题组内4名无生物信息背景的实验人员提供2小时实战培训,使其能独立完成从原始FASTQ到富集报告的全流程分析;该管道后续被纳入实验室常规分析工具箱。
针对传统方法难以捕获氨基酸长程依赖的瓶颈,基于公开数据集CB513独立完成数据清洗与滑动窗口编码,使用Python与TensorFlow设计融合膨胀卷积与残差连接的多尺度深度卷积网络,统一提取局部基序与全局序列特征。
引入Focal Loss函数与余弦退火学习率调度,解决螺旋/折叠/卷曲类别的严重失衡,并通过网格搜索对核尺寸、层数和丢弃率进行调优,最终在独立测试集上取得85.0%的Q3准确率,较标准CNN基线提升6.8个百分点。
运用Grad-CAM可视化关键残基的预测贡献,证实模型注意力聚焦于跨膜疏水区及β‑折叠边界等已知结构热点,并将预测管道封装为可复现的Python模块,便于后续功能注释研究使用。
独立完成从理论调研、模型构建到评估分析的全流程,项目代码与训练权重在GitHub发布后获校内生物信息学课程“优秀项目”评定,并收到多个研究组的复现与复用咨询。
教育经历
专业技能
荣誉奖项
因学业成绩优异获得研究生学业优秀奖学金。
以“基于网络模型的生物通路分析”论文获省级二等奖。
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































