李华 · Bioinformatics Engineer
个人总结
拥有约2年生物信息学经验,精通Python、R和Nextflow,在基因组与转录组分析中取得显著成果:将WES变异检测流程耗时缩短39%,RNA-seq交付周期压缩60%,并独立开发质控模块累计处理超200批次数据。在蛋白质结构预测方面,基于PyTorch复现并优化AlphaFold2的Evoformer模块,通过改进注意力机制使LDDT分数提升5.2%,并将复合物预测成功率从31%提升至47%,展现了深度学习在多组学整合中的扎实应用能力。
工作经历
针对临床外显子组测序项目,使用Python重构基于GATK Best Practices的变异检测流程,将WES数据从FASTQ到VCF的处理时间从18小时缩短至11小时(缩短39%),并通过Nextflow实现并行调度,单批次处理量提升至96个样本。
为RNA-seq差异表达分析搭建标准管道,整合STAR、featureCounts和DESeq2,处理来自12种肿瘤组织的48个样本,输出基因表达矩阵和显著差异基因列表(|log2FC|>1, FDR<0.05),交付周期从5天压缩至2天(缩短60%)。
独立开发BWA-mem比对后的质量控制模块(Python+R),自动统计覆盖深度、比对率、GC偏差等12项指标,生成PDF报告,被团队采纳为日常质控标准,累计处理超200批次数据。
维护并优化公司内部的高通量测序分析平台,将WGS变异检测流程从单线程迁移至Nextflow多步骤工作流,节省30%的GPU/CPU资源消耗,实现每小时完成1个全基因组样本的完整分析。
项目经历
作为核心开发者,在多组学整合分析平台中基于PyTorch复现并优化AlphaFold2的Evoformer模块,通过改进注意力机制将蛋白质结构预测的LDDT分数提升5.2%。
针对蛋白质多聚体复合物预测需求,设计并实现基于深度学习的分层采样策略,将复合物预测成功率从基线模型的31%提升至47%。
主导开发数据预处理管道,使用Python高效处理超过200万条蛋白质序列,将输入数据准备时间从12小时缩短至2.5小时。
协同团队完成模型调优,通过超参数搜索使预测结果RMSD降低0.8Å,并撰写详细技术文档供后续研究复用。
教育经历
专业技能
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































