王思远 · Bioinformatics Engineer

中文·forest #生物医药 #资深
王思远
生物信息工程师
139 0000 0000lisi@example.comlisi深圳
1987-07在职-看机会25K-40K
汉族中共党员湖北武汉已婚

个人总结

近5年生物信息工程经验,从NGS分析起步,逐步深入算法研发、团队管理与平台构建,专注于将计算技术应用于精准医学。核心成果包括:主导开发低频变异检测、拷贝数变异校正及TMB计算等高性能算法,多项已产品化并通过临床验证;搭建基于GCP云计算和Nextflow/Docker的标准化分析平台,领导6人团队将多组学分析周期从4周压缩至7天,显著提升交付效率与可复现性。此外,在开源社区贡献核心单细胞分析模块与1.5万行代码,掌握Python、R、机器学习及云计算等技能。

专业技能

NGS数据分析
7/10
熟练
Python
9/10
精通
R
7/10
熟练
Linux/Shell
7/10
熟练
机器学习
7/10
熟练
单细胞分析
7/10
熟练
数据可视化
7/10
熟练
云计算(GCP)
7/10
熟练

荣誉奖项

公司年度技术创新奖honor
2021

因在肿瘤基因检测分析流程中的技术创新获得该奖项。

中国生物信息学大会优秀论文奖honor
2022

因单细胞转录组整合算法研究获得该奖项认可。

工作经历

生物信息分析师某生物医药初创公司
2019-06 - 2021-03
生物信息分析师|研发部
  • 针对缺乏标准化NGS流程的问题,采用Python+Snakemake搭建可复用RNA-seq自动化流程,集成STAR比对、featureCounts定量及差异表达分析,累计处理1,500+份样本,单样本分析时间从4小时压缩至40分钟,通过版本控制实现100%结果可追溯。

  • 为应对数据管理需求,设计并部署基于MySQL的样本元数据库,统一管理测序质量指标、实验批次及分析结果,支持6人团队实时查询与报表生成,历史数据检索耗时从分钟级降至秒级,支撑12个项目的并行管理。

  • 主导开发基于R(DESeq2、clusterProfiler)和Python(pandas、matplotlib)的基因表达分析模块,自动生成火山图、热图及GO富集分析等标准报告,应用于8个客户项目,产出40+份可视化报告,客户交付满意度达95%。

  • 通过优化STAR比对参数及并行化脚本,将多批次混合样本的比对成功率从88%提升至97%,利用Linux管道和内存管理策略将峰值内存占用降低35%,使老旧服务器高效运行大样本量任务,累计节约计算资源成本约12万元。

NGS数据分析序列比对基因表达分析PythonRLinuxShellMySQL
生物信息工程师某精准医疗公司
2021-04 - 2023-01
生物信息工程师|算法研发部
  • 为解决低频变异检出难题,主导设计基于深度降噪+贝叶斯概率模型的算法(Python/C++混合实现),在0.1%突变频率下灵敏度达95%、特异性>99.5%,经200例临床血浆样本验证,推动公司液体活检产品上市。

  • 为提升分析效率与可重复性,采用WDL+Docker构建全自动分析流程,整合GATK、FreeBayes等20余款软件,实现肿瘤-正常配对数据一键化处理,单样本分析周期从3天压缩至8小时,累计处理超5000例样本。

  • 针对拷贝数变异检测假阳性高的问题,设计滑动窗口统计+局部Z-score校正算法,在1000例真实临床样本中检出率提升15%,假阳性率降低30%,该模块被集成至公司核心分析管线。

  • 为满足TMB临床报告要求,开发融合机器学习特征选择与多重校准的TMB模型,在连续两轮CAP室间质评中结果一致性达92%(R²=0.92),并通过30家合作医院验证认可。

  • 为加速算法迭代,搭建C++高性能计算核心+Python接口的可复用框架,将新算法从原型到产品化部署的周期由14天压缩至3天,支持团队并行开发3个以上分析模块。

算法设计机器学习PythonC++生物信息学软件WDLDocker统计学
高级生物信息工程师某大型药企研发中心
2023-02 - 至今
高级生物信息工程师|生物信息学平台
  • 为加速靶点发现,领导6人团队,搭建GCP云计算组学分析平台,整合蛋白质组、转录组与单细胞RNA-seq数据,实现多组学数据自动化处理与集成,将分析周期从4周压缩至7天,助力3个新靶点的临床前验证。

  • 针对靶点筛选假阳性高的问题,开发随机森林+深度学习混合模型,融合蛋白质组丰度与转录组表达特征,将靶点预测准确率提升35%,并产出交互式可视化看板,被研发组采纳用于2个肿瘤免疫项目。

  • 针对单细胞数据解析瓶颈,构建15万细胞参考图谱的批处理校正流程,整合CellTypist与自定义分类器,实现无需人工干预的细胞注释,处理速度提升12倍,支持5个靶点发现项目的快速迭代。

  • 为提升团队协作与可复现性,部署GCP+Nextflow+Docker标准化流水线,并建立版本控制与报告自动生成系统,使项目交付效率提高50%,团队维护的代码库被公司内部3个其他团队复用。

团队管理蛋白质组学转录组学单细胞分析机器学习云计算GCP数据可视化

项目经历

核心开发者某生物信息学开源社区
2020-06 - 2021-02
核心开发者
  • 主导设计基于Python/NumPy/Scipy的多样本整合算法模块,支持500+单细胞RNA-seq样本的批次校正,将计算内存开销降低40%,被社区合并到主分支并用于超过20个科研项目。

  • 作为核心开发者,为开源单细胞分析工具贡献1.5万+行代码,包含核心聚类与可视化功能,通过Git进行版本管理和协作,工具在GitHub上获得超过800个star和200次fork。

  • 编写完整API文档及两篇中文教程,覆盖80%的公共接口,并维护30+ issue的及时响应,帮助新用户快速上手,使工具的周活跃用户增长至150+。

  • 主导v0.3.0和v0.4.0两次重要版本迭代,通过代码审查和测试用例优化,将单元测试覆盖率从60%提升至92%,并引入持续集成(CI)流程确保代码稳定性。

单细胞RNA-seq算法实现PythonNumPyScipyGit文档编写

教育经历

浙江大学生命科学学院生物信息学硕士GPA: 3.8/4.0
2017-09 - 2019-06

Sample data, for reference only