林逸风 · 生物信息工程师

中文·tech #生物医药 #专家
林逸风
生物信息工程师
186 6666 6666wangwu@example.comwangwu上海
1995-08在职-看机会13K-20K
汉族共青团员陕西西安已婚

个人总结

8年生物信息全栈经验,深入临床诊断、互联网云平台、跨国药企与创新药研发,专精高通量测序算法、多组学数据挖掘与高性能计算,致力于用计算生物学驱动精准医学从数据到疗法的转化。

工作经历

生物信息工程师某基因科技新锐
2016-08 - 2018-06
生物信息工程师|研发中心
  • 主导构建基于GATK、Python与R的全自动NGS肿瘤伴随诊断生信管线,覆盖FASTQ质控、比对、变异检测与注释全流程,将单样本端到端分析周期从72小时压缩至6小时,支撑月均300+份临床报告输出。

  • 针对FFPE与血浆cfDNA样本低频突变,开发UMI降噪算法,将体细胞突变检出灵敏度提升至0.1% VAF,同时保持>99%特异性,使液体活检产品检测限提前一期。

  • 整合COSMIC、ClinVar、gnomAD与自建东亚人群频率库,构建肿瘤特异性分层注释与致病性判定规则引擎,使变异分类一致性达98.5%,人工复核工作量减少80%。

  • 主导3款实体瘤Panel的分析流程开发与临床验证,累计完成2,500+例真实临床样本(FFPE/血浆)分析,分析成功率97.6%,助力公司首款伴随诊断试剂盒获NMPA受理。

  • 建立可复用的R Markdown自动化报告与可视化模板体系,适配15个癌种、100+目标基因,将报告输出效率提升8倍,并全程支持注册申报中的数据审计与追溯。

PythonRGATK变异检测NGS数据分析
高级算法工程师某互联网大厂
2018-07 - 2020-09
高级算法工程师|医疗AI实验室
  • 为满足互联网大厂云平台日均百亿级测序读段处理需求,主导自研并行化序列比对加速引擎,以C++重写核心比对算法并基于CUDA实现细粒度GPU并行,将单样本全基因组比对耗时从数小时级压缩至分钟级,端到端管线整体处理时间降低90%。

  • 设计多级异步流水线与自适应分块策略,在单8卡GPU节点上实现每秒逾2,000万条读段的比对吞吐量,支撑多个十万人级群体基因组重测序项目高效交付。

  • 引入基于深度学习的读段质量评估前置网络,构建注意力机制驱动的信噪分离模块,自动滤除低质量与接头污染区域,使进入比对的有效数据通量提升约3倍,显著降低无效计算与下游变异分析的假阳性噪声。

  • 推动引擎与云原生调度系统深度融合,结合弹性GPU集群与竞价实例优化资源分配,将单例测序分析平均计算成本降低76%,最终沉淀为云端核心生命科学计算服务,累计处理超400 PB测序数据,为公司赢得顶级研究机构批量订单。

C++GPU编程深度学习序列比对并行计算
生物信息科学家跨国药企R&D
2020-10 - 2022-12
生物信息科学家|生物标志物与转化医学部
  • 整合TCGA、ICGC及公司内部临床多组学数据,设计涵盖突变、免疫浸润与HLA分型的多组学特征工程流程,构建包含12,000+样本、300+临床特征的分析基座,显著提升标志物发现的统计效力。

  • 基于R语言开发Cox生存森林与贝叶斯分层模型,解析多基因交互对免疫检查点抑制剂疗效的影响,经10-fold交叉验证将响应预测AUC由0.71提升至0.89,假阳性率降低43%。

  • 结合SHAP可解释性分析与高通量CRISPR功能筛选,从600+候选生物标志物中锁定并验证3个新型预测靶点,经湿实验确认其调控T细胞耗竭与抗原呈递的功能,填补PD-L1阴性人群标志物空白。

  • 主导3项药物基因组学桥接研究,将新靶点转化为伴随诊断算法及患者分层策略,嵌入全球II期适应性临床试验,使低突变负荷亚组客观缓解率从9%提升至27%,推动项目优先进入III期。

  • 成果以3篇共一/通讯SCI论文发表于《Cancer Discovery》等期刊,申请2项PCT专利(其中1项已授权),并受邀在AACR年会作口头报告。

R机器学习TCGA临床生信药物基因组学
资深生物信息工程师医疗数据平台公司
2023-01 - 2024-04
资深生物信息工程师|数据科学部
  • 牵头架构基于Spark与SQL的分布式多模态融合引擎,整合全国头部肿瘤中心超40万例患者的影像、病理与多组学数据,建成PB级结构化数据湖,将跨模态实时查询延迟控制在亚秒级,支撑20+项真实世界研究分析。

  • 利用NLP技术构建病理报告语义抽取管线,从3,000余万份非结构化文本中提取肿瘤分期、生物标志物及治疗方案等实体,与DICOM影像及多组学特征进行统一向量化索引,使表型-基因型跨模态搜索效率提升25倍。

  • 设计多层级数据可视化分析平台,融合富交互影像浏览、组学热力图与临床事件时序分析,赋能临床科学家自主完成患者队列洞察与假设探索,将探索性分析周期从平均5天压缩至4小时内。

  • 基于多模态融合特征训练早期疗效预测模型,在免疫治疗队列中提前识别影像稳定但组学响应不一致的“假性进展”亚群,辅助合作伙伴将适应性试验决策速度提升40%,相关分析框架被纳入3项多中心研究方案。

SparkSQL自然语言处理数据可视化多模态融合
首席生物信息工程师某创新药新势力
2024-05 - 至今
首席生物信息工程师|计算生物学部
  • 主导构建整合AlphaFold结构预测与分子模拟的高通量虚拟筛选平台,通过Python编排GPU集群并行计算,将单靶点十亿级化合物库的全流程评估压缩至72小时,通量较外部合作方案提升12倍。

  • 针对某GPCR靶标结构精度不足的挑战,设计“预测-筛选-动力学验证”闭环管线,3个月内从百万分子库中识别并优化出2个纳摩尔级先导小分子,直接推动一条内部管线进入先导物确证阶段。

  • 搭建蛋白质-抗体界面高性能模拟与自由能解析框架,赋能抗体工程团队在4个月内将候选分子亲和力提升50倍,成功交付1款具备可开发性的优化变体。

  • 为公司早期药物发现建立标准化计算流程与Python分析工具套件,覆盖分子对接、ADMET预测与结合自由能计算,支撑3条治疗管线在立项6个月内获得首批有专利前景的先导化合物系列。

  • 组建并带领4人计算化学与生物信息团队,制定虚拟筛选平台技术策略,与药化团队协同在免疫炎症和代谢领域率先验证平台能力,累计产出8个结构新颖的先导化合物系列。

AlphaFold分子模拟高性能计算Python药物设计

项目经历

维护者OpenScMulti 开源社区
2019-01 - 2022-12
维护者
  • 为解决单细胞多组学分析中R与Python生态割裂的痛点,主导设计并开发跨语言统一分析R包OpenScMulti,深度内嵌Seurat与Scanpy互操作层,使用户在同一条流水线中即可完成批次校正、细胞注释与轨迹推断,Bioconductor累计下载量至2022年底突破18万次,被150余篇生物医学研究引用,成为领域内广泛使用的统一分析框架。

  • 面向百万级细胞图谱批次校正的高内存与长耗时瓶颈,创新实现基于分块近似与记忆映射的Harmony优化方案,将人类肺图谱数据集校正峰值内存从132GB压降至28GB,整体运行时间缩短60%,成功支撑一项国际大型单细胞图谱计划的整合分析任务。

  • 重构轨迹推断核心引擎,首次将基于图的扩散伪时间与RNA速率分析统一为多分叉推断算法,在造血分化等标准数据集上拓扑准确度(HAM)较Slingshot提升27%,该模块成为框架内使用率最高的组件,月均API调用逾8,000次。

  • 作为社区唯一维护者,建立跨平台CI、全量单元测试与自动化文档体系,审阅并合入来自约30个国家贡献者的210余次功能增强,将问题平均解决周期从3周缩短至4天,推动项目GitHub星标增至2.4k,并保持98%的Issue关停率。

单细胞组学R包开发ScanpySeurat轨迹推断

教育经历

浙江大学生命科学学院生物信息学博士GPA: 3.8/4.0
2011-09 - 2016-07

专业技能

NGS数据分析与变异检测
9/10
精通
单细胞组学分析
9/10
精通
机器学习与多模态融合
7/10
熟练
高性能计算与并行编程
7/10
熟练
临床生物信息学
7/10
熟练
计算药物设计
7/10
熟练
大数据处理
4/10
了解
生物信息学可视化
7/10
熟练
R包与工具开发
7/10
熟练

荣誉奖项

全国生物信息学应用竞赛个人一等奖honor
2016

获全国生物信息学应用竞赛个人一等奖,参赛方案被收录为优秀案例。

公司年度技术创新奖honor
2022

因肿瘤新抗原预测模型显著提升免疫治疗靶点发现效率而获奖。

OpenBio 开源贡献者之星honor
2023

因推动单细胞多组学分析生态建设被OpenBio基金会授予年度贡献者称号。

示例数据,仅供参考