李想 · Big Data Instructor
工作经历
主导核心业务数据管道设计,基于Hadoop与Spark搭建日处理超50亿条用户行为日志的实时ETL系统,将数据入库延迟从小时级压缩至5分钟以内,支撑业务实时分析需求。
重构离线数仓ETL流程,使用Hive与SQL优化30余张核心事实表的调度依赖与分区策略,使全链路执行耗时减少42%,节省集群计算资源约15%。
设计并实现数据质量自动化校验框架,配置200+条校验规则(空值、重复、波动阈值),将异常数据率由3.2%降至0.4%,保障下游报表准确率达99.6%。
推动MapReduce作业向Spark迁移,重写核心ETL逻辑并优化Shuffle参数,使全量数据重跑时间从4.5小时缩短至1.8小时,作业稳定性提升至99.9%。
建立统一的数据血缘与任务监控看板,基于Hive元数据与Spark事件日志自动解析依赖关系,每周主动发现并解决10+个潜在链路风险,使交付效率提升30%。
主导实时计算架构升级:基于Flink与Kafka搭建低延迟数据管道,将事件处理延迟从分钟级压缩至秒级,日均处理超500万条业务事件,支撑上游实时报表与告警需求。
设计并落地离线数仓分层模型(ODS→DWD→DWS),结合HBase列簇优化存储结构,使核心查询响应时间缩短40%,数据冗余降低30%。
承担新人技术培训:制定涵盖Flink、Kafka、HBase及数仓理论的系统化培训计划,累计带教22名新员工,使其在3个月内独立承担模块开发任务,转正率100%。
攻克Flink状态后端与HBase的读写瓶颈:通过调整Checkpoint策略及HBase预分区方案,将实时任务稳定性从95%提升至99.9%,故障恢复时间减少60%。
组织6次内部技术分享与Workshop,覆盖实时计算最佳实践与数仓调优技巧,推动团队整体开发效率提升约25%。
针对电商平台大数据部门50+工程师的技能差距,主导设计并交付《Spark性能调优》与《Hive高级应用》两门核心课程,覆盖80%的数据处理场景,学员课后实战项目效率平均提升30%。
连续三个季度担任骨干讲师,累计为200+内部学员讲授离线数仓与实时计算实战课程,结合电商订单与用户行为数据设计5个真实项目,学员结业项目通过率达92%。
基于学员反馈与业务需求,迭代更新课程大纲6次,将Python数据处理模块与Hive UDF开发整合为标准化教学案例,培训周期从4周压缩至3周,满意度评分4.8/5.0。
独立开发配套实验环境与自动化考核题库,支撑200+次上机练习与25场随堂测验,帮助新入职员工提前2周独立承担ETL开发任务。
负责主讲大数据核心课程,主导实战项目设计,运用Hadoop、Spark、Flink及数据挖掘技术,结合教学管理方法完成关键知识交付与学员能力提升。
教育经历
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































