陈思远 · Architect

中文·executive #高端技术职位 #首席架构师
陈思远
首席架构师
188 8888 8888 · zhouba@example.com · zhouba · 上海
github.com/username
· 1987-11 · 在职-看机会 · 30K-50K
汉族 · 中共党员 · 江苏南京 · 已婚

个人总结

陈思远拥有12年分布式系统与AI基础设施深度实践经验,从底层存储引擎到上层AI推理平台,主导构建了多个支撑万亿级数据处理的超大规模系统。核心成果包括:自主研发日均处理1.2万亿条消息的流计算引擎(峰值吞吐1.8亿条/秒,延迟<5ms),以及千亿参数多模态模型推理服务平台(推理延迟从180ms降至28ms,SLA达99.99%)。深耕分布式系统与云原生,精通Kubernetes、微服务、服务网格及全链路可观测性,曾设计万级节点容器编排平台与自适应反压调度器,实现资源利用率提升40%以上、系统可用性达99.995%。在AI基础设施领域,从零落地多模态训练平台与MLOps流水线,通过ZeRO-3、混合量化及GPU kernel融合等优化,将千亿模型训练效率提升60%、推理成本降低60%,精度损失<0.5%。

工作经历

后端工程师某初创科技公司
2012-07 - 2015-06
后端工程师|基础架构部

主导设计基于一致性哈希的数据分片策略,将存储节点从3个扩展至12个,读写吞吐量提升150%,支撑日均10亿条用户日志的持久化写入。 采用C++实现高性能网络层与本地存储引擎,优化RPC序列化与磁盘I/O,使单节点写入延迟压至2ms以内,整体系统可用性达99.95%。 引入基于Raft共识的自动故障恢复机制,将节点宕机后的数据重建时间从小时级缩短至15分钟,数据丢失率降至0.001%以下。 设计多副本冗余与数据校验策略,在断电、磁盘损坏等场景下实现100%数据完整性保护,支撑产品从MVP阶段平稳过渡到百万用户规模。

分布式存储一致性哈希C++故障恢复
高级软件工程师某头部云计算公司
2015-07 - 2018-08
高级软件工程师|云原生平台部

主导设计并落地基于Kubernetes的容器编排平台,将公司内部数百个异构微服务统一调度至万级节点集群,资源利用率提升40%,部署频率从周级缩短至分钟级。 牵头研发服务网格(Service Mesh)基础设施,通过Sidecar代理实现无侵入的流量治理与安全通信,支撑日均超百亿次服务调用,故障隔离时间从小时级降至秒级。 构建全链路可观测性系统,集成分布式追踪、指标监控与日志聚合,覆盖上千个微服务,服务异常定位耗时平均降低65%,帮助团队提前发现90%以上的性能瓶颈。 推动云原生架构标准化,制定容器化部署规范与治理策略,带领团队迁移核心业务至Kubernetes,使系统弹性伸缩能力提升3倍,突发流量下零宕机。 主导开源组件(如Kubernetes、Istio)的深度定制与性能优化,为内部定制化需求贡献了5个核心特性补丁,其中2个被社区合并,间接提升公司技术影响力。

Kubernetes微服务服务网格云原生可观测性
架构师某全球电商平台
2018-09 - 2020-12
架构师|交易中台

面对订单履约系统在双十一峰值千万级并发交易的瓶颈,主导架构升级:采用分布式事务框架(TCC + 最终一致性)保证资金与库存强一致性,通过分库分表(1024个分片)及两级缓存(本地+Redis集群)将订单查询延迟从80ms降至8ms,支撑峰值QPS突破300万,系统可用性保持在99.995%。 设计并落地全链路压测体系,模拟真实订单流从下单到履约全环节,提前暴露分布式事务超时与缓存穿透问题,优化后单机TPS提升5倍,压测覆盖率达90%,确保大促期间零故障。 主导完成存储层分库分表策略,按买家ID哈希+时间片双维度拆分,消除单库写入瓶颈,扩容至256个数据库实例,支撑日处理订单量从2000万提升至1.2亿,写入延迟稳定在5ms以内。 重构缓存架构:引入多级失效与预加载机制,核心订单状态缓存命中率从85%提升至99.2%,结合异步写回策略,将分布式事务接口平均响应时间从150ms压缩至25ms,同时降低DB连接数70%。

高并发分布式事务分库分表缓存设计全链路压测
高级架构师某智能科技集团
2021-01 - 2022-12
高级架构师|AI基础设施部

从零主导设计并落地多模态AI训练平台,整合数千张GPU的集群调度系统,通过定制化Kubernetes调度器与抢占式任务机制,将集群资源利用率从30%提升至85%,支撑百亿参数模型的并行训练。 构建统一模型服务网关,支持多模型热加载、动态批处理与A/B测试,结合自适应扩缩容策略,保障日均千万级推理请求的P99延迟低于100ms,服务SLA达99.95%。 搭建端到端MLOps流水线,实现数据版本、实验配置、模型Checkpoint的自动化追踪与回滚,并集成持续训练与部署管道,将模型迭代周期从3周压缩至2天。 设计分布式训练加速方案,采用ZeRO-3优化、流水线并行与混合精度训练,使千亿参数多模态模型的训练效率提升60%,单次迭代时间从30天降至12天。

AI平台GPU集群训练调度模型服务MLOps
首席架构师某头部AI公司
2023-01 - 至今
首席架构师|架构委员会

制定下一代通用AI系统的技术战略并主导架构设计,采用分层解耦的微服务与事件驱动架构,支持模型训练与推理的弹性扩展,系统日均处理超50亿次API请求,实现99.99%可用性。 主导技术选型与核心组件设计,引入自研的分布式调度引擎与混合精度优化策略,将千亿参数模型端到端训练效率提升40%,推理延迟降低至200毫秒以内。 带领30+人的架构团队,建立技术评审与知识沉淀机制,推动模块化设计与代码复用,使新功能开发周期缩短30%,系统可维护性评分提升至92分。 设计多区域多活部署方案与智能熔断降级策略,支撑突发流量峰值达百万QPS时零宕机,年度SLA达成99.999%。

系统架构技术选型团队指导高可用可扩展性

项目经历

架构师某智能科技集团
2021-06 - 2022-06
架构师|AI基础设施部

主导设计千亿参数模型推理服务平台,针对多模态模型推理时延瓶颈,引入INT8/FP8混合量化与GPU kernel级算子融合,将单次推理延迟从180ms压降至28ms,支撑实时交互场景的毫秒级响应。 构建基于Kubernetes的模型服务化框架,实现模型版本热加载、动态batch调度与GPU显存池化,将推理集群资源利用率从35%提升至72%,同时支撑日均1.2亿次API调用无抖动。 设计面向突发流量的弹性伸缩策略,结合请求队列长度与GPU利用率双指标自动扩缩容,在大促峰值流量下(30万QPS)成功将实例扩容延迟控制在15秒内,服务SLA维持在99.99%。 采用模型分片与流水线并行架构,将千亿参数模型部署在16卡A100集群上,通过显存零拷贝与异步推理流水线,实现端到端吞吐量达到行业基准的2.3倍,推理成本降低60%。 牵头制定模型量化与精度校准规范,在保持模型精度损失<0.5%的前提下,将模型体积压缩至1/4,大幅降低显存占用并支持单节点部署更大规模模型。

GPU推理优化模型服务化弹性伸缩模型量化
技术负责人某全球电商平台
2019-03 - 2020-09
技术负责人|交易中台

针对电商平台实时订单、支付及风控等万亿级日处理需求,主导自主研发分布式流计算引擎:基于Flink深度定制状态后端与异步检查点,引入增量快照与两级存储优化,实现Exactly-Once语义和毫秒级反压反馈控制,最终支撑每日1.2万亿条消息稳定处理,峰值吞吐达每秒1.8亿条,延迟中位数低于5ms。 为解决万亿级吞吐下反压引发任务雪崩的痛点,设计自适应反压感知调度器与动态资源伸缩机制:通过流量预测模型预分配计算槽位,结合背压水位线自动触发弹性扩缩容,使集群资源利用率从40%提升至82%,系统可用性达到99.995%,无一次因反压导致的级联故障。 在保障数据一致性与容错方面,主导构建分布式快照协调器与端到端Exactly-Once链路:基于轻量级屏障对齐算法与HDFS持久化状态,将恢复时间从分钟级压缩至3秒以内,支持跨500+节点同时故障后零数据丢失恢复,累计服务期间实现100%数据一致性。 针对万亿级状态存储与访问瓶颈,重新设计状态分区路由与本地化缓存层:引入分层LSM-Tree状态后端与热冷分离策略,结合异步增量检查点与多级缓存,使状态读写吞吐提升4倍,检查点完成时间从15秒降至2秒,支撑超过3000个并行计算槽位稳定运行。

流处理Flink状态管理Exactly-Once反压机制

教育经历

卡内基梅隆大学计算机科学学院计算机科学硕士
2010-09 - 2012-06

专业技能

分布式系统架构
9/10
精通
Kubernetes
7/10
熟练
微服务与云原生
7/10
熟练
数据库与缓存设计
7/10
熟练
AI平台与模型服务
7/10
熟练
流处理(Flink)
7/10
熟练
性能调优与全链路压测
7/10
熟练

荣誉奖项

某头部云计算公司年度技术创新奖honor
2021

表彰在云原生技术落地中的突出贡献

发明专利授权(5项)honor
2020

覆盖分布式存储、微服务治理、AI推理优化等领域

全球架构师峰会特邀讲师honor
2023

分享‘万亿级AI平台架构演进’主题演讲

Sample data, for reference only