陈景行 · Cloud Platform Engineer

中文·dashboard #运维、技术支持 #云平台架构专家
陈景行
云平台管理工程师
150 0000 1111wangwu@example.comwangwu成都
github.com/username
1995-08在职-看机会20K-30K
汉族共青团员陕西西安已婚

个人总结

8 年云平台全生命周期实践,覆盖通信云基础设施与互联网混合云架构,擅长以量化指标驱动高可用、成本与效能体系演进,逐步成长为数据导向型云架构专家。

  • 主导 300+ 节点电信云规模化部署、亿级并发混合云多活容灾、AI 算力池化与碳感知调度等关键项目,多次实现集群部署成功率 100%、全年可用性 99.99% 及资源交付效率提升 60% 以上。

  • 系统性构建 FinOps 成本治理与全栈可观测性双引擎,累计将故障发现与定位时间压缩 70% 以上、年节省云支出超千万,以数据闭环保障业务连续性并推动架构持续进化。

教育经历

3.7/4.0
电子科技大学
本科·网络工程·信息与通信工程学院2012.09 - 2016.06

专业技能

云平台与混合云架构90%
精通
基础设施即代码与自动化90%
精通
容器编排与云原生90%
精通
可观测性与监控90%
精通
性能工程与可靠性90%
精通
FinOps与成本优化70%
熟练
网络与安全90%
精通
AI基础设施与GPU调度40%
了解

荣誉奖项

FinOps云成本优化实践奖
2021.01
混合云架构最佳实践奖
2023.01

工作经历

2016
27mo
2016.07 → 2018.09
云计算工程师某通信设备商
云计算工程师
  • 参与运营商 NFV 电信云项目初始建设,基于 OpenStack 与 KVM 完成 300+ 物理节点的规模化部署,支撑核心网网元虚拟化试点,实现业务首次上线集群部署成功率 100%。

  • 设计多租户网络隔离方案,运用 VLAN 结合安全组划分管理、业务、存储等 6 个隔离平面,制定跨平面访问控制策略,在多次渗透测试中实现零越权事件。

  • 引入 Ansible 构建标准化组件交付流水线,实现从 OS 到 OpenStack 的全栈自动化部署与配置管理,将单节点上线时间由 2 天压缩至 4 小时以内,集群扩缩容效率提升 80%。

  • 搭建 Zabbix 分布式监控体系,覆盖计算、存储、网络等 2000+ 关键指标,结合告警分级与自愈脚本联动,将平均故障发现时间(MTTD)缩短约 60%。

#OpenStack#KVM#VLAN#Ansible#Zabbix
2018
23mo
2018.10 → 2020.08
高级运维开发工程师某云服务商
高级运维开发工程师
  • 针对自研云平台监控割裂、排障全靠人肉的困局,主导落地 Prometheus + Grafana 全栈可观测体系,统一纳管 1200+ 集群核心指标与 200+ 业务服务,推动告警准确率提升至 98%,将平均故障定位时间缩短 72%。

  • 面对资源交付依赖人工工单、周期长达数天的瓶颈,引入 Terraform 与 GitOps 驱动 CI/CD 流水线实现基础设施即代码,重塑计算/网络资源编排流程,将资源交付效率提升 60%,变更回滚从天级压缩至分钟级。

  • 基于 Python 与 Docker 重构自动化运维工具链,构建自愈引擎与智能扩缩容策略,覆盖 85% 以上高频故障场景,使夜间人工介入下降 90%,推动平台季度可用性稳定至 99.95%。

  • 将容量数据与 Grafana 看板联动,建立资源水位精细化治理机制,通过动态装箱与混合部署将集群碎片率从 27% 压降至 9%,等效释放数百万元计算资本。

#Prometheus#Grafana#Terraform#Python#Docker#CI/CD
2020
21mo
2020.09 → 2022.05
云平台架构师头部金融科技公司
云平台架构师
  • 主导某头部金融科技公司整体云安全架构重构,基于 AWS Organizations 与精细化 IAM 策略重塑账户及权限边界,落地最小权限模型并启用多因子审计,实现越权风险事件归零,一次性通过等保三级合规测评。

  • 设计面向交易、结算等核心业务的微分段安全体系,利用安全组策略与网络 ACL 构建零信任网络隔离,阻断横向移动攻击面 90% 以上,并通过渗透测试验证金融级防护能力。

  • 构建 FinOps 驱动的成本治理引擎,引入 Kubernetes HPA/VPA 弹性伸缩、Spot 实例混部及冷热数据分层,建立预算、标签与资源生命周期管理闭环,在业务调用量攀升 50% 的前提下年节省云支出逾 1200 万元。

  • 搭建多维度成本可视化与异常告警看板,驱动研发、业务方协同优化,将非生产环境资源闲置率从 35% 压降至 8%,实现云成本精细化运营。

#AWS#安全组策略#IAM#成本优化#FinOps#Kubernetes
2022
29mo
2022.06 → 2024.10
资深云架构专家某电商巨头
资深云架构专家
  • 主导电商核心交易链路的混合云多活容灾架构设计,引入 Service Mesh 实现跨云流量智能调度与故障自愈,将系统全年可用性提升至 99.99%,从容支撑亿级并发峰值。

  • 自研 Nginx + Lua 动态路由层,结合 Redis Cluster 异构数据同步方案,构建分钟级异地灾难切换能力,在多次实战演练中实现切换 RTO < 120 秒、数据 RPO 趋近于 0。

  • 构建常态化全链路压测体系,精准模拟混合云环境下真实流量分布,驱动容量瓶颈预判与自动弹性扩容,保障大促期间核心交易 P99 延迟低于 200ms。

  • 深化混合云可观测性建设,通过多集群联邦追踪打通全链路调用链,使跨云故障定位时间由小时级压缩至 5 分钟以内,将 MTTR 缩短 90% 以上。

  • 优化跨云数据面与控制面架构,裁撤冗余专线依赖并推行 Nginx 七层精准分流,在链路质量持平前提下降低跨云网络成本约 35%。

#混合云#多活容灾#Service Mesh#Nginx#Redis Cluster#全链路压测
2024
23mo
2024.11 → 至今
首席云平台架构师某互联网大厂
首席云平台架构师
  • 面对集团 AI 应用井喷与异构算力烟囱式浪费,主导制定全栈云原生技术演进蓝图,落地跨集群 GPU 虚拟化与统一池化调度,将碎片化加速卡利用率从 32% 拉升至 78%,AI 环境准备由天级缩短至分钟级。

  • 为实现算力底座碳中和,首创碳感知调度算法并通过 Kubernetes 扩展原生集成,动态将离线训练任务迁移至绿电充裕时段,年内头部区域数据中心 PUE 降至 1.19,训练工作负载碳强度下降 28%。

  • 基于 eBPF 构建内核级拓扑感知观测平面,打通网络、调度与 GPU 遥测数据,实现大模型推理微秒级热点定位与自适应流控,成功将在线推理服务长尾延迟 P99 降低 42%。

  • 推出内嵌 MLOps 与精细化计量能力的 AI Foundation 平台,为 15+ 业务单元提供从数据到上线的自服务能力,使 AI 应用迭代周期平均压缩 60%,算力闲置成本减少 25%。

#云原生#GPU池化#碳感知调度#eBPF#AI基础设施

Sample data, for reference only