这是用于演示写法的虚构简历。姓名、任职经历和成果均为创作,并非真实员工的履历。
萧若彤
从事使用Prometheus监控SLO和错误预算与基于追踪记录的故障响应与防复发测试的站点可靠性工程师实习生,实务在指导下完成。主要实践领域:Kubernetes · Terraform · Prometheus · SLO。
工作经历
英伟达
圣克拉拉 · 美国
站点可靠性工程师实习生
2026年6月 - 2026年8月
- 在指导下,利用追踪、部署事件与SLO告警重建事故时间线,将触发故障的依赖失效纳入演练并测量恢复时间。
- 团队负责使用Prometheus监控SLO和错误预算;实习期间,我在导师指导下协助准备资料、核验结果和整理文档。团队整体将告警聚焦于影响客户的故障。与导师核对我的贡献范围,仅记录分配的支持任务和验证工作。
- 团队负责Kubernetes区域切换与数据恢复演练;实习期间,我在导师指导下协助准备资料、核验结果和整理文档。团队整体发现恢复流程遗漏的依赖。与导师核对我的贡献范围,仅记录分配的支持任务和验证工作。
- 在指导下,主导通过Prometheus告警和Grafana追踪开展值班恢复演练,解决Kubernetes依赖故障并在约定SLO窗口内完成回退。
- 在指导下,通过Linux日志及Terraform状态构建Python调试检查,将事件分诊从32分钟缩短至14分钟并发布测试过的CI/CD恢复说明。
重点项目
站点可靠性工程师独立案例研究
实习项目成员
2025年9月 - 2026年5月
- 在导师评审的模拟实习中,使用Grafana错误预算消耗仪表盘和轮值(on-call)手册建设Kubernetes可观测性(observability),将告警关联到SLO和验证过的缓解措施,而非单纯CPU阈值。
- 在后续指导练习中,依据评审后的Terraform计划演练Linux节点替换,检查工作负载排空、存储挂载和恢复时间,记录原恢复流程中遗漏的挂载依赖。
- 在指导下,团队负责Terraform变更审查与漂移检测;实习期间,我在导师指导下协助准备资料、核验结果和整理文档
- 构建正常、错误和中断输入的独立测试数据,在运行实现前记录预期响应,区分缺陷与假设变更。
- 在项目中打包复现步骤、配置和回归测试,从全新环境验证说明,记录不支持的情形而非声称可直接投产。
- 主导通过隔离输入构建独立回归测试,解决边界故障并发布附预期输出的可复现测试包。
教育经历
University of Washington
华盛顿州西雅图 · 美国
计算机科学学士 · 在读
2023年9月 - 2027年6月
相关课程:算法、操作系统、数据库、计算机网络
技能
岗位能力
Kubernetes · Terraform · Prometheus · SLO · 事件响应
证书
AWS Certified Solutions Architect – Associate
Amazon Web Services
2025年12月

