这是用于演示写法的虚构简历。姓名、任职经历和成果均为创作,并非真实员工的履历。
侯诗雨
从事使用Prometheus监控SLO和错误预算与基于追踪记录的故障响应与防复发测试的资深站点可靠性工程师。主要实践领域:Kubernetes · Terraform · Prometheus · SLO。
工作经历
英伟达
圣克拉拉 · 美国
资深站点可靠性工程师
2021年1月 - 至今
- 作为工作流负责人,使用Grafana错误预算消耗仪表盘和轮值(on-call)手册建设Kubernetes可观测性(observability),将告警关联到SLO和验证过的缓解措施,而非单纯CPU阈值。
- 负责制定评审标准,依据评审后的Terraform计划演练Linux节点替换,检查工作负载排空、存储挂载和恢复时间,记录原恢复流程中遗漏的挂载依赖。
- 作为工作流负责人,构建客户请求路径的Go探针及恢复记录的Python检查。在故障切换演练中发现进程正常但数据不全的问题,改进操作手册并通过重复演练完成恢复验证。
- 利用追踪、部署事件与SLO告警重建事故时间线,将触发故障的依赖失效纳入演练并测量恢复时间。
- 主导通过Prometheus告警和Grafana追踪开展值班恢复演练,解决Kubernetes依赖故障并在约定SLO窗口内完成回退。
- 通过Linux日志及Terraform状态构建Python调试检查,将事件分诊从32分钟缩短至14分钟并发布测试过的CI/CD恢复说明。
Datadog
纽约 · 美国
站点可靠性工程师
2016年3月 - 2020年12月
- 负责基于追踪记录的故障响应与防复发测试,并与协作团队明确决策标准和职责分工。与协作团队共同用复现测试阻断相同故障路径。
- 按现有接口契约评审变更,复现审核者提出的边界情况,并在合并前补齐测试或示例。
- 使用下游团队提供的版本和输入调查故障,缩减为最小复现测试,随修复交付兼容性说明,并在原案例通过后关闭报告。
重点项目
站点可靠性工程师独立案例研究
跨团队项目负责人
2023年3月 - 2023年7月
- 负责Terraform变更审查与漂移检测,并与协作团队明确决策标准和职责分工
- 构建正常、错误和中断输入的独立测试数据,在运行实现前记录预期响应,区分缺陷与假设变更。
- 在项目中打包复现步骤、配置和回归测试,从全新环境验证说明,记录不支持的情形而非声称可直接投产。
- 主导通过隔离输入构建独立回归测试,解决边界故障并发布附预期输出的可复现测试包。
教育经历
University of Washington
华盛顿州西雅图 · 美国
计算机科学学士
2008年9月 - 2012年6月
相关课程:算法、操作系统、数据库、计算机网络
技能
岗位能力
Kubernetes · Terraform · Prometheus · SLO · 事件响应
证书
AWS Certified Solutions Architect – Associate
Amazon Web Services
2023年11月

