跳到正文

站点可靠性工程师简历示例(实习)

参考站点可靠性工程师(实习)简历,了解如何写清职责与成果,并组织项目经历、教育背景和技能。

英伟达参考职位工作地点: 圣克拉拉 · 美国本例为虚构内容,并非真实员工简历或企业官方材料。

这是用于演示写法的虚构简历。姓名、任职经历和成果均为创作,并非真实员工的履历。

萧若彤

站点可靠性工程师实习生 · 圣克拉拉 · 美国

从事使用Prometheus监控SLO和错误预算与基于追踪记录的故障响应与防复发测试的站点可靠性工程师实习生,实务在指导下完成。主要实践领域:Kubernetes · Terraform · Prometheus · SLO。

工作经历

英伟达

圣克拉拉 · 美国

站点可靠性工程师实习生

2026年6月 - 2026年8月

  • 在指导下,利用追踪、部署事件与SLO告警重建事故时间线,将触发故障的依赖失效纳入演练并测量恢复时间。
  • 团队负责使用Prometheus监控SLO和错误预算;实习期间,我在导师指导下协助准备资料、核验结果和整理文档。团队整体将告警聚焦于影响客户的故障。与导师核对我的贡献范围,仅记录分配的支持任务和验证工作。
  • 团队负责Kubernetes区域切换与数据恢复演练;实习期间,我在导师指导下协助准备资料、核验结果和整理文档。团队整体发现恢复流程遗漏的依赖。与导师核对我的贡献范围,仅记录分配的支持任务和验证工作。
  • 在指导下,主导通过Prometheus告警和Grafana追踪开展值班恢复演练,解决Kubernetes依赖故障并在约定SLO窗口内完成回退。
  • 在指导下,通过Linux日志及Terraform状态构建Python调试检查,将事件分诊从32分钟缩短至14分钟并发布测试过的CI/CD恢复说明。

重点项目

站点可靠性工程师独立案例研究

实习项目成员

2025年9月 - 2026年5月

  • 在导师评审的模拟实习中,使用Grafana错误预算消耗仪表盘和轮值(on-call)手册建设Kubernetes可观测性(observability),将告警关联到SLO和验证过的缓解措施,而非单纯CPU阈值。
  • 在后续指导练习中,依据评审后的Terraform计划演练Linux节点替换,检查工作负载排空、存储挂载和恢复时间,记录原恢复流程中遗漏的挂载依赖。
  • 在指导下,团队负责Terraform变更审查与漂移检测;实习期间,我在导师指导下协助准备资料、核验结果和整理文档
  • 构建正常、错误和中断输入的独立测试数据,在运行实现前记录预期响应,区分缺陷与假设变更。
  • 在项目中打包复现步骤、配置和回归测试,从全新环境验证说明,记录不支持的情形而非声称可直接投产。
  • 主导通过隔离输入构建独立回归测试,解决边界故障并发布附预期输出的可复现测试包。

教育经历

University of Washington

华盛顿州西雅图 · 美国

计算机科学学士 · 在读

2023年9月 - 2027年6月

相关课程:算法、操作系统、数据库、计算机网络

技能

岗位能力

Kubernetes · Terraform · Prometheus · SLO · 事件响应

证书

AWS Certified Solutions Architect – Associate

Amazon Web Services

2025年12月

发表内容

  • 通过项目前后追踪发布独立技术笔记,说明失效假设、回归覆盖及实现不支持的情况。

站点可靠性工程师简历与招聘要求对照

查看哪些具体经历能够支持招聘要求。

英伟达

Senior Site Reliability Engineer, AIOPs

圣克拉拉 · 美国资深

查看招聘信息原文

本简历为虚构示例。最新信息请以招聘原文为准。

  • 招聘要求
      • Kubernetes
      关键词与实践经历均有体现

    Own Kubernetes deployments end-to-end (runbooks, canary checks, post-deploy validation), and lead rollbacks/remediations when needed.

    简历中的对应经历
    团队负责Kubernetes区域切换与数据恢复演练;实习期间,我在导师指导下协助准备资料、核验结果和整理文档。团队整体发现恢复流程遗漏的依赖。与导师核对我的贡献范围,仅记录分配的支持任务和验证工作。
    站点可靠性工程师实习生 · 英伟达
  • 招聘要求
      • Terraform
      • Python
      • CI/CD
      • 调试
      关键词与实践经历均有体现

    Manage deployment infrastructure and packaging (Helm + Terraform/IaC) to keep environments scalable, consistent, and reproducible.

    Automation-first approach: solid scripting (Python/Bash), CI/CD, and infrastructure-as-code (Terraform + Helm) to deliver safe rollouts (canaries/rollbacks), reproducible environments, and minimal toil.

    Deep Kubernetes + containers experience (deploying, debugging, scaling) for telemetry-heavy microservices—ingestion, processing, storage, APIs, and UI.

    简历中的对应经历
    在指导下,通过Linux日志及Terraform状态构建Python调试检查,将事件分诊从32分钟缩短至14分钟并发布测试过的CI/CD恢复说明。
    站点可靠性工程师实习生 · 英伟达
  • 招聘要求
      • 可观测性
      关键词与实践经历均有体现

    Proven ownership of reliability for an observability/AIOps platform: SLOs/SLIs, on-call, addressing incidents, and follow-up evaluations that drive measurable improvements.

    简历中的对应经历
    在导师评审的模拟实习中,使用Grafana错误预算消耗仪表盘和轮值(on-call)手册建设Kubernetes可观测性(observability),将告警关联到SLO和验证过的缓解措施,而非单纯CPU阈值。
    站点可靠性工程师独立案例研究
  • 招聘要求
      • 分布式系统
      未找到相关经历

    BS/MS in CS/CE (or equivalent experience) and 5+ years operating production distributed systems as SRE/DevOps/Platform Ops.

    简历中的对应经历

    未找到支持此要求的经历。没有实际经验时,不要只添加关键词。

再查看5项匹配要求
  • 招聘要求
      • 值班
      • Grafana
      关键词与实践经历均有体现

    Proven ownership of reliability for an observability/AIOps platform: SLOs/SLIs, on-call, addressing incidents, and follow-up evaluations that drive measurable improvements.

    Proven experience running large‑scale production deployments and multiple Kubernetes environments or clusters across teams or customers, coordinating changes and rollouts with minimal disruption with hands‑on experience with observability tools — you know your way around dashboards, metrics, logs, and traces using platforms like Prometheus, Grafana, or similar.

    简历中的对应经历
    在指导下,主导通过Prometheus告警和Grafana追踪开展值班恢复演练,解决Kubernetes依赖故障并在约定SLO窗口内完成回退。
    站点可靠性工程师实习生 · 英伟达
  • 招聘要求
      • Linux
      关键词与实践经历均有体现

    Strong Linux + networking fundamentals, distributed systems instincts, and hands-on ops for Kubernetes/services/streaming stacks are ideal; bonus for experience with observability platforms at scale.

    简历中的对应经历
    在后续指导练习中,依据评审后的Terraform计划演练Linux节点替换,检查工作负载排空、存储挂载和恢复时间,记录原恢复流程中遗漏的挂载依赖。
    站点可靠性工程师独立案例研究
  • 招聘要求
      • Prometheus
      • 监控
      关键词与实践经历均有体现

    Proven experience running large‑scale production deployments and multiple Kubernetes environments or clusters across teams or customers, coordinating changes and rollouts with minimal disruption with hands‑on experience with observability tools — you know your way around dashboards, metrics, logs, and traces using platforms like Prometheus, Grafana, or similar.

    Experience building safe automation that operators trust: canary releases, automated rollback criteria, “monitoring for the monitoring” (lag/drop/error budgets), and replay/backfill pipelines with correctness checks.

    简历中的对应经历
    团队负责使用Prometheus监控SLO和错误预算;实习期间,我在导师指导下协助准备资料、核验结果和整理文档。团队整体将告警聚焦于影响客户的故障。与导师核对我的贡献范围,仅记录分配的支持任务和验证工作。
    站点可靠性工程师实习生 · 英伟达
参考资料2项查阅日期

从这个示例开始,用你的经历完成简历。

在编辑器中打开示例,将工作经历、项目与成果替换为你自己的真实经历。