Senior Site Reliability Engineer – Observability

Cisco

Boise (ID)

On-site

USD 120,000 - 170,000

Full time

13 hours ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Cisco is seeking an Observability-focused Site Reliability Engineer to design and operate enterprise-grade monitoring and tracing platforms for our cloud infrastructure in Boise. The role emphasizes building and maintaining Splunk, Elasticsearch, Grafana, Tempo, and OpenTelemetry pipelines.

You will collaborate across platform, application, security, and network teams, participate in on-call rotations, and drive reliability improvements across Cisco's cloud environment.

Qualifications

  • Design, build, and operate enterprise observability platforms.
  • Participate in on-call rotation and incident response.

Responsibilities

  • Design, deploy, operate, and improve observability platforms.
  • Build and maintain Splunk Enterprise/Cloud infrastructure.
  • Deploy and operate Elasticsearch clusters for log analytics.
  • Design, deploy, and support tracing platforms using Grafana Tempo and OpenTelemetry.
  • Build telemetry pipelines for logs, metrics, and traces.
  • Define instrumentation standards and data quality practices.
  • Scale and optimize monitoring systems like Prometheus, Grafana, Kafka, Tempo, and OpenTelemetry.
  • Develop dashboards and alerts using Splunk SPL, Grafana, Kibana, Tempo.
  • Automate provisioning, configuration, upgrades, and operations with Terraform.
  • Participate in capacity planning, performance tuning, and disaster recovery.

Skills

Kubernetes
Observability
SRE
Terraform
Grafana
OpenTelemetry
Splunk
Elasticsearch
Kibana
Tempo

Tools

Splunk
Elasticsearch
Grafana
Tempo
OpenTelemetry
Prometheus
Kibana
Terraform

Job description

The application window is expected to close on: 12/17/2026

Meet the Team

Join the Observability team within Cloud Network Platform Engineering's Site Reliability Engineering organization. You will help design, build, and operate enterprise observability platforms for logging, metrics, tracing, and alerting across large-scale cloud infrastructure.

This role will contribute to customer-facing production services, with an initial focus on Kubernetes-based platform workloads such as Nextunnel and broader SRE and reliability initiatives over time. You will lead efforts that improve visibility, reduce time to detect and resolve incidents, increase platform reliability, and strengthen operational excellence across Cisco's cloud environment.

The role includes participation in a shared SRE pager and on-call rotation, production support, and incident response.

Your Impact
  • Design, deploy, operate, and continuously improve enterprise observability platforms.
  • Build and maintain Splunk Enterprise and Splunk Cloud infrastructure, including indexers, Search Head Clusters, heavy forwarders, deployment servers, and related integrations.
  • Deploy and operate large-scale Elasticsearch clusters supporting log analytics, search, and operational troubleshooting.
  • Design, deploy, and support distributed tracing platforms using Grafana Tempo and OpenTelemetry.
  • Build and maintain end-to-end telemetry pipelines for logs, metrics, and traces.
  • Define instrumentation standards, data quality practices, retention policies, and observability patterns.
  • Scale and optimize Prometheus, Grafana, Kafka, Tempo, OpenTelemetry, and related monitoring systems.
  • Develop dashboards, alerts, analytics, and trace visualizations using Splunk SPL, Grafana, Kibana, and Tempo.
  • Establish monitoring and alerting standards that improve service-level visibility and reduce mean time to detect and resolve incidents.
  • Automate infrastructure provisioning, configuration, upgrades, and operational processes using Terraform and configuration management tools.
  • Participate in capacity planning, performance tuning, upgrades, patching, disaster recovery, and production readiness reviews.
  • Troubleshoot complex distributed-systems issues and lead or support incident response and root-cause analysis.
  • Partner with platform, application, security, database, and network engineering teams to improve reliability and operational consistency.
  • Contribute to shared S
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior SRE: Observability & Cloud Platform Engineer
Senior SRE: Observability & Cloud Platform Engineer

Cisco • San Francisco (CA)

On-site
USD 168,000 - 245,000
Medical, dental, and vision insurance
401(k) with Cisco matching
Paid parental leave
+3
Senior SRE - Observability & Cloud Platform Lead
Senior SRE - Observability & Cloud Platform Lead

Cisco • Nashville (TN)

On-site
USD 168,000 - 245,000
Senior Site Reliability Engineer – Observability
Senior Site Reliability Engineer – Observability

Cisco • San Francisco (CA)

On-site
USD 168,000 - 245,000
Senior SRE - Observability & Cloud Reliability
Senior SRE - Observability & Cloud Reliability

Cisco Systems, Inc. • San Francisco (CA)

On-site
USD 168,000 - 245,000
Medical benefits
401(k) matching
Parental leave
+1
Senior Observability SRE – Kubernetes & Cloud
Senior Observability SRE – Kubernetes & Cloud

Cisco • San Francisco (CA)

On-site
USD 168,000 - 245,000
Senior Observability & Reliability Engineer
Senior Observability & Reliability Engineer

Cisco • Boise (ID)

On-site
USD 120,000 - 170,000
Observability Engineer / Site Reliability Engineer
Observability Engineer / Site Reliability Engineer

Ontrac Solutions • New York (NY)

On-site
USD 120,000 - 190,000
Senior Site Reliability Engineer, Observability
Senior Site Reliability Engineer, Observability

Ripple • New York (NY)

On-site
USD 130,000 - 180,000
Site Reliability Engineer
Site Reliability Engineer

Veritas Search Group • Tustin (CA)

On-site
USD 140,000 - 190,000
Technical Operations Lead
Technical Operations Lead

First Citizens • Raleigh (NC)

On-site
USD 140,000 - 190,000