Senior SRE - Observability & Cloud Reliability

Cisco Systems, Inc.

San Francisco (CA)

On-site

USD 168,000 - 245,000

Full time

4 days ago
Be an early applicant
Application generator

Get a reply from this employer — a resume and cover letter tailored to exactly what they’re hiring for.

Get past ATS filters

Benefits offered by this job

Medical benefits
401(k) matching
Parental leave
Life insurance

Job summary

Cisco Systems, Inc. is seeking an experienced Site Reliability Engineer to design, deploy, and operate enterprise observability platforms across logging, metrics, tracing, and alerting for large-scale cloud infrastructure.

You will lead efforts to improve visibility, reduce MTTD/MTTR, and strengthen reliability while supporting Kubernetes-based workloads and on-call incident response within a shared SRE pager. Strong collaboration with cross-functional teams is required.

Qualifications

  • 7+ years of experience in Site Reliability Engineering, Platform Engineering, DevOps, or related field.
  • Experience administering Splunk Enterprise or Splunk Cloud in a production environment.
  • Solid understanding of Splunk SPL and production dashboards, alerts, analytics.
  • Experience designing, deploying, operating Elasticsearch/ELK-based platforms.
  • Experience with Prometheus, Grafana, Grafana Tempo, OpenTelemetry, distributed tracing, Kafka.
  • Demonstrated experience implementing modern observability strategies across logs, metrics, traces.
  • Experience with Terraform and Infrastructure as Code practices.
  • Strong understanding of Linux, networking, distributed systems, high availability, production operations.
  • Programming or scripting in Python, Go, Ruby, Bash, or similar.
  • Experience troubleshooting production incidents and on-call/ops model.
  • Strong communication, collaboration, problem-solving skills.

Responsibilities

  • Design, deploy, operate, and continuously improve enterprise observability platforms.
  • Build and maintain Splunk Enterprise and Splunk Cloud infrastructure and integrations.
  • Deploy and operate large-scale Elasticsearch clusters for log analytics and troubleshooting.
  • Design, deploy, and support tracing platforms using Grafana Tempo and OpenTelemetry.
  • Build and maintain telemetry pipelines for logs, metrics, traces.
  • Define instrumentation standards, data quality, retention policies, observability patterns.
  • Scale and optimize Prometheus, Grafana, Kafka, Tempo, OpenTelemetry, and related systems.
  • Develop dashboards, alerts, analytics, and trace visualizations (Splunk SPL, Grafana, Kibana, Tempo).
  • Establish monitoring/alerting standards to improve visibility and MTTR.
  • Automate provisioning, configuration, upgrades, and operational processes with Terraform and other IaC tools.
  • Participate in capacity planning, performance tuning, upgrades, DR, and readiness reviews.
  • Troubleshoot complex distributed-systems issues and lead/root-cause analysis.
  • Collaborate with platform, application, security, DB, and network teams to improve reliability.
  • Contribute to shared SRE standards, runbooks, and engineering best practices.
  • Participate in on-call rotation for production services.

Skills

SRE experience
Splunk admin
SPL proficiency
Elasticsearch
Prometheus/Grafana
Terraform IaC
Linux/Networking
Programming (Python/Go)
Incident response
On-call reliability

Tools

Splunk Enterprise/Cloud
Elasticsearch
Kibana
Grafana Tempo/OpenTelemetry
Kafka
Kubernetes
Terraform
Ansible

Job description

Cisco Systems, Inc. is seeking an experienced Site Reliability Engineer to design, deploy, and operate enterprise observability platforms across logging, metrics, tracing, and alerting for large-scale cloud infrastructure.

You will lead efforts to improve visibility, reduce MTTD/MTTR, and strengthen reliability while supporting Kubernetes-based workloads and on-call incident response within a shared SRE pager. Strong collaboration with cross-functional teams is required.

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior SRE: Observability & Cloud Platform Engineer
Senior SRE: Observability & Cloud Platform Engineer

Cisco • San Francisco (CA)

On-site
USD 168,000 - 245,000
Medical, dental, and vision insurance
401(k) with Cisco matching
Paid parental leave
+3
Senior SRE - Observability & Cloud Platform Lead
Senior SRE - Observability & Cloud Platform Lead

Cisco • Nashville (TN)

On-site
USD 168,000 - 245,000
Senior Observability SRE – Kubernetes & Cloud
Senior Observability SRE – Kubernetes & Cloud

Cisco • San Francisco (CA)

On-site
USD 168,000 - 245,000
Senior Site Reliability Engineer – Observability
Senior Site Reliability Engineer – Observability

Cisco • Boise (ID)

On-site
USD 120,000 - 170,000
Senior SRE: Scale Reliability, Observability & Resilience
Senior SRE: Scale Reliability, Observability & Resilience

Early Warning Services LLC • Scottsdale (AZ)

Hybrid
USD 106,000 - 130,000
Healthcare Coverage
401(k) Retirement Plan
Paid Time Off
+2
Senior Observability & Reliability Engineer
Senior Observability & Reliability Engineer

Cisco • Boise (ID)

On-site
USD 120,000 - 170,000
Senior SRE: Cloud-Native Reliability & Automation
Senior SRE: Cloud-Native Reliability & Automation

020 Cisco Systems, Inc. • San Francisco (CA)

Hybrid
USD 168,000 - 245,000
Senior Site Reliability Engineer: Observability & Cloud
Senior Site Reliability Engineer: Observability & Cloud

VBeyond Corporation • Jersey City (NJ)

On-site
USD 100,000 - 260,000
Senior SRE - Hybrid, Observability & Reliability
Senior SRE - Hybrid, Observability & Reliability

Early Warning Services LLC • Chicago (IL)

Hybrid
USD 106,000 - 130,000
Healthcare Coverage
401(k) Plan with match
PTO and Holidays
+1
Senior SRE: Cloud-Native Reliability & Observability
Senior SRE: Cloud-Native Reliability & Observability

UnitedHealth Group • Schaumburg (IL)

Remote
USD 92,000 - 164,000
Telecommute within US