Lead SRE: Scalable, High-Availability Systems

Socket.dev

North Carolina

On-site

USD 150,000 - 210,000

Full time

3 days ago
Be an early applicant
Application generator

A complete application in a minute — tailored resume and cover letter, ready to send.

Get past ATS filters

Job summary

Fidelity Investments is seeking a Principal Site Reliability Engineer to design and lead reliability initiatives across distributed systems. You will architect resilient cloud-native platforms on AWS, implement CI/CD pipelines, and drive observability with Datadog, Grafana, and the ELK stack.

You will mentor engineers, perform advanced performance testing, and partner with leadership to define SLOs/SLIs, ensuring scalable, highly available services in a financial services environment.

Qualifications

  • DE performing software performance benchmarking for online financial web applications using JMeter, Rushhour, Locust, and K6; configuring CI/CD and test automation with Jenkins, Sonar, Maven, Artifactory, and Terraform in AWS.
  • DE solutioning, designing, architecting, and building scalable enterprise platforms using AWS services (EC2, ECS, Lambda, EMR, CloudFormation) and microservices on EKS.
  • DE analyzing and monitoring system performance across Apache, NGINX, Java, and Node.js; using Splunk, Datadog, Grafana, Kibana, and AWS CloudWatch.
  • DE instrumenting observability at scale; defining SLOs/SLIs; Python automation; IaC; alerting and incident response workflows.

Responsibilities

  • Defines and leads enterprise-level reliability strategies.
  • Architects resilient systems and infrastructure.
  • Creates and publishes performance test results with recommendations.
  • Maintains scalability and resiliency of complex environments.
  • Implements advanced observability practices at scale.
  • Manages and interprets large datasets using queries and visualization tools.
  • Advises senior leadership on reliability engineering best practices.
  • Mentors junior engineers.
  • Performs independent technical and functional analyses for initiatives.
  • Develops innovative solutions to improve availability, scalability, and performance.
  • Designs, implements, and maintains performance test frameworks.

Skills

Performance benchmarking
DevOps practices
Python scripting
Shell scripting
CI/CD pipelines
AWS
Kubernetes
Java
Spring Boot
Docker
EKS
Terraform
Monitoring & observability
Datadog
Splunk
Grafana
ELK stack
JMeter
Locust
RushHour
Jenkins
Maven
CloudFormation
CI/CD tools

Education

Bachelor's degree in Computer Science, Engineering, IT Management, IS Security, Business Administration
Five (5) years of experience as Principal Site Reliability Engineer (or closely related)
Master's degree in Computer Science, Engineering, IT Management, IS Security, Business Administration
Three (3) years of experience as Principal Site Reliability Engineer (or closely related)

Job description

Fidelity Investments is seeking a Principal Site Reliability Engineer to design and lead reliability initiatives across distributed systems. You will architect resilient cloud-native platforms on AWS, implement CI/CD pipelines, and drive observability with Datadog, Grafana, and the ELK stack.

You will mentor engineers, perform advanced performance testing, and partner with leadership to define SLOs/SLIs, ensuring scalable, highly available services in a financial services environment.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Principal SRE: Build Resilient, Scalable Cloud Systems
Principal SRE: Build Resilient, Scalable Cloud Systems

Worky • Durham (NC)

On-site
USD 150,000 - 210,000
Senior Site Reliability Engineer – Chaos & Observability
Senior Site Reliability Engineer – Chaos & Observability

Fidelity Investments • Westlake (TX)

On-site
USD 150,000 - 190,000
Lead SRE - Remote/Hybrid, Enterprise-Scale Reliability
Lead SRE - Remote/Hybrid, Enterprise-Scale Reliability

Empower Retirement • Greenwood Village (CO)

Hybrid
USD 114,000 - 166,000
Medical insurance
401(k) with company match
Tuition reimbursement
+3
Senior Site Reliability Engineer — Cloud, Chaos & Automation
Senior Site Reliability Engineer — Cloud, Chaos & Automation

Soteria Reinsurance Ltd. • Town of Texas (WI), Northern (KY)

Hybrid
USD 150,000 - 210,000
Senior SRE, Software Engineering (AWS / Scaling Infrastructure)
Senior SRE, Software Engineering (AWS / Scaling Infrastructure)

PulseRise Technologies • New York (NY)

Hybrid
USD 130,000 - 160,000
Senior Site Reliability Engineer — FinTech & Cloud Native
Senior Site Reliability Engineer — FinTech & Cloud Native

Longbridge • New York (NY)

On-site
USD 140,000 - 190,000
Lead SRE: Scale, Resilience & Cloud Automation
Lead SRE: Scale, Resilience & Cloud Automation

Federal Reserve Bank of New York • San Francisco (CA)

On-site
USD 147,000 - 234,000
Principal Site Reliability Engineer
Principal Site Reliability Engineer

Socket.dev • North Carolina

On-site
USD 150,000 - 210,000
Remote Principal SRE — FinTech Reliability Leader
Remote Principal SRE — FinTech Reliability Leader

Priority • United States

Remote
USD 181,000 - 201,000
Sr. Site Reliability Engineer
Sr. Site Reliability Engineer

MeridianLink • United States

Remote
USD 140,000 - 190,000