Principal Site Reliability Engineer

Fidelity

United States

On-site

USD 120,000 - 180,000

Full time

6 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Fidelity is seeking a Principal Site Reliability Engineer to deliver services at scale, using automation and infrastructure as code. You will blend devops, SRE, and chaos testing to build reliable pipelines and platform availability for workplace investing and healthcare domains.

The role requires designing resilient systems, mentoring teams, and advising on technical strategy while partnering with stakeholders to ensure compliant, reliable IT operations.

Qualifications

  • Expertise in Site Reliability Engineering pillars to improve stability and platform availability for containerized workloads and on‑premises services.
  • Cloud and on‑premises systems management using IaC tools (Azure ARM, Terraform) with scalable distributed systems.
  • DevOps practices supporting delivery and operations using Jenkins, Azure DevOps, TFVC, and CloudFormation.

Responsibilities

  • Provides cloud support and enhances cloud capabilities per SRE principles—observability, automation, resiliency.
  • Develops and enhances internal chaos framework for chaos executions and reporting.
  • Facilitates adoption of chaos engineering by application teams and analyzes weaknesses to increase resiliency.
  • Designs products around SRE domain to improve stability and platform availability.
  • Collaborates with business and technology teams to scale products and automation across units.
  • Minimizes impact of operational problems by developing remediation strategies and tools.
  • Provides technical leadership on chaos testing for cloud and on‑prem applications.
  • Develops scripts to automate repeatable business processes and assist program needs.

Skills

Site Reliability Engineering
Kubernetes
PowerBi
Grafana
DevOps practices

Education

Bachelor's degree in Computer Science, Engineering, Information Technology, Information Systems, or related field
Master's degree in Computer Science, Engineering, Information Technology, Information Systems or related field

Tools

Azure ARM
Terraform
Datadog
Splunk
Jenkins
Azure DevOps
Team Foundation Version Control
CloudFormation Template
AWS Lambda
API Gateway
Fault Injection Service (FIS)
Azure Chaos Studio
Python

Job description

Note: Fidelity will not provide immigration sponsorship for this position.

Position Description :

Delivers services at high scale and high availability with resilience by using automation and Infrastructure Code. Builds reliability into the ecosystem by applying best practices in resiliency engineering and observability by developing resiliency tools and capabilities for observability and chaos testing of pipelines. Combines systems and software engineering techniques with site reliability engineering practices to create reliable user experiences to support workplace investing, healthcare and defined benefits organizations. Assists teams scale through production insights, operational automation, developer guidance, real-time metrics, and automation. Provides training, support, and alignment to ensures Site Reliability Engineers have the skills, tools, and opportunities to accomplish engineering reliable systems. Provides Product and Platform teams with engineering expertise that enables them to clarify and achieve their system reliability goals. Partners with our key stakeholders in defining and adopting policies, processes and practices that lead to reliable Information Technology systems and measures compliance with those policies.

Primary Responsibilities:
  • Provides cloud support and enhances cloud capabilities according to Site Reliability Engineering principles -- observability, automation, and resiliency.
  • Develops and enhances internal chaos framework to streamline chaos executions and reporting.
  • Facilitates the adoption of chaos engineering by application teams, helping to perform chaos testing, and to analyze business-critical applications to understand the weaknesses and increase application resiliency.
  • Develops and designs products created around the Site Reliability Engineering domain to improve stability and improve platform availability.
  • Collaborates with business and technology teams to scale the products and automation across business units.
  • Minimizes the impact of operational problems by developing strategies and tools to remediate the issues.
  • Provides technical leadership on chaos testing for cloud and on-premises based applications.
  • Develops scripts and applications to automate repeatable business processes.
  • Advises senior management on technical strategy and tools.
  • Mentors team members to build core competencies required in Site Reliability Engineering space.
Education and Experience :

Bachelor's degree in Computer Science, Engineering, Information Technology, Information Systems, or a closely related field (or foreign education equivalent) and five (5) years of experience as a Principal Site Reliability Engineer (or closely related occupation) designing and automating container and Cloud-based platform products and infrastructure solutions within a production environment.

Or, alternatively, Master's degree in Computer Science, Engineering, Information Technology, Information Systems or a closely related field (or foreign education equivalent) and three (3) years of experience as a Principal Site Reliability Engineer (or closely related occupation) designing and automating container and Cloud-based platform products and infrastructure solutions within a production environment.

Skills and Knowledge :
  • Demonstrated Expertise (\"DE\") developing and designing products created around Site Reliability Engineering pillars to improve stability and improve platform availability for containerized workloads and on-premises services using Kubernetes; managing and interpreting datasets using query languages; and developing reports using PowerBi and Grafana.
  • DE managing Cloud and on-premises systems using infrastructure-as-code tools -- Azure ARM and Terraform; and building, operating, monitoring, logging, and alerting services of distributed systems at scale and utilizing modern monitoring tools - Datadog and Splunk.
  • DE creating solutions that support DevOps practice for delivery and operations of services using Jenkins and Azure DevOps, Team Foundation Version Control, and Cloud Formation Template.
  • DE maintaining scalability and resiliency of applications deployed on Amazon Web Services (AWS) and Azure using LAMBDA, API Gateway, Fault Injection Service (FIS), and Azure Chaos Studio; and developing scripts and applications to automate repeatable business processes and providing solutions to program needs for applications hosted on Windows and Linux using Python.

#PE1M2 #LI-DNI

Certifications:
Category:

Information Technology Please be advised that Fidelity's business is governed by the provisi

Fidelity's Onsite Working Model

Fidelity is transitioning to a full-time onsite working model through a phased rollout across regions and roles. Currently, some roles and locations require 100% onsite presence, while others require less. Onsite expectations are likely to evolve as the rollout continues. This transition does not apply to fully remote roles.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Principal Site Reliability Engineer
Principal Site Reliability Engineer

Soteria Reinsurance Ltd. • Town of Texas (WI), Northern (KY)

Hybrid
USD 150,000 - 210,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Fidelity Investments • Durham (NC)

On-site
USD 120,000 - 180,000
Principal Full Stack Engineer
Principal Full Stack Engineer

Worky • Durham (NC)

On-site
USD 120,000 - 180,000
Senior SRE Leader: Cloud Resiliency & Chaos Engineering
Senior SRE Leader: Cloud Resiliency & Chaos Engineering

Fidelity • United States

On-site
USD 120,000 - 180,000
Sr. Site Reliability Engineer
Sr. Site Reliability Engineer

MeridianLink, Inc. • Northern (KY)

Hybrid
USD 140,000 - 210,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Veloc Inc • Coppell (TX)

On-site
USD 140,000 - 190,000
Principal Digital Assets Engineer
Principal Digital Assets Engineer

Fidelity • United States

On-site
USD 150,000 - 190,000
Senior Site Reliability Engineer — Cloud, Chaos & Automation
Senior Site Reliability Engineer — Cloud, Chaos & Automation

Soteria Reinsurance Ltd. • Town of Texas (WI), Northern (KY)

Hybrid
USD 150,000 - 210,000
Senior Cloud Engineer
Senior Cloud Engineer

Fidelity • United States

On-site
USD 115,000 - 128,000
Principal Systems Engineer
Principal Systems Engineer

Soteria Reinsurance Ltd. • Durham (NC)

On-site
USD 140,000 - 200,000