Principal Engineer - Resiliency

Insight Global

Austin (TX)

On-site

USD 180,000 - 280,000

Full time

3 days ago
Be an early applicant
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Insight Global seeks a Principal Engineer to own the resiliency strategy for a large-scale AWS environment. This role defines availability standards, leads BC/DR initiatives, and drives high-availability architectures across infrastructure, containers, data platforms, and engineering teams.

The successful candidate has 12+ years in engineering with 7+ in resiliency, extensive AWS multi-account/multi-region experience, and a proven ability to balance reliability with cost and complexity.

Qualifications

  • 12+ years of engineering experience, incl. 7+ years owning resiliency architecture.
  • Deep AWS experience across multi-account, multi-region environments.
  • Proven BC/DR strategy, automated failover and RTO/RPO testing.

Responsibilities

  • Own AWS resiliency strategy, availability standards, and multi-AZ/multi-region architecture.
  • Define active-active, active-passive, warm-standby, and pilot-light patterns.
  • Lead BC/DR planning, including RTO/RPO targets, automated failover, runbooks, DR testing, and game days.
  • Conduct AWS Well-Architected Reviews and drive remediation efforts.
  • Build resiliency across ECS/Fargate, EKS, Aurora, RDS, DynamoDB, ElastiCache, and S3.
  • Automate recovery using IaC, self-healing, drift detection, and fault injection.
  • Establish SLOs, error budgets, health checks, dependency mapping, and observability standards.
  • Lead availability incident response and convert recurring failures into architectural improvements.

Skills

Senior engineering
Resiliency architecture
AWS multi-account
EKS / ECS
Terraform / IaC
BC/DR planning
Chaos engineering
Observability & SLOs
Cross-functional leadership

Tools

Terraform/IaC
CI/CD tooling

Job description

Seeking a Principal Engineer to own the resiliency strategy and reference architecture for a large-scale AWS environment. This individual will establish availability standards, lead business continuity and disaster recovery initiatives, and drive high-availability architecture across infrastructure, containers, data platforms, and engineering teams.

Required Skills & Experience
  • 12+ years of engineering experience, including 7+ years owning large-scale resiliency or high-availability architecture.
  • Deep hands-on AWS experience across multi-account, multi-region environments, networking, IAM, Route 53, load balancing, and Global Accelerator.
  • Proven ownership of multi-AZ/multi-region architecture, BC/DR strategy, automated failover, RTO/RPO, and recovery testing.
  • Expertise in the AWS Well-Architected Framework and production container platforms, including EKS and ECS/Fargate.
  • Strong data resiliency experience with Aurora/RDS and at least one of DynamoDB, ElastiCache, or S3 replication.
  • Advanced Terraform/IaC and infrastructure CI/CD experience, including state management, guardrails, and drift detection.
  • Hands-on experience with chaos engineering, observability, SLOs, error budgets, and incident response.
  • Strong cross-functional leadership with the ability to balance availability, cost, risk, and operational complexity.
Key Responsibilities
  • - Own AWS resiliency strategy, availability standards, and multi-AZ/multi-region architecture.
  • - Define appropriate active-active, active-passive, warm-standby, and pilot-light patterns.
  • - Lead BC/DR planning, including RTO/RPO targets, automated failover, runbooks, DR testing, and game days.
  • Conduct AWS Well-Architected Reviews and drive remediation efforts.
  • - Build resiliency across ECS/Fargate, EKS, Aurora, RDS, - DynamoDB, ElastiCache, and S3.
  • - Automate recovery using IaC, self-healing, drift detection, and fault injection.
  • - Establish SLOs, error budgets, health checks, dependency mapping, and observability standards.
  • - Lead availability incident response and convert recurring failures into architectural improvements.
  • - Partner with engineering, product, finance, and business leaders to balance reliability, cost, and operational complexity.
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Principal AWS Resiliency Architect
Principal AWS Resiliency Architect

Insight Global • Austin (TX)

Hybrid
USD 180,000 - 210,000
Principal AWS Resiliency Architect
Principal AWS Resiliency Architect

Insight Global • Austin (TX)

On-site
USD 180,000 - 280,000
Resiliency Architect
Resiliency Architect

ALLTECH CONSULTING SVC INC • Town of Texas (WI)

On-site
USD 100,000 - 130,000
AWS Resiliency Architect - Multi-Region HA Leader
AWS Resiliency Architect - Multi-Region HA Leader

Insight Global • Austin (TX)

Hybrid
USD 180,000 - 210,000
AWS Architect
AWS Architect

Sovereign Technologies, LLC. • Boston (MA)

On-site
USD 160,000 - 210,000
AWS Architect & Platform Engineering Lead
AWS Architect & Platform Engineering Lead

Micrologic • Parsippany-Troy Hills (NJ)

On-site
USD 140,000 - 190,000
AWS/Java Technical Architect
AWS/Java Technical Architect

Sovereign Technologies, LLC. • Northern (KY)

Hybrid
USD 140,000 - 200,000
Reliability Engineer
Reliability Engineer

Compunnel, Inc. • Town of Texas (WI)

On-site
USD 140,000 - 190,000
Software Dev Engineer, AWS Resilience Hub
Software Dev Engineer, AWS Resilience Hub

Amazon Web Services (AWS) • Seattle (WA)

On-site
USD 144,000 - 194,000
Health insurance
401(k) matching
Paid time off
+1
Cloud Engineer
Cloud Engineer

Gotham Technology Group • United States

On-site
USD 120,000 - 160,000