Sr Site Reliability Engineer (SRE)

CareCone Group

Sydney

On-site

AUD 180,000 - 240,000

Full time

22 hours ago
Be an early applicant
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

CareCone Group in Sydney seeks an experienced Sr Site Reliability Engineer (SRE) to design, build, and operate cloud platforms on AWS. You will drive automation, reliability, and scalability for mission-critical applications, partnering with engineering teams to improve release quality and customer experience.

The role focuses on AWS cloud engineering, infrastructure automation, CI/CD, observability, incident management, and resiliency within a highly regulated enterprise environment.

Qualifications

  • 8–10 years of experience in SRE/DevOps or related field
  • Strong AWS cloud engineering and automation background
  • Experience designing and operating cloud-native platforms in regulated environments

Responsibilities

  • Design, build, and maintain AWS cloud infrastructure and platform services
  • Develop and manage CI/CD pipelines using GitLab
  • Support cloud migration and platform modernization initiatives
  • Implement Infrastructure as Code (Terraform) and configuration management (Ansible)
  • Automate deployments, environment provisioning, database refreshes, and operational processes
  • Manage secrets, certificates, access controls, and cloud security controls
  • Develop reusable infrastructure modules and deployment standards

Skills

AWS Cloud
Terraform
Ansible
Kubernetes
CI/CD
Python scripting
Linux
Observability
Incident management
Security best practices

Education

Bachelor's degree in Computer Science or related field

Tools

GitLab
Grafana
Splunk/ELK
CloudWatch
Vault
Terraform
OpenTelemetry
Oracle migration tools

Job description

Role: Sr Site Reliability Engineer (SRE)

Experience: 8-10 years

Location: Sydney
Key Technologies

AWS | EKS | ECS | EC2 | Lambda | GitLab | Terraform | Ansible | Python | Bash | Linux | Kubernetes | Docker | PostgreSQL | Oracle | Vault | CloudWatch | OpenTelemetry | Grafana | Splunk | ELK | SLI | SLO | SLA | DevOps | Site Reliability Engineering

Role Summary

We are seeking an experienced AWS DevOps & Site Reliability Engineer (SRE) to build, automate, operate, and continuously improve cloud platforms and mission-critical applications. The role focuses on AWS cloud engineering, infrastructure automation, CI/CD, platform reliability, observability, incident management, resiliency, and operational excellence within a highly regulated enterprise environment.

The successful candidate will drive automation, reliability, performance, scalability, and availability of cloud-native platforms while partnering with engineering teams to improve release quality, operational stability, and customer experience.

Key Responsibilities
  • Design, build, and maintain AWS cloud infrastructure and platform services.
  • Develop and manage CI/CD pipelines using GitLab.
  • Support cloud migration and platform modernization initiatives.
  • Implement Infrastructure as Code (Terraform) and configuration management (Ansible).
  • Automate deployments, environment provisioning, database refreshes, and operational processes.
  • Manage secrets, certificates, access controls, and cloud security controls.
  • Develop reusable infrastructure modules, deployment standards, and platform engineering patterns.
Site Reliability Engineering
  • Define and implement reliability engineering practices, operational standards, and platform blueprints.
  • Establish and manage Service Level Indicators (SLIs), Service Level Objectives (SLOs), and Service Level Agreements (SLAs).
  • Improve platform reliability, scalability, resilience, and fault tolerance for mission-critical applications.
  • Drive proactive reliability improvements through automation and elimination of operational toil.
  • Conduct capacity planning, performance tuning, and resource optimization activities.
  • Support disaster recovery planning, backup validation, resilience testing, and business continuity initiatives.
  • Participate in production readiness reviews and ensure operational requirements are embedded into solution designs.
Observability & Monitoring
  • Design and implement monitoring, logging, alerting, and observability frameworks.
  • Build and maintain dashboards, health checks, metrics, and operational reporting.
  • Enhance end-to-end system visibility using CloudWatch, Grafana, Splunk, ELK, OpenTelemetry, or similar technologies.
  • Drive alert tuning and noise reduction to improve operational effectiveness.
  • Establish monitoring standards across applications, infrastructure, databases, and integration components.
Incident & Operational Management
  • Lead incident triage, troubleshooting, root cause analysis, and post-incident reviews.
  • Support production systems and provide timely resolution of infrastructure and application issues.
  • Drive reduction of Mean Time to Detect (MTTD) and Mean Time to Recover (MTTR).
  • Develop operational runbooks, knowledge articles, and recovery procedures.
  • Collaborate with engineering and support teams to implement preventative actions and continuous improvement initiatives.
  • Participate in on-call and major incident management activities where required.
  • Promote DevOps, SRE, and Platform Engineering best practices.
  • Collaborate with development teams to improve deployment reliability and automation maturity.
  • Integrate security, observability, and operational controls into CI/CD pipelines.
  • Support release management, change governance, and deployment strategies.
  • Champion Infrastructure as Code, automation, and self-service platform capabilities.
Mandatory Skills
AWS Cloud
  • AWS EC2, ECS/EKS, Lambda, VPC, IAM, S3, CloudWatch
  • RDS/Aurora
  • Route53
  • Secrets Manager
  • AWS Networking and Security Services
DevOps & Automation
  • Terraform
  • Ansible
  • Bash and Python scripting
  • Infrastructure Automation
Site Reliability Engineering
  • Production Support and Incident Management
  • SLI / SLO / SLA implementation and management
  • Reliability Engineering practices
  • High Availability and Fault-Tolerant Architecture Design
  • Capacity Planning and Performance Optimization
  • Disaster Recovery and Business Continuity
  • Root Cause Analysis and Problem Management
Observability
  • Monitoring, Logging and Alerting
  • CloudWatch
  • Grafana
  • Splunk / ELK
  • OpenTelemetry
  • Operational Metrics and Dashboarding
Platform & Containers
  • Containerisation (Docker)
  • Networking and Infrastructure Troubleshooting
Security
  • Secrets Management Solutions (Vault preferred)
  • IAM and Access Controls
  • Cloud Security Best Practices
Preferred Skills
  • AWS Certified Solutions Architect / DevOps Engineer Certification
  • Experience with Aurora PostgreSQL and Oracle migration programs
  • Chaos Engineering and Resilience Testing
  • Experience implementing SRE operating models
  • Service Mesh technologies
  • Financial Services, Banking, Capital Markets, or other regulated industries
  • ITIL processes including Incident, Problem, Change and Release Management
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

AWS DevOps & Site Reliability Engineer (SRE)
AWS DevOps & Site Reliability Engineer (SRE)

CareCone Group • Sydney

On-site
AUD 130,000 - 190,000
Site Reliability Engineer (SRE)
Site Reliability Engineer (SRE)

Peoplebank • Sydney

On-site
AUD 150,000 - 190,000
Cloud Site Reliability Engineer
Cloud Site Reliability Engineer

Intrinzic • Sydney

Hybrid
AUD 140,000 - 200,000
DevOps Engineer
DevOps Engineer

Cloud Raptor • Sydney

On-site
AUD 180,000 - 240,000
Technical Support Engineer(SRE, Dynatrace, ELK)
Technical Support Engineer(SRE, Dynatrace, ELK)

Tech Mahindra • Sydney

On-site
AUD 90,000 - 130,000
Windows Infrastructure Engineer (AWS)
Windows Infrastructure Engineer (AWS)

The Network Technology Recruitment • North Shore

On-site
AUD 120,000 - 170,000
DevOps Engineer
DevOps Engineer

United States Digital Space LLC • North Sydney Council

On-site
AUD 100,000 - 130,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Firesoft People • Sydney

On-site
AUD 230,000 - 320,000
Site Reliability Engineer
Site Reliability Engineer

Precisely • Sydney

On-site
AUD 150,000 - 210,000
Senior DevOps/ Site Reliability Engineer
Senior DevOps/ Site Reliability Engineer

HCLTech - Australia and New Zealand • City of Melbourne

On-site
AUD 140,000 - 170,000