Senior Site Reliability Engineer

Castleton Commodities International

Stamford (CT)

On-site

USD 150,000 - 190,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Benefits offered by this job

Competitive compensation
Comprehensive benefits
Tuition assistance

Job summary

Castleton Commodities International seeks a Senior Site Reliability Engineer to improve the reliability, scalability, and operational excellence of our cloud-native platforms. You will collaborate with Engineering, Security, and Infrastructure teams to design resilient architectures and drive measurable reliability outcomes.

You will own SLO/SLI definitions, implement observability, lead incident response, and advance IaC/CI/CD practices across multi-AZ environments, ensuring robust BCP/DR

Qualifications

  • 7+ years of experience in SRE, DevOps, Platform Engineering, or Systems Engineering roles supporting production environments.

Responsibilities

  • Own and improve service reliability through SLO/SLI definition, error budgets, and operational best practices.
  • Design, implement, and maintain observability (monitoring, logging, tracing, alerting) to reduce MTTR and improve proactive detection.
  • Lead incident response practices including on-call improvements, runbooks, post-incident reviews (RCA), and preventative actions.
  • Partner with application teams to improve performance, capacity planning, and resiliency under failure scenarios.

Skills

SRE/DevOps
Observability
AWS
Terraform/CloudFormation
CI/CD automation
Kubernetes
Scripting (Python/Go/Bash)
Incident management

Tools

Datadog
Prometheus/Grafana
ELK/OpenSearch
Nagios
Nimsoft

Job description

The Senior Site Reliability Engineer is responsible for improving the reliability, availability, scalability, and operational excellence of our critical infrastructure platforms and services. This role partners closely with Engineering, Security, and Infrastructure teams to design resilient cloud-native architectures, implement Infrastructure as Code (IaC) and CI/CD standards, and drive measurable reliability outcomes. The Senior Site Reliability Engineer will also lead efforts to define and validate recovery objectives (RTO/RPO), design and implement Business Continuity / Disaster Recovery (BCP/DR) plans, and coordinate structured testing to ensure readiness.

Responsibilities:
Reliability Engineering & Operations
  • Own and improve service reliability through SLO/SLI definition, error budgets, and operational best practices.
  • Design, implement, andmaintainobservability (monitoring, logging, tracing, alerting) to reduce MTTR and improve proactive detection.
  • Lead incident response practices including on-call improvements, runbooks, post-incident reviews (RCA), and preventative actions.
  • Partner with application teams to improve performance, capacity planning, and resiliency under failure scenarios.
Infrastructure & Cloud Architecture
  • Design andoperatehighly available, fault-tolerantCloudarchitectures (multi-AZ and, whererequired, multi-region).
  • Implementresilient patterns across compute, storage, networking, and managed services (e.g., autoscaling, load balancing, backups, replication).
  • Drive cloud governance best practices (tagging, account/landing zone patterns, least privilege, guardrails) in partnership with security and platform teams.
Infrastructure as Code (IaC) & DevOps Enablement
  • Build and maintainIaCmodules and standards (e.g., Terraform, CloudFormation, CDK) for repeatable, auditable infrastructure delivery.
  • Develop, standardize, andoptimizeCI/CD pipelines to enable safe, automated deployments (e.g., GitHub Actions, GitLab CI, Jenkins, AWS CodePipeline).
  • Promote DevOps practices: version-controlled infrastructure, automated testing, immutable deployments, and progressive delivery patterns.
  • Establish environment consistency across dev/test/stage/prod and ensure infrastructure drift detection and remediation.
BCP/DR, RTO/RPO Definition & Testing
  • Collaborate with stakeholders to evaluate and define service-level RTO and RPO targets based on business and technical requirements.
  • Design and implement BCP/DR architectures and procedures (backups, restore workflows, replication, failover/failback, data integrity validation).
  • Coordinate and execute structured DR tests (tabletop, simulation, partial failover, full failover) and document outcomes.
  • Maintain DR runbooks, dependency maps, and recovery checklists; drive remediation of gapsidentifiedduring testing.
  • Produce metrics and reporting on DR readiness, test results, and continuous improvement actions.
Qualifications:
  • 7+ years of experience in SRE, DevOps, Platform Engineering, or Systems Engineering roles supporting production environments.
  • Strongproficiencywith observability platforms (e.g., Datadog, Prometheus/Grafana, ELK/OpenSearch, Nagios, Nimsoft,etc).
  • Strong hands-on AWS experience building and operating production systems.
  • Provenexpertisewith Infrastructure as Code (Terraform and/or CloudFormation/CDK).
  • Strong CI/CD and automation background (pipeline design, deployment strategies, testing automation).
  • Experience defining and validating RTO/RPO, andimplementing BCP/DR plans with structured testing.
  • Experience with Kubernetes andauto-scalingcontainer platforms (EKS, ECS, or Kubernetes on-prem).
  • Strong Linux fundamentals, networking concepts (DNS, TCP/IP, load balancing), and troubleshooting skills.
  • Proficiencyin at least one scripting/programming language (Python, Go, Bash, or similar).
  • Ability to write clear operational documentation, runbooks, and post-incident reports.
  • Ability to work effectively in a fast-paced, dynamic and high-intensity environment including open-floor plan if applicable to the position, with timely responsiveness and the ability to work beyond normal business hours when required.
Preferred Qualifications:
  • Familiarity with Azure and/or Oracle Cloud (OCI).
  • Familiarity with Service Mesh, API Gateways, and distributed tracing tooling.
  • Familiarity withOpenTelemetry, client instrumentations and collector configurations.
  • Security and compliance familiarity in cloud environments (IAM design,secretsmanagement, audit logging).
  • Experience implementing progressive delivery (blue/green, canary), feature flags, and automated rollback.
  • Relevant certifications (AWS Solutions Architect/DevOps Engineer, Kubernetes CKA/CKAD).
  • Experience with ArgoCD & Karpenter.
Employee Programs & Benefits:

CCI offers competitive benefits and programs to support our employees, their families and local communities. These include:

  • Competitive comprehensive medical, dental, retirement and life insurance benefits
  • Employee assistance & wellness programs
  • Parental and family leave policies
  • CCI in the Community: Each office has a Charity Committee and as a part of this program employees are allocated 2 days annually to volunteer at the selected charities.
  • Charitable contribution match program
  • Tuition assistance & reimbursement
  • Quarterly Innovation & Collaboration Awards
  • Employee discount program, including access to fitness facilities
  • Competitive paid time off
  • Continued learning opportunities

Visit https://www.cci.com/careers/life-at-cci/# to learn more!

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Senior Site Reliability Engineer
Senior Site Reliability Engineer

Castleton Commodities International, LLC • United States

On-site
USD 160,000 - 260,000
Medical & Dental
Pension Plan
Tuition assistance
+2
Principal Platform Engineer
Principal Platform Engineer

CCC Intelligent Solutions Inc. • Chicago (IL)

On-site
USD 147,000 - 200,000
401K Match
Paid time off
Annual Incentive Plan
+7
Senior Site Reliability Engineer
Senior Site Reliability Engineer

GovCIO • Arlington (VA)

On-site
USD 210,000 - 230,000
Principal Platform Engineer
Principal Platform Engineer

CCC Information Services • Chicago (IL)

On-site
USD 147,000 - 200,000
401K Match
Paid time off
Annual Incentive Plan
+6
Cloud Platform SRE Engineer #11145
Cloud Platform SRE Engineer #11145

ECCO Select • Dallas (TX)

Hybrid
USD 110,000 - 150,000
Sr. Manager, Site Reliability Engineer
Sr. Manager, Site Reliability Engineer

iCIMS, Inc. • Holmdel Township (NJ)

On-site
USD 150,000 - 200,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

ConsultNet Technology Services and Solutions • El Segundo (CA)

On-site
USD 140,000 - 180,000
3510- Site Reliability Engineer II
3510- Site Reliability Engineer II

Innovaccer • Dallas (TX)

On-site
USD 110,000 - 140,000
Generous Paid Time Off: 22 days per year plus company holidays
Best-in-Class Parental Leave
Comprehensive insurance coverage
Senior Site Reliability Engineer
Senior Site Reliability Engineer

United States Digital Space LLC • Charlotte (TX)

On-site
USD 153,000 - 192,000
Discretionary incentive eligible
Benefits package
Senior DevOps Engineer
Senior DevOps Engineer

Cognizant • New York (NY)

Remote
USD 63,000 - 100,000
Medical, Dental, Vision, and Rx
HSA and FSA
401(k) with company contributions
+6