Director of Engineering – Quality & Reliability

Jobtailor

New York (NY)

On-site

USD 180,000 - 260,000

Full time

11 days ago
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Job summary

Canoe is building a Site Reliability Engineering and Quality Engineering practice from the ground up. You will own end-to-end incident management, establish SLOs, error budgets, and production readiness, and lead the quality organization with an automation-first mindset.

Partners across architecture and engineering, driving metrics, governance, and tooling to improve reliability and client trust. This senior role reports to the VP of Application Development.

Qualifications

  • Minimum 10 years of software engineering experience.
  • At least 4 years leading quality, reliability, or platform engineering teams.
  • Experience building SRE/quality practice from scratch.
  • Ownership of incident management with retrospectives and follow-through.
  • Deep background in quality strategy and distributed QA teams.
  • Proven use of LLMs and agentic tools in real workflows.
  • Fluency in quality metrics and executive-level reporting.
  • Strong leadership and remote collaboration across time zones.
  • Bachelor's degree in CS, Engineering, or related field.

Responsibilities

  • Build Canoe's SRE practice from ground up, including SLOs and error budgets.
  • Own incident management end-to-end with process and tooling.
  • Lead Quality Engineering organization and internal leadership.
  • Define risk-based quality strategy and CI/CD gates.
  • Shift from manual verification to automation-first testing.
  • Define and report executive KPIs on quality and reliability.
  • Use quality data to influence engineering priorities.
  • Serve as Technical Governance Owner for testing/incidents.
  • Partner with architects on reliability and operability in decisions.
  • Report to VP of Application Development as a peer.

Skills

SRE Leadership
Incident Management
Quality Engineering
Automation Testing
SLO Development
CI/CD Gates
LLMs & Agentic Tools
KPI Reporting
Distributed Team Leadership
Python
TypeScript
PHP/Laravel
Kafka
AWS
Terraform
PostgreSQL
Redis
ElasticSearch
Datadog

Education

Bachelor's degree in CS or related

Tools

Python
TypeScript
PHP/Laravel
Kafka
AWS
Terraform
PostgreSQL
Redis
ElasticSearch
Datadog

Job description

  • Build Canoe's Site Reliability Engineering practice from the ground up, including SLOs and error budgets on critical services, observability and alerting standards, production readiness reviews, and on-call design
  • Own incident management across Canoe end to end, including process, tooling, escalation paths, retrospective quality, and follow-through on corrective actions
  • Lead the Quality Engineering organization and build lasting in-house quality leadership and expertise
  • Define a risk-based quality strategy, including quality gates in CI/CD pipelines
  • Continue the shift from manual verification toward automation-first, AI-assisted testing, and specification-driven development
  • Define and report executive-level KPIs for quality and reliability, such as escape rates, incident trends, and error-budget consumption
  • Use quality and reliability KPIs to inform engineering priorities across teams
  • Serve as Technical Governance Owner for testing and incident management topics
  • Partner with architects to bring reliability, testability, and operability perspectives to technical decisions
  • Report to the VP of Application Development as a peer of other engineering guild leads
Requirements
  • Minimum of 10 years of software engineering experience
  • At least 4 years leading quality, reliability, or platform engineering teams
  • Experience building an SRE, reliability, or quality engineering practice from scratch
  • Experience formally owning incident management for a company or major platform, from incident response through high-quality retrospectives and follow-through
  • Deep quality engineering background, including ownership of quality strategy and experience leading distributed or offshore QA teams
  • Demonstrated expertise applying LLMs and agentic tools such as Claude Code to real engineering workflows
  • Fluency with quality and reliability metrics such as escape rate, flake rate, MTTD/MTTR, and SLO attainment, including experience reporting them at the executive level
  • Excellent leadership, communication, and interpersonal skills with geographically distributed teams across multiple time zones
  • Ability to work effectively with ambiguous or missing information and adapt quickly in a startup-like environment
  • Bachelor's degree in Computer Science, Engineering, or a related field (or equivalent experience)
  • Preferred: hands-on experience with Python, TypeScript, PHP/Laravel, Kafka, AWS, Terraform, PostgreSQL, Redis, ElasticSearch, or Datadog
  • Preferred: fintech or other environments where data integrity and client trust are the product
Core Competencies

Demonstrates extensive experience in building and leading Site Reliability Engineering and Quality Engineering practices, with a strong focus on incident management, quality strategy, and automation-first testing methodologies. Proficient in defining and reporting quality and reliability metrics to inform engineering priorities and drive organizational excellence.

Highest-signal resume keywords
  • Site Reliability Engineering Leadership
  • Incident Management Ownership
  • Quality Engineering Strategy Development
  • Automation-First Testing Methodologies
  • Quality and Reliability Metrics Reporting
Hard Skills
  • Software Engineering
  • Quality Engineering
  • Incident Management
  • Automation Testing
  • SLO Development
  • CI/CD Pipeline Quality Gates
  • LLMs and Agentic Tools
  • KPI Reporting
  • Risk-Based Quality Strategy
  • Distributed QA Team Leadership
Soft Skills
  • Leadership
  • Communication
  • Interpersonal Skills
  • Adaptability
  • Problem-Solving
Industry Keywords
  • Fintech
  • Data Integrity
  • Client Trust
  • Quality Metrics
  • Incident Trends
Tools & Technologies
  • Python
  • TypeScript
  • PHP/Laravel
  • Kafka
  • AWS
  • Terraform
  • PostgreSQL
  • Redis
  • ElasticSearch
  • Datadog
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Principal Site Reliability Engineer
Principal Site Reliability Engineer

Jobtailor • Arizona

On-site
USD 180,000 - 240,000
Director, Site Reliability Engineering
Director, Site Reliability Engineering

Jobtailor • Minnesota

On-site
USD 170,000 - 210,000
Senior Availability & Reliability Engineering Manager
Senior Availability & Reliability Engineering Manager

Jobtailor • Charlotte (NC)

On-site
USD 140,000 - 190,000
AVP SRE, Cloud Solutions
AVP SRE, Cloud Solutions

Jobtailor • Arlington (TX)

On-site
USD 180,000 - 240,000
Site Reliability Engineering Manager
Site Reliability Engineering Manager

O.C. Tanner • Salt Lake City (UT)

On-site
USD 180,000 - 240,000
Staff Site Reliability Engineer, SRE
Staff Site Reliability Engineer, SRE

Jobtailor • California (MO)

On-site
USD 120,000 - 210,000
Senior Site Reliability Engineer – Digital Assets
Senior Site Reliability Engineer – Digital Assets

Jobtailor • Arizona

On-site
USD 120,000 - 170,000
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Veloc Inc • Coppell (TX)

On-site
USD 140,000 - 210,000
Site Reliability Engineer
Site Reliability Engineer

TalentDome Staffing • United States

On-site
USD 140,000 - 210,000
Reliability Engineer 3, Observability Specialist
Reliability Engineer 3, Observability Specialist

Jobtailor • California (MO)

On-site
USD 140,000 - 190,000