Site Reliability Engineer - Vice President

InforCapital

Lisboa

Híbrido

EUR 150 000 - 190 000

Tempo integral

14 dias+
Gerador de candidaturas

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Ultrapassa os filtros ATS

Resumo da oferta

iCapital is seeking a high-impact Site Reliability Engineer at Vice President level to drive reliability for our platform. You will design and enforce SLOs/SLIs, lead monitoring and observability efforts, and implement scalable Kubernetes-based reliability patterns.

You will own incident response, postmortems, and automation initiatives to reduce toil. The role requires 7+ years in SRE or related fields, strong experience with AWS and container orchestration, and a track record of cross-team

Qualificações

  • 7+ years in SRE or related roles with seniority across multiple services.
  • Strong experience with AWS and Kubernetes in production environments.
  • Proven ability to design observability solutions and SLO/SLI-driven decisions.
  • IaC expertise (Terraform preferred) and automation skills.

Responsabilidades

  • Define, implement, and iterate SLOs and SLIs reflecting customer expectations.
  • Lead monitoring standardization and “monitors as code” with quality gates.
  • Develop observability standards across metrics, logs, and traces.
  • Drive reliability standards for Kubernetes-based services and scaling patterns.
  • Lead incident response as Commander, manage postmortems, track action items.
  • Participate in on-call rotations to improve reliability and signal quality.

Conhecimentos

SRE leadership
AWS
Kubernetes
Observability
Terraform / IaC
Incident management
Automation
Monitoring
Distributed systems
Postgres / DynamoDB / MongoDB

Ferramentas

Prometheus/Grafana
New Relic
CloudWatch
ELK
OpenTelemetry

Descrição da oferta de emprego

LocationLisbon, Portugal## About This RoleJob Application for Site Reliability Engineer - Vice President at iCapitalThe Site Reliability Engineering team at iCapital is fundamental to ensuring our platform delivers consistent, reliable service to our client base. As a Site Reliability Engineer, you'll work at the intersection of software engineering and operations, applying engineering principles to infrastructure challenges. You'll be responsible for designing and implementing systems that scale efficiently, architecting observability solutions that provide actionable insights, and building automation that enhances our platform's reliability. This role requires someone who thinks systematically about reliability, can translate business requirements into technical implementations, and thrives on making complex systems more robust.Define, implement, and iterate service level objectives (SLOs) and service level indicators (SLIs) that reflect customer and business expectations.Lead monitoring and alerting standardization through “monitors as code” (Terraform preferred), including quality gates such as severity, ownership, and runbook links.Develop observability standards across metrics, logs, and traces, including instrumentation and dependency mapping patterns (OpenTelemetry where applicable).Lead technical evaluations and PoCs for observability platforms and integrations; define success criteria and migration approach for adoption.Define and implement reliability and operability standards for Kubernetes-based services, including scaling patterns, resource constraints, rollout safety, and baseline dashboards and alerts as part of service onboarding.Drive automation to eliminate toil, improve repeatability, and accelerate recovery (incident workflows, runbooks, and remediation where appropriate).Serve as Incident Commander for high-severity incidents, lead postmortems, and drive systemic improvements through action items and measurable follow-through using established tooling workflows.Participate in on-call rotations with a focus on improving reliability, reducing alert noise, and increasing signal quality over time.7+ years in SRE or related roles, with evidence of technical seniority across multiple services and teams.Strong experience with AWS and container orchestration (Kubernetes) in production environments.Demonstrated experience defining SLOs/SLIs and using them to drive operational and engineering decisions.Proven ability to design and implement observability solutions that produce actionable insights while reducing alert fatigue and operational noise.Strong IaC skills (Terraform preferred) and the ability to build reusable automation and standards (monitoring as code, configuration patterns).Familiarity with common data stores and managed services (e.g., Postgres, MongoDB, DynamoDB) and how they fail in distributed systems.Experience with at least two observability stacks (Prometheus/Grafana, New Relic, Splunk, CloudWatch, ELK, etc.) and driving st...
Obtém a tua avaliação gratuita e confidencial do currículo.

ou arrasta e larga o ficheiro aqui.

Similar jobs

Ofertas semelhantes que vale a pena comparar

VP, Reliability Engineering — Scale & Observability
VP, Reliability Engineering — Scale & Observability

InforCapital • Lisboa

Híbrido
EUR 150 000 - 190 000
Cloud Infrastructure Engineer - Vice President
Cloud Infrastructure Engineer - Vice President

InforCapital • Lisboa

Híbrido
EUR 180 000 - 240 000
Head of Security Engineering - Senior Vice President
Head of Security Engineering - Senior Vice President

InforCapital • Lisboa

Híbrido
EUR 140 000 - 220 000
Cloud Database Administrator - Vice President
Cloud Database Administrator - Vice President

InforCapital • Lisboa

Híbrido
EUR 120 000 - 150 000
Observability Engineer - Site Reliability Engineer
Observability Engineer - Site Reliability Engineer

La Redoute • Viseu

Híbrido
EUR 60 000 - 100 000
Site Reliability Engineer
Site Reliability Engineer

Fulcrum Digital Inc • Lisboa

Presencial
EUR 50 000 - 70 000
Site Reliability Engineer
Site Reliability Engineer

EPAM Systems • Lisboa

Presencial
EUR 70 000 - 100 000
Site Reliability Engineer
Site Reliability Engineer

FundApps • Braga

Presencial
EUR 50 000 - 75 000
Site Reliability Engineering Manager (Data Infra)
Site Reliability Engineering Manager (Data Infra)

Complyadvantage • Lisboa

Presencial
EUR 86 000 - 96 000
Equity participation
Private medical insurance
Unlimited Time Off Policy
+2
Senior Site Reliability Engineer
Senior Site Reliability Engineer

Claranet Portugal • Portugal

Presencial
EUR 45 000 - 65 000