Senior Site Reliability Engineer (all genders)

FactFinder

Berlin

Vor Ort

EUR 90.000 - 130.000

Vollzeit

14 Tage+
Bewerbungsgenerator

Eine zielgenaue Bewerbung für diesen Job — ein maßgeschneiderter Lebenslauf und ein Anschreiben, die genau zur Stellenanzeige passen.

Schaffe es an den ATS-Filtern vorbei

Zusammenfassung

FACT-Finder sucht eine/n Senior Site Reliability Engineer (SRE) zur Sicherung der Leistungsfähigkeit und Skalierbarkeit unserer SaaS-Plattformen in einer hybriden Umgebung. Du arbeitest eng mit Hosting-Teams und erfahrenen Engineers zusammen, um unsere Cloud-Transformation aktiv zu gestalten.

Du definierst SLOs, SLIs und Error Budgets, treibst Incident-Response-Prozesse voran und automatisierst Prozesse mit GitOps-Tools wie Argo CD/Flux.

Qualifikationen

  • Erfahrung als SRE/Production Engineer in SaaS- oder Plattform-Umfeld.
  • Solides Verständnis von SLOs, Error Budgets und Incident Management.
  • Hands-on mit Kubernetes, Cluster-Lifecycle, Upgrades und Operator-Pattern.
  • Interesse oder Erfahrung mit Harvester bzw. ähnlichen HCI-/Virtualisierungsplattformen.
  • Vertrautheit mit GitOps (Argo CD/Flux) und Container Storage (Longhorn/Ceph).
  • Kenntnisse zu Auto-Scaling (HPA/VPA/KEDA) und Kapazitätsplanung on-prem und in der Cloud.
  • Gute Englischkenntnisse; Deutsch vorteilhaft.

Aufgaben

  • Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg.
  • Du treibst Incident Response mit schneller Detektion, klarer Kommunikation und blameless Postmortems voran.
  • Du reduzierst manuelle Arbeit durch Automatisierung und GitOps.
  • Du unterstützt den Aufbau eines NG Search Operators und die Einführung von Auto-Scaling.
  • Du entwickelst Observability weiter – Metriken, Logs, Traces, Alerts und Runbooks.
  • Du planst Kapazität und Kosten On-Premise und in der Cloud, inkl. Burst-Szenarien.

Kenntnisse

Kubernetes
GitOps
SRE/Production
Observability
Automation
AI-Tools im Betrieb
English Kommunikation

Tools

Argo CD
Flux
Harvester
Longhorn
Ceph

Jobbeschreibung

Introduction

FACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Beide Produkte bewegen sich aktuell in Richtung einer modernen, hybriden Plattform auf Basis von Kubernetes und Harvester - mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Senior Site Reliability Engineer (SRE) sorgst du dafür, dass unsere Systeme über diese Transformation hinweg schnell, verfügbar und skalierbar bleiben. Du arbeitest mit dem Hosting-Team und erfahrenen Engineers zusammen und gestaltest den Weg zu einer modernen SaaS-Company aktiv mit.

Deine Aufgaben
  • Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.
  • Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.
  • Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z. B. Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.
  • Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
  • Du entwickelst unsere Observability weiter - Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.
  • Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg - inklusive Burst-Szenarien in die Public Cloud.
  • Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu
Dein Profil
  • Erfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld - oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.
  • Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.
  • Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrades und Operator-Pattern.
  • Erfahrung oder starkes Interesse an Harvester bzw. vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
  • Vertrautheit mit GitOps (Argo CD / Flux), Container Storage (Longhorn, Ceph) und Kubernetes Networking (Load Balancing, Ingress).
  • Kenntnisse zu Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und Kapazitätsplanung on-prem und in der Cloud.
  • Verständnis für Netzwerke in produktionsnahen Rechenzentren (u. a. VLAN).
  • Ausgeprägter Automatisierungsinstinkt und eine Haltung, Toil strukturell zu eliminieren.
  • Praktische Erfahrung im Einsatz von AI-Tools im operativen Betrieb.
  • Sehr gute Englischkenntnisse; Deutsch von Vorteil.
THE JOY OF WORKING WITH US
  • Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.
  • Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud - mit Raum, Dinge neu und richtig zu bauen.
  • AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.
  • Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.
  • Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.
Standort

Berlin, München, Pforzheim oder Stockholm (Hybrid)

Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

FactFinder • Berlin

Hybrid
Confidential
Hybrides Arbeitsmodell
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

Fact Finder • Berlin

Vor Ort
EUR 110.000 - 150.000
Wettbewerbsfähiges Gehalt
Weiterbildungsbudget
Regelmäßige Team-Events
+1
Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

Meyandy LLC • Berlin

Vor Ort
EUR 90.000 - 130.000
Hybrid work model
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

FactFinder • Berlin

Vor Ort
Confidential
Wettbewerbsfähiges Gehalt
Moderne Ausstattung
Weiterbildungsbudget
+2
Senior Site Reliability Engineer / SRE - Kubernetes & Hybrid Cloud (m/f/d)
Senior Site Reliability Engineer / SRE - Kubernetes & Hybrid Cloud (m/f/d)

FactFinder • Berlin

Hybrid
EUR 90.000 - 140.000
Hybrid work model (3 office days/week)
Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)
Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

FACT-Finder • Pforzheim

Hybrid
EUR 90.000 - 125.000
Hybrid work model
Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)
Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)

FactFinder • Berlin

Hybrid
Confidential
Hybrid work model
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

FACT-Finder • Pforzheim

Vor Ort
EUR 110.000 - 170.000
Competitive salary
Modern equipment
Learning budget
+2
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

Meyandy LLC • Berlin

Vor Ort
EUR 110.000 - 150.000
Competitive salary
Learning budget
Hybrid work model
+1
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)

eddy's pulse • Göttingen

Hybrid
EUR 80.000 - 110.000
Sonderurlaubstage
Betriebliche Krankenversicherung
Hansefit
+5