Team Lead - Site Reliability Engineering (all genders)

United States Digital Space LLC

Berlin

Vor Ort

EUR 110.000 - 160.000

Vollzeit

14 Tage+

Erhalte mehr Antworten von Arbeitgebern

Versende in nur wenigen Minuten einen passgenauen Lebenslauf.

Benefits dieser Stelle

Wettbewerbsfähiges Gehalt
Moderne Ausstattung
Weiterbildungsbudget
Team-Events

Zusammenfassung

FACT-Finder sucht eine erfahrene Team Lead Site Reliability Engineering, die Verantwortung für die operative Gesundheit des Hostings über On-Premise (Frankfurt, Stock­holm) und Cloud hinweg übernimmt. Du treibst die Modernisierung mit Kubernetes auf Harvester weiter, baust eine produktionsreife Plattform auf und gestaltest das On-Prem-Hybrid-Modell.

Du führst ein 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Kosten und Performance, integriert AI in den Betrieb und arbeitest

Qualifikationen

  • Fundierter Hintergrund in Infrastructure oder Platform Engineering über On-Premise und Cloud hinweg.
  • Hands-on Tiefe mit Kubernetes in Produktion: Cluster-Lifecycle, Upgrades, Networking, Storage, RBAC, Observability, GitOps-Delivery.
  • Nachweislich starke Führungserfahrung, exzellente Kommunikation und Stakeholder-Management.
  • Idealerweise praktische Erfahrung mit Harvester oder vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
  • Erfahrung mit einer echten Migration von Bare Metal/VMs auf k8s-basierte Plattform – inklusive stateful Workloads, Storage-Migration, Cutover und Rollback.
  • Sicherer Umgang mit Kubernetes Operators (Custom Controllers/CRDs).
  • Solides Verständnis von Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA).
  • Erfahrung mit On-Prem-Hybrid-Architekturen und Reliability-Kostenverantwortung.
  • Hands-on Fluency im Einsatz von AI-Tools im operativen Betrieb.
  • Sehr gute Englischkenntnisse; Deutsch von Vorteil.

Aufgaben

  • Verantwortest die operative Gesundheit des Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management.
  • Treibst die Modernisierung in Richtung Kubernetes auf Harvester voran: Cluster-Topologie, Storage (Longhorn), Networking, Backup/DR.
  • Baust eine produktionsreife k8s-Plattform auf: Lifecycle, Upgrades, RBAC, Secrets, GitOps (Argo CD/Flux), Observability, Policy-Guardrails.
  • Gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
  • Definierst das On-Prem-Hybrid-Modell konkret: Workloads, Cloud-Burst, Latenz & Kosten, portablen Cloud-Only-Schritt.
  • Verantwortest Kapazitätsplanung und Hosting-Kosten; Kosten-Steuerung.
  • Führst und entwickelst das 4-köpfige Hosting-Team fachlich und disziplinarisch.
  • Mache AI zum festen Bestandteil unserer Operations: Diagnose, Automatisierung, Monitoring & Insight.

Kenntnisse

Infrastruktur-Engineering
Kubernetes in Produktion
Teamführung
Harvester/Kubernetes-Stack
Bare-Metal zu k8s Migration
Kubernetes Operators
Auto-Scaling (HPA/VPA/KEDA)
On-Prem-Hybrid-Architektur
AI im Betrieb
Englisch-Fähigkeiten

Tools

Kubernetes
Harvester
GitOps (Argo CD/Flux)

Jobbeschreibung

IntroductionFACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Aktuell modernisieren wir unser Hosting konsequent in Richtung Kubernetes auf Harvester – als on-prem Hybrid mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Team Lead Site Reliability Engineering (all genders) verantwortest du Reliability, Skalierbarkeit und Kosten unserer Hosting-Umgebungen, treibst diese Transformation end-to-end voran und führst das Team, das sie umsetzt.

Deine Aufgaben Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management. Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran: Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery. Du baust eine produktionsreife k8s-Plattform auf: Lifecycle, Upgrades, RBAC, Secrets, GitOps (Argo CD / Flux), Observability und Policy-Guardrails. Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur. Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt. Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel. Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur. Du machst AI zum festen Bestandteil unserer Operations: Diagnose, Automatisierung, Monitoring und Insight.

Deine Aufgaben
  • Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management.
  • Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran: Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery.
  • Du baust eine produktionsreife k8s-Plattform auf: Lifecycle, Upgrades, RBAC, Secrets, GitOps (Argo CD / Flux), Observability und Policy-Guardrails.
  • Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur.
  • Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt.
  • Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel.
  • Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur.
  • Du machst AI zum festen Bestandteil unserer Operations: Diagnose, Automatisierung, Monitoring und Insight.
Dein Profil
  • Fundierter Hintergrund in Infrastructure oder Platform Engineering über On-Premise und Cloud hinweg.
  • Hands-on Tiefe mit Kubernetes in Produktion: Cluster-Lifecycle, Upgrades, Networking, Storage, RBAC, Observability, GitOps-Delivery.
  • Nachweislich starke Führungserfahrung, exzellente Kommunikation und Stakeholder-Management.
  • Idealerweise praktische Erfahrung mit Harvester oder vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
  • Erfahrung mit einer echten Migration von Bare Metal / klassischen VMs auf eine k8s-basierte Plattform – inklusive stateful Workloads, Storage-Migration, Cutover und Rollback.
  • Sicherer Umgang mit Kubernetes Operators (Custom Controllers / CRDs), idealerweise für stateful Systeme wie Search, Datenbanken oder Streaming.
  • Solides Verständnis von Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und deren Zusammenspiel mit Kapazitätsplanung.
  • Erfahrung mit On-Prem-Hybrid-Architekturen und der Verantwortung für Reliability, Kapazität und Kosten produktiver Systeme.
  • Hands-on Fluency im Einsatz von AI-Tools im operativen Betrieb.
  • Sehr gute Englischkenntnisse; Deutsch von Vorteil.
THE JOY OF WORKING WITH US
  • Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.
  • Führungsrolle mit Gestaltungsspielraum: Du führst ein eingespieltes Team und gestaltest unsere Plattform in einer entscheidenden Phase unserer Transformation.
  • Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud – mit Raum, Dinge neu und richtig zu bauen.
  • AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.
  • Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.
  • Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.
  • Attraktive Benefits: Wettbewerbsfähiges Gehalt, moderne Ausstattung, Weiterbildungsbudget und regelmäßige Team-Events.

StandortBerlin, München, Pforzheim oder Stockholm (hybrid)

Find more English Speaking Jobs in Germany on Arbeitnow

Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

Fact Finder • Berlin

Vor Ort
EUR 110.000 - 150.000
Wettbewerbsfähiges Gehalt
Weiterbildungsbudget
Regelmäßige Team-Events
+1
Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

FactFinder • Berlin

Vor Ort
EUR 90.000 - 130.000
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

Jackalope Digital LLC • Berlin

Hybrid
EUR 110.000 - 160.000
Competitive salary
Modern equipment
Learning budget
+2
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

FACT-Finder • Pforzheim

Hybrid
EUR 110.000 - 170.000
Competitive salary
Modern equipment
Learning budget
+2
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

Meyandy LLC • Berlin

Hybrid
EUR 110.000 - 150.000
Competitive salary
Learning budget
Hybrid work model
+1
Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

Meyandy LLC • Berlin

Hybrid
EUR 90.000 - 130.000
Hybrid work model
Team Lead - Site Reliability Engineering (all genders)
Team Lead - Site Reliability Engineering (all genders)

GoHiring GmbH • Deutschland

Hybrid
EUR 110.000 - 150.000
Competitive salary
Modern equipment
Learning budget
+1
Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

Jackalope Digital LLC • Berlin

Hybrid
EUR 90.000 - 130.000
Hybrid work model
Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

FACT-Finder • Pforzheim

Hybrid
EUR 90.000 - 140.000
Hybrid work model
Impact on product reliability
Competitive compensation
+1
Team Lead Cloud Solutions (all genders) in Berlin
Team Lead Cloud Solutions (all genders) in Berlin

RxREVU, Inc. • Berlin

Hybrid
EUR 90.000 - 120.000
30 Urlaubstage und EU-Workation
Flexible Arbeitszeiten und mobiles Té
Academy und Zertifizierungen
+2