(Senior) Site Reliability Engineer - STACKIT Control Plane (m/w/d)

Schwarz Digits

Heilbronn

Vor Ort

EUR 55.000 - 75.000

Vollzeit

14 Tage+

Erhalte mehr Antworten von Arbeitgebern

Versende in nur wenigen Minuten einen passgenauen Lebenslauf.

Zusammenfassung

Schwarz Digits sucht einen Site Reliability Engineer in Heilbronn, der sich auf große verteilte Systeme konzentriert. Du arbeitest eng mit Entwicklungsteams zusammen, um die Effizienz der Monitoring-Infrastruktur zu verbessern, Optimierungen herbeizuführen und CI/CD-Prozesse zu gestalten. Du solltest mehr als 3 Jahre Erfahrung in diesem Bereich sowie Kenntnisse in Kubernetes, Go und Infrastructure as Code mitbringen. Die Rolle beinhaltet auch eine On-Call-Rotation zur Incident-Leitung.

Qualifikationen

  • Mehr als 3 Jahre Erfahrung in Site Reliability Engineering, DevOps oder Platform Engineering.
  • Expertenwissen über Kubernetes Control Plane.
  • Sichere Beherrschung von Go für Automatisierungstools.
  • Erfahrung mit Infrastructure as Code und Container-Infrastrukturen.
  • Tiefe Kenntnisse in Linux Interna und Networking.
  • Erfahrungen im Betrieb von Datastores und Messaging-Systemen.

Aufgaben

  • Optimierung der Monitoring- und Alerting-Infrastruktur.
  • Erstellung klarer Playbooks und Design von Dashboards für First Responder.
  • Handlung als Reliability Consultant für Entwicklungsteams.
  • Gestaltung von CI/CD-Pipelines zur Unterstützung von Progressive-Delivery-Strategien.
  • Proaktive Analyse der Skalierbarkeit und Behebung von Engpässen.
  • Teilnahme an einer vergüteten On-Call-Rotation und Leitung von Incident Responses.

Kenntnisse

Site Reliability Engineering
DevOps
Platform Engineering
Kubernetes
Go
Infrastructure as Code
Linux Interna
Networking
PostgreSQL
Kafka

Jobbeschreibung

Schwarz Digits schafft das technologische Fundament für digitale Entscheidungsfreiheit in Europa. Als IT- und Digitalsparte der Schwarz Gruppe entwickeln und verantworten wir einerseits die IT-Infrastrukturen für die Handelssparten Lidl und Kaufland sowie die Schwarz Produktion und PreZero. Gleichzeitig agieren wir als unabhängiger Anbieter am externen Markt, um Unternehmen in ganz Europa bei ihrer digitalen Transformation zu unterstützen. Unsere Kernleistungen bündeln wir in den Bereichen Cloud, Cyber Security, Data & AI, Communication und Workspace. Trage auch du zur digitalen Entscheidungsfreiheit in Europa bei. Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.

Deine Aufgaben
  • Du arbeitest eng mit den Entwicklungsteams zusammen, um die “Time-to-Detect” zu verkürzen, indem du unsere Monitoring- und Alerting-Infrastruktur verbesserst und die Einhaltung der SLOs sicherstellst.
  • Deine Arbeit ist entscheidend für die kontinuierliche Optimierung der „Time-to-Mitigation“; dies erreichst du durch das Erstellen klarer Playbooks, das Design von Dashboards für First Responder und die Sicherstellung umfassender Telemetriedaten (Logs und Metriken).
  • Du agierst als Reliability Consultant für die Entwicklungsteams, vermittelst Wissen über Reliability-Patterns und unterstützt den „Shift Left“-Ansatz, um ein Modell der geteilten Verantwortung zu etablieren.
  • Du gestaltest und optimierst Entwicklungsprozesse wie CI/CD-Pipelines, um Progressive-Delivery-Strategien (z. B. Canary Releases und Blue/Green Deployments) zu unterstützen und Updates sicher und risikoarm auszurollen.
  • Du analysierst proaktiv die Skalierbarkeit der Control Plane und behebst Engpässe in Bereichen wie Distributed Consensus, Datenbank-Durchsatz und Kernel-Level-Networking.
  • Du nimmst an einer vergüteten On-Call-Rotation teil, leitest Incident Responses und moderierst Post-Mortems sowie Root Cause Analysen.
Dein Profil
  • Du bringst mehr als 3 Jahre Erfahrung in Site Reliability Engineering, DevOps oder Platform Engineering mit, wobei dein Fokus auf dem Betrieb großer verteilter Systeme in Produktionsumgebungen liegt.
  • Du besitzt Expertenwissen über die Interna der Kubernetes Control Plane, einschließlich API Server, Controller Manager, Scheduler und etcd.
  • Du beherrschst Go sicher und schreibst produktionsreifen Code, um Automatisierungstools, Kubernetes Operatoren oder Integrations-Code zu entwickeln.
  • Du verfügst über fundierte Erfahrung mit Infrastructure as Code und Container-Infrastrukturen sowie tiefgehende Kenntnisse in Linux-Interna (Kernel-Tuning, Memory Management) und Networking (TCP/IP, CNI, Load Balancer, eBPF).
  • Du bringst Erfahrung im Betrieb von Datastores (z. B. PostgreSQL, Redis) und Messaging-Systemen (z. B. Kafka, NATS) in skalierbaren Umgebungen mit.
  • Du gehst Problemen auf den Grund, um daraus zu lernen, automatisierst dich selbst aus dem Job und verlässt dich nicht auf das Prinzip Hoffnung.
Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

(Senior) Site Reliability Engineer - STACKIT Control Plane (m/w/d)
(Senior) Site Reliability Engineer - STACKIT Control Plane (m/w/d)

STACKIT • Heilbronn

Vor Ort
EUR 90.000 - 120.000
(Senior) Site Reliability Engineer - STACKIT Control Plane (m/w/d)
(Senior) Site Reliability Engineer - STACKIT Control Plane (m/w/d)

Schwarz Dienstleistung KG • Heilbronn

Vor Ort
EUR 60.000 - 80.000
(Senior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
(Senior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)

STACKIT • Heilbronn

Vor Ort
EUR 70.000 - 110.000
(Senior) Customer Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
(Senior) Customer Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)

STACKIT • Heilbronn

Vor Ort
EUR 90.000 - 130.000
Site Reliability Engineer - Cloud Infrastructure - STACKIT (m/w/d)
Site Reliability Engineer - Cloud Infrastructure - STACKIT (m/w/d)

Schwarz Digits • Bad Friedrichshall

Vor Ort
EUR 90.000 - 130.000
(Senior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
(Senior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)

Schwarz Digits • Heilbronn

Vor Ort
EUR 55.000 - 75.000
(Junior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
(Junior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)

Schwarz Dienstleistung KG • Heilbronn

Vor Ort
EUR 55.000 - 75.000
(Senior) Platform Engineer - STACKIT Control Plane Platform (m/w/d)
(Senior) Platform Engineer - STACKIT Control Plane Platform (m/w/d)

Schwarz Dienstleistung KG • Heilbronn

Vor Ort
EUR 75.000 - 110.000
(Senior) Customer Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
(Senior) Customer Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)

Schwarz Digits • Heilbronn

Vor Ort
EUR 70.000 - 110.000
(Junior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)
(Junior) Site Reliability Engineer / Distributed Cloud - STACKIT (m/w/d)

STACKIT • Heilbronn

Vor Ort
EUR 70.000 - 100.000