Site Reliability Engineer (m/w/d)

gridscale GmbH

Köln

Hybrid

EUR 90.000 - 140.000

Vollzeit

Vor 8 Tagen
Bewerbungsgenerator

Erhalte eine Antwort von diesem Arbeitgeber — ein Lebenslauf und ein Anschreiben, die genau auf die Eigenschaften eingehen, die gesucht werden.

Schaffe es an den ATS-Filtern vorbei

Benefits dieser Stelle

32 Urlaubstage
Homeoffice-Möglichkeiten
Altersvorsorge
Sportzuschuss 400€ jährlich
Corporate Benefits
40% Leasing Cargo Bike

Zusammenfassung

gridscale GmbH sucht einen erfahrenen Senior Engineer (SRE/Platform) zur Weiterentwicklung einer OpenStack-basierten On-Premise-Cloud-Infrastruktur. Sie arbeiten an Kubernetes- und GitOps-Stacks, nutzen AI-unterstützte Engineering-Methoden und übernehmen Ownership für Architektur und Automatisierung.

Sie verantworten End-to-End-Betrieb von Bare Metal bis zu Hypervisoren, betreiben IaC mit Ansible/Terraform und gestalten Compute Lifecycle, AI-Substrate sowie Self-Healing-Strategien.

Qualifikationen

  • Mehrjährige praktische Erfahrung als SRE, Platform Engineer oder DevOps im Betrieb produktiver Infrastruktur.
  • End-to-End-Betrieb von Compute-Infrastruktur (Bare Metal, Hypervisoren, Provisionierung)
  • AI-Assisted Engineering gehört zum Arbeitsalltag und wird mit LLMs/agentischen Tools unterstützt.

Aufgaben

  • Du konzipierst und entwickelst eine OpenStack-basierte On-Premise-Cloud-Infrastruktur hochautomatisiert auf Bare Metal.
  • Du betreibst Infrastructure as Code mit Ansible und Terraform sowie Kubernetes- und GitOps-Workflows mit FluxCD/ArgoCD.
  • Du verantwortest Lifecycle deiner Compute-Infrastruktur einschließlich Firmware, Provisionierung, Migrationen und Capacity Rebalancing.
  • Du entwickelst AI Substrate und Self-Healing-Strategien weiter und automatisierst Runbooks.
  • Du erstellst Tests für Non-Regression, Performance und Security und dokumentierst Lösungen.
  • Du bist technische Ansprechperson für Kolleg:innen rund um Automation, Platform Engineering und AI Tooling.

Kenntnisse

SRE/Platform Engineer
DevOps Engineer
OpenStack
Kubernetes
Linux
Observability
Networking
Auto-Remediation
Ownership
Englisch-Kommunikation

Tools

OpenStack
Kubernetes
Linux
Ansible
Terraform
FluxCD
ArgoCD
Claude Code
Cursor
Aider
Go
Python

Jobbeschreibung

Deine Rolle

Du unterstützt uns dabei, die On-Premise-Cloud-Plattform von OVHcloud weiterzuentwickeln, zu betreiben und zu industrialisieren. Als Teil eines kleinen, erfahrenen Teams arbeitest du an unserer OpenStack-basierten Infrastruktur sowie am Kubernetes- und GitOps-Stack, auf dem unsere kundenorientierte Cloud-Plattform läuft. AI-Assisted Engineering ist dabei ein fester Bestandteil unserer täglichen Engineering-Praxis – von Spec-Driven Development über agentische Coding-Workflows bis hin zu Incident Response und Automatisierung. Die Plattform befindet sich aktiv im Aufbau, sodass du direkten Einfluss auf Architektur, Automatisierungsstrategie und den Einsatz von AI im Platform Engineering hast. Als Senior übernimmst du Ownership für deine Themen und gestaltest deinen fachlichen Schwerpunkt entlang deiner Stärken – mit Fokus auf Automation, Compute Lifecycle, Platform Engineering und AI Substrate.

Unser Tech Stack

· OpenStack · Kubernetes · KVM · Linux · Bare Metal · Ansible · Terraform · Go
· FluxCD / ArgoCD · Git· Python · Claude Code · Cursor · Agentic Coding Tooling

Deine Aufgaben
  • Du konzipierst und entwickelst unsere OpenStack-basierte On-Premise-Cloud-Infrastruktur mit dem Ziel, komplette Cloud-Umgebungen hochautomatisiert auf Bare Metal ausrollen und in Betrieb nehmen zu können.

  • Du entwickelst und betreibst Infrastructure as Code mit Ansible und Terraform sowie unsere Kubernetes- und GitOps-Workflows mit FluxCD / ArgoCD - unterstützt durch LLMs, agentische Workflows und automatisierte Test- und Review-Prozesse.

  • Du verantwortest den Lifecycle unserer Compute-Infrastruktur - von Bare Metal, Firmware und Provisionierung bis zu Hypervisoren und virtuellen Compute Nodes. Dazu gehören unter anderem Patching, Migrationen, Host Evacuations, Capacity Rebalancing und die Automatisierung eines stabilen Plattformbetriebs.

  • Du entwickelst unser AI Substrate und unsere Self-Healing-Strategie weiter - von strukturierten Knowledge Bases und agentischen Workflows für Incident Triage und Capacity Planning bis hin zur schrittweisen Automatisierung heutiger Runbooks.

  • Du konzipierst Tests für Non-Regression, Performance und Security, dokumentierst und paketierst Lösungen und verbesserst die Plattform kontinuierlich anhand von Telemetrie, Betriebserfahrungen und Nutzerfeedback.

  • Als Senior Engineer bist du technische Ansprechperson und Sparringspartner für Kolleg rund um Automation, Platform Engineering und AI Tooling.

Was wir dir bieten
  • Eine Plattform im echten Build Mode mit viel Gestaltungsspielraum, sichtbarem Einfluss auf Architekturentscheidungen und einem erfahrenen Senior-Team, in dem Autonomie und Ownership zählen.

  • AI-Augmented Engineering als fester Bestandteil unserer Arbeitsweise - mit Claude Code und vergleichbaren agentischen Tools, Markdown-basierten Knowledge Bases und Raum, unsere Engineering-Praxis aktiv weiterzuentwickeln.

  • Außergewöhnlicher Teamspirit über alle Abteilungen und Ländergrenzen hinweg - wir leben #OneTeam.

  • Spannende Aufgaben in einem hochinnovativen und internationalen Umfeld mit modernsten Technologien.

  • 32 Urlaubstage, die sich mit zunehmender Betriebszugehörigkeit erhöhen.

  • Flexible Arbeitszeiten, Homeoffice-Möglichkeiten und eine sichere, unbefristete Anstellung mit markt- und leistungsorientierter Vergütung.

  • Arbeitgeberfinanzierte Altersvorsorge und ein attraktives Versicherungspaket.

  • OVHcloud übernimmt 50 % der Kosten für den öffentlichen Nahverkehr.

  • Bis zu 400 € jährlicher Zuschuss für Sportaktivitäten, zum Beispiel Fitnessstudio oder Sportkurse.

  • Attraktive Rabatte bei zahlreichen Shops und Unternehmen über Corporate Benefits.

  • Wir beteiligen uns am Leasing deines Cargo Bikes.

  • Regelmäßige Company Events sowie kostenlose Kalt- und Heißgetränke.

  • Du bringst mehrere Jahre praktische Erfahrung als SRE, Platform Engineer oder DevOps Engineer im Betrieb produktiver Infrastruktur mit und verfügst über fundierte Erfahrung mit OpenStack, Kubernetes und Linux, auch auf Bare Metal.

  • Du hast Compute-Infrastruktur bereits End-to-End betrieben - von Firmware-/BIOS-Rollouts, Bare-Metal-Provisionierung und Hardware-Diagnostik bis zu Hypervisoren, Migrationen, Host Evacuations, Graceful Drains und Capacity Rebalancing.

  • AI-Assisted Engineering gehört für dich bereits zum Arbeitsalltag. Du setzt LLMs und agentische Tools gezielt dort ein, wo sie Entwicklung, Testing, Reviews oder den Betrieb sinnvoll unterstützen, und kannst gut einschätzen, wo AI echten Mehrwert schafft und wo fundiertes Engineering-Know-how entscheidend bleibt.

  • Du arbeitest sicher mit Ansible, Terraform sowie GitOps-Workflows wie FluxCD oder ArgoCD und hast Erfahrung damit, automatisierte Prozesse stabil und reproduzierbar in Produktionsumgebungen zu betreiben.

  • Du bringst Erfahrung mit Go und/oder Python sowie mit Claude Code, Cursor, Aider oder vergleichbaren agentischen Coding-Umgebungen mit.

  • Auch Observability, Networking, Compute-Tuning, Auto-Remediation, Security-kritische Infrastrukturen und Multi-Site-Cloud-Umgebungen gehören zu deinem technischen Erfahrungsspektrum.

  • Du arbeitest eigenverantwortlich, bringst ein ausgeprägtes Ownership-Mindset mit und hast Freude daran, Dinge nicht nur zu betreiben, sondern kontinuierlich besser zu machen. Gleichzeitig teilst du dein Wissen gerne und kannst komplexe technische Zusammenhänge klar vermitteln.

  • Wir arbeiten in einem internationalen Umfeld auf Englisch. Du fühlst dich deshalb sicher dabei, technische Themen auf Englisch zu diskutieren, zu dokumentieren und gemeinsam im Team voranzutreiben.

Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

Site Reliability Engineer (m/w/d)
Site Reliability Engineer (m/w/d)

Gridscale • Köln

Vor Ort
EUR 90.000 - 130.000
Site Reliability Engineer (m/w/d)
Site Reliability Engineer (m/w/d)

United States Digital Space LLC • Köln

Hybrid
EUR 90.000 - 150.000
32 Urlaubstage
Homeoffice möglichkeiten
Altersvorsorge
+3
Site Reliability Engineer (m/w/d)
Site Reliability Engineer (m/w/d)

Meyandy LLC • Deutschland

Hybrid
EUR 90.000 - 130.000
32 Urlaubstage
Homeoffice möglich
Überdurchschnittliche Vergütung
+7
Lead Platform Engineer - OpenStack
Lead Platform Engineer - OpenStack

Interval • Leipzig

Vor Ort
EUR 120.000 - 160.000
Gestaltungsspielraum
State-of-the-Art Tooling
Flache Hierarchien
+1
Cloud Infrastructure Engineer deutsch (all genders)
Cloud Infrastructure Engineer deutsch (all genders)

solute gmbh • Stuttgart

Hybrid
EUR 70.000 - 110.000
Hybrides Arbeiten
Flexible Arbeitszeiten
Weiterbildung / Learning Days
Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)
Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)

MAIA • Leipzig

Hybrid
Confidential
Eigenen technischen Verantwortungs-bzw
VSOP-Beteiligung
Hybrid-Arbeitsmodell in Leipzig
+3
OpenStack Engineer (m/w/d)
OpenStack Engineer (m/w/d)

Akkodis • Nordrhein-Westfalen

Hybrid
EUR 63.000 - 77.000
Unbefristete Festanstellung
Home-Office 2–3 Tage pro Woche
Hybrides Arbeiten
+9
Senior Cloud Engineer and Consultant (w/d/m)
Senior Cloud Engineer and Consultant (w/d/m)

codecentric AG • München

Hybrid
EUR 90.000 - 130.000
Weiterbildung / OffProject Time (bis -
Projektvielfalt
Eigene Hardware & Geräte
+6
Senior Cloud Engineer and Consultant (w/d/m)
Senior Cloud Engineer and Consultant (w/d/m)

codecentric AG • Stuttgart

Hybrid
EUR 90.000 - 130.000
Weiterbildung / OffProject Time
Flexible Arbeitsbedingungen
Hybride Arbeitsweise
+2
Site Reliability Engineer (m/f/d)
Site Reliability Engineer (m/f/d)

gridscale GmbH • Köln

Vor Ort
EUR 90.000 - 130.000
32 vacation days
Flexible working hours
Home office options
+4