Senior Site Reliability Engineer (m/w/d)

Remotely

Berlin

Hybrid

EUR 90.000 - 140.000

Vollzeit

Vor 12 Tagen

Erhalte mehr Antworten von Arbeitgebern

Versende in nur wenigen Minuten einen passgenauen Lebenslauf.

Benefits dieser Stelle

Remote Work aus Deutschland
Homeoffice-Budget
Learning & Development Budget
Deutschlandticket
28 Urlaubstage

Zusammenfassung

Remotely sucht einen Senior Site Reliability Engineer (m/w/d) zur Weiterentwicklung einer hochverfügbaren Plattform im Finanzumfeld. Du übernimmst Verantwortung für Stabilität, Verfügbarkeit und Resilienz der Infrastruktur und arbeitest eng mit Development-, Platform- und Infrastructure-Teams zusammen.

Du bringst mindestens 6 Jahre SRE/DevOps-Erfahrung, solide Kenntnisse in Cloud-Technologien, Programmiersprachen (Python, Ruby, Java oder Go) sowie Erfahrung mit Chaos Engineering und

Qualifikationen

  • Mindestens 6 Jahre Berufserfahrung in SRE, DevOps oder Software Engineering.
  • Sehr gute Erfahrung mit Cloud- und Plattformtechnologien.
  • Programmier- bzw. Scripting-Erfahrung mit Python, Ruby, Java oder Go.
  • Erfahrung mit Service Discovery und/oder Service Mesh.
  • Fundiertes Verständnis von Microservices und deren Kommunikation.
  • Erfahrung mit Capacity Planning und Performance-Optimierung.
  • Kenntnisse im Aufbau hochverfügbarer und resilienter Systeme.
  • Erfahrung mit Failover- und Disaster-Recovery-Konzepten.
  • Idealerweise Erfahrung mit Chaos Engineering (Chaos Mesh oder Gremlin).
  • Erfahrung in der Entwicklung und Umsetzung von Monitoring- und Alerting-Konzepten.
  • Verständnis für SLI, SLO und SLA.
  • Erfahrung mit Incident Response und Reliability Engineering.
  • Bereitschaft zur Teilnahme an einer 24/7-Rufbereitschaft.
  • Verständnis für Finanzsektor-Anforderungen.
  • Sehr gute Englischkenntnisse; Deutschkenntnisse sind von Vorteil.

Aufgaben

  • Entwicklung und Weiterentwicklung von Monitoring- und Alerting-Standards.
  • Aufbau von Frameworks und Standards für SLI, SLO und SLAs.
  • Weiterentwicklung von Incident-Response- und Reliability-Prozessen.
  • Entwicklung von Maßnahmen zur Verbesserung von Resilienz, Stabilität und Verfügbarkeit.
  • Automatisierung operativer Prozesse und Entwicklung entsprechender Tools.
  • Aufbau und Weiterentwicklung von Monitoring-Dashboards.
  • Analyse von Kapazitätsanforderungen und frühzeitige Identifikation möglicher Engpässe.
  • Entwicklung von Architekturen mit automatisierten Failover-Mechanismen.
  • Reduzierung des Blast Radius einzelner Fehler und Ausfälle.
  • Durchführung bzw. Unterstützung von Chaos Engineering zur Prüfung der Systemresilienz.
  • Zerlegung komplexer Architekturziele in konkrete Arbeitspakete.
  • Bewertung und Auswahl geeigneter Third-Party-Tools.
  • Technische Betreuung von Tools und Plattformkomponenten als zentraler Ansprechpartner.
  • Planung und sichere Umsetzung größerer Plattformänderungen.
  • Enge Zusammenarbeit mit Development-, Platform- und Infrastructure-Teams.
  • Teilnahme an einer 24/7-On-Call-Rotation.

Kenntnisse

SRE
DevOps
Software Engineering
Python
Ruby
Java
Go
Cloud Technologies
Service Mesh
SLI/SLO/SLA
Incident Response
Chaos Engineering
Monitoring & Observability

Ausbildung

Informatik-Studium

Tools

Chaos Mesh
Gremlin
Monitoring Dashboards
Service Discovery

Jobbeschreibung

Du möchtest moderne Cloud-Infrastrukturen nicht nur betreiben, sondern aktiv stabiler, skalierbarer und resilienter machen? Für ein international ausgerichtetes Technologieunternehmen im Finanzumfeld suchen wir einen Senior Site Reliability Engineer (m/w/d), der Verantwortung für die Zuverlässigkeit und Weiterentwicklung einer hochverfügbaren Plattform übernimmt.

Unser Kunde ist ein international tätiges Technologieunternehmen aus dem Finanz- und Banking-Umfeld mit Hauptsitz in Berlin und mehreren hundert Mitarbeitenden in Europa.

Das Unternehmen entwickelt eine moderne, skalierbare Technologieplattform, über die Geschäftskunden digitale Finanz- und Banking-Services anbieten können. Dabei treffen Finanztechnologie, Cloud Engineering, Softwareentwicklung und moderne Plattformarchitekturen aufeinander.

Das technische Umfeld ist geprägt von einem hohen Automatisierungsgrad, modernen Cloud-Technologien und hohen Anforderungen an Verfügbarkeit, Sicherheit und Resilienz.

Die Position kann überwiegend remote aus Deutschland ausgeübt werden. Regelmäßige Präsenz in Berlin ist vorgesehen.

Detaillierte Arbeitsbezeichnung und Arbeitsinhalte

Als Senior Site Reliability Engineer (m/w/d) übernimmst Du eine zentrale Rolle bei der Weiterentwicklung und Stabilisierung der technischen Plattform.

Deine Aufgaben:

  • Entwicklung und Weiterentwicklung von Monitoring- und Alerting-Standards
  • Aufbau von Frameworks und Standards für SLIs, SLOs und SLAs
  • Weiterentwicklung von Incident-Response- und Reliability-Prozessen
  • Entwicklung von Maßnahmen zur Verbesserung von Resilienz, Stabilität und Verfügbarkeit
  • Automatisierung operativer Prozesse und Entwicklung entsprechender Tools
  • Aufbau und Weiterentwicklung von Monitoring-Dashboards
  • Analyse von Kapazitätsanforderungen und frühzeitige Identifikation möglicher Engpässe
  • Entwicklung von Architekturen mit automatisierten Failover-Mechanismen
  • Reduzierung des Blast Radius einzelner Fehler und Ausfälle
  • Durchführung bzw. Unterstützung von Chaos Engineering zur gezielten Prüfung der Systemresilienz
  • Zerlegung komplexer Architekturziele in konkrete, umsetzbare Arbeitspakete
  • Bewertung und Auswahl geeigneter Third-Party-Tools
  • Technische Betreuung von Tools und Plattformkomponenten als zentraler Ansprechpartner
  • Planung und sichere Umsetzung größerer Plattformänderungen
  • Enge Zusammenarbeit mit Development-, Platform- und Infrastructure-Teams
  • Teilnahme an einer 24/7-On-Call-Rotation
Warum diese Rolle besonders spannend ist
  • Hoher technischer Gestaltungsspielraum: Du entwickelst Standards und Strukturen aktiv mit, anstatt lediglich bestehende Systeme zu verwalten.
  • Modernes Cloud-Umfeld: Du arbeitest mit modernen Technologien rund um Cloud, Plattform Engineering, Automation und Observability.
  • Business-kritische Systeme: Deine Arbeit hat direkten Einfluss auf die Stabilität und Verfügbarkeit einer wichtigen digitalen Finanzplattform.
  • SRE statt klassischem Betrieb: Der Fokus liegt auf Automatisierung, Resilienz, Skalierbarkeit und kontinuierlicher Verbesserung.
  • Internationale Zusammenarbeit: Du arbeitest in einem internationalen, englischsprachigen Technologieumfeld.
  • Entwicklungsmöglichkeiten: Deine fachliche und persönliche Weiterentwicklung wird durch ein transparentes Entwicklungsmodell und ein jährliches Weiterbildungsbudget unterstützt.
  • Remote Work: Du kannst flexibel aus Deutschland arbeiten und regelmäßig aus dem Ausland tätig sein.
Dein Profil: Das bringst Du mit
  • Mindestens 6 Jahre Berufserfahrung in SRE, DevOps oder Software Engineering
  • Studium in Informatik, Software Engineering, Information Technology oder eine vergleichbare praktische Qualifikation
  • Sehr gute Erfahrung mit Cloud- und Plattformtechnologien
  • Programmier- bzw. Scripting-Erfahrung mit Python, Ruby, Java oder Go
  • Erfahrung mit Service Discovery und/oder Service Mesh
  • Fundiertes Verständnis von Microservices und deren Kommunikation
  • Erfahrung mit Capacity Planning und Performance-Optimierung
  • Kenntnisse im Aufbau hochverfügbarer und resilienter Systeme
  • Erfahrung mit Failover- und Disaster-Recovery-Konzepten
  • Idealerweise Erfahrung mit Chaos Engineering, z. B. Chaos Mesh oder Gremlin
  • Erfahrung in der Entwicklung und Umsetzung von Monitoring- und Alerting-Konzepten
  • Verständnis von SLI, SLO und SLA
  • Erfahrung mit Incident Response und Reliability Engineering
  • Bereitschaft zur Teilnahme an einer 24/7-Rufbereitschaft
  • Verständnis für die besonderen Anforderungen und Rahmenbedingungen des Finanzsektors
  • Sehr gute Englischkenntnisse in Wort und Schrift
  • Deutschkenntnisse sind von Vorteil
  • Strukturierte, eigenständige und Hands-on-Arbeitsweise
  • Hohe Eigenverantwortung und ausgeprägtes Ownership
  • Agile Mentalität sowie Bereitschaft, bestehende Prozesse kontinuierlich zu hinterfragen und zu verbessern
Benefits

Remote Work aus Deutschland mit regelmäßiger Präsenz in Berlin

  • Möglichkeit, bis zu 12 Wochen pro Jahr aus dem Ausland zu arbeiten
  • Homeoffice-Budget
  • 1.000 € Learning & Development Budget pro Jahr
  • Individuelle Weiterentwicklung und transparentes Karriere-/Growth Framework
  • Wettbewerbsfähiges Gehalt plus variable Vergütung
  • Monatlicher Zuschuss für Verpflegung
  • Zuschuss zum Deutschlandticket
  • 28 Urlaubstage, mit zusätzlichem Urlaubsanspruch bei längerer Betriebszugehörigkeit ab dem 2. Jahr
  • Internationales und modernes Arbeitsumfeld
  • Hoher technischer Gestaltungsspielraum
  • Zusammenarbeit mit erfahrenen Engineering- und Platform-Teams
  • Fokus auf kontinuierliche fachliche und persönliche Weiterentwicklung
Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

(Senior) Site Reliability Engineer (m/w/d) | Hamburg
(Senior) Site Reliability Engineer (m/w/d) | Hamburg

ZABEL • Hamburg

Hybrid
EUR 99.000 - 121.000
Hybrid-Arbeitsmodell
Deutschlandticket-Zuschuss
Urban Sports Club-Zuschuss
+2
Site Reliability Engineer (m/w/d)
Site Reliability Engineer (m/w/d)

Assecor Group • Berlin

Hybrid
EUR 60.000 - 80.000
Flexible Arbeitszeiten
Entwicklungsmöglichkeiten
Flache Hierarchien
+3
Cloud Platform / Kubernetes Engineer*
Cloud Platform / Kubernetes Engineer*

inovex GmbH • Berlin

Vor Ort
EUR 55.000 - 85.000
Hardwareleasing
Sportförderung (EGYM Wellpass)
Betriebliche Altersvorsorge
+13
Full-Stack Entwickler (m/w/d) DevOps
Full-Stack Entwickler (m/w/d) DevOps

artevie • Berlin

Hybrid
EUR 90.000 - 120.000
Home-Office möglich
Flexible Arbeitszeiten
30 Tage Urlaub
+1
Staff Software Engineer (m/w/d)
Staff Software Engineer (m/w/d)

OneCareer GmbH • Berlin

Remote
EUR 70.000 - 90.000
100% Remote-Arbeit
100 € Benefitbudget pro Monat
Weiterbildungsmöglichkeiten
+3
Senior Site Reliability Engineer
Senior Site Reliability Engineer

ZABEL • Hamburg

Hybrid
EUR 99.000 - 121.000
Flexible Arbeitszeiten
Remote-Arbeit möglich
Weiterbildung
+4
Senior Cloud-Infrastructure Engineer (w/m/d)
Senior Cloud-Infrastructure Engineer (w/m/d)

Remotely • Berlin

Hybrid
EUR 90.000 - 125.000
Moderne Office Hubs
Weiterbildungsangebote im Bereich Fin/
Regelmäßige Team-Events & starke Kult
+2
Security Specialist* (Kubernetes, Cloud)
Security Specialist* (Kubernetes, Cloud)

inovex GmbH • Berlin

Vor Ort
EUR 60.000 - 80.000
Hardwareleasing
Sportförderung
Betriebliche Altersvorsorge
+7
DevOps Engineer* Linux
DevOps Engineer* Linux

inovex GmbH • Berlin

Vor Ort
EUR 55.000 - 75.000
Hardwareleasing
Sportförderung
Betriebliche Altersvorsorge
+3
Senior Site Reliability Engineer (all genders)
Senior Site Reliability Engineer (all genders)

FactFinder • Berlin

Vor Ort
EUR 90.000 - 130.000