Site Reliability Engineer (SRE) (m/w/d)

Deutsche Telekom AG

Dresden

Vor Ort

EUR 80.000 - 130.000

Vollzeit

14 Tage+

Erhalte mehr Antworten von Arbeitgebern

Versende in nur wenigen Minuten einen passgenauen Lebenslauf.

Benefits dieser Stelle

Flexible Arbeitszeiten
Mobiles Arbeiten
Hybrides Arbeitsmodell
Weiterbildungsangebote
Moderne Ausstattung

Zusammenfassung

Deutsche Telekom AG sucht eine/n Site Reliability Engineer (SRE) zur Sicherstellung der Stabilität, Verfügbarkeit und Beobachtbarkeit verteilter Infrastrukturen. Sie arbeiten an modernen Edge-/Fog-/Cloud‑Native‑Technologien und gestalten den Aufbau eines leistungsfähigen Monitoring‑Stacks aktiv mit.

Sie verfügen über fundierte Kenntnisse in Prometheus, Grafana, Loki und AlertManager, sowie Erfahrung mit Kubernetes, YAML und GitOps.

Qualifikationen

  • Fundierte Erfahrung mit Prometheus und Monitoring-Stacks.
  • Sehr gute Kenntnisse in Grafana und Dashboards.
  • Erfahrung mit Loki, AlertManager und Kubernetes-Umgebungen.
  • Verständnis von YAML, GitOps und Cloud-Native-Architekturen.
  • Deutsch auf hohem Niveau (C1) und Sicherheitsbewusstsein.

Aufgaben

  • Sicherstellen der Stabilität, Verfügbarkeit und Beobachtbarkeit verteilter Infrastrukturen.
  • Aufbau, Weiterentwicklung und Betrieb eines Monitoring-Stacks (Prometheus, Grafana, Loki, AlertManager).
  • Automatisierung der Bereitstellung via Infrastructure-as-Code und YAML-Konfigurationen.
  • Optimierung von CPU-, Speicher- und Storage-Nutzung in Edge-/Fog-Umgebungen.

Kenntnisse

Prometheus
Grafana
Loki
AlertManager
Kubernetes
YAML
GitOps
OpenTelemetry
Security Awareness
German C1
Observability
Monitoring

Jobbeschreibung

Stellendetails zu: Site Reliability Engineer (SRE) (m/w/d)
  • Angebotsart: Arbeit
  • Arbeitgeber: Deutsche Telekom AG
  • Beginn ab 01.10.2026
  • Arbeitsort: verschiedene Arbeitsorte
  • Anstellungsart: Vollzeit
Stellenbeschreibung

Über die Position

Als Site Reliability Engineer stehen Sie an vorderster Front, um die Stabilität, Performance und Skalierbarkeit unserer kritischen Systeme sicherzustellen. Sie spielen eine zentrale Rolle bei der Entwicklung, dem Aufbau und der Wartung einer hochzuverlässigen und effizienten Infrastruktur.

  • Mit Ihrer Expertise in modernen Monitoring-, Observability- und Cloud‑Native-Technologien gestalten Sie den Aufbau und Betrieb eines leistungsfähigen Monitoring‑Stacks auf Basis von Prometheus, Grafana, Loki und AlertManager für verteilte Fog‑ und Edge‑Infrastrukturen. Sie entwickeln spezialisierte Dashboards zur Überwachung von Hardwarezuständen, Ressourcenauslastung und Netzwerkverbindungen.
  • Sie konzipieren und implementieren Alerting‑Strategien für autonome Betriebsmodelle sowie Disconnected‑ und Air‑Gap‑Szenarien und stellen sicher, dass kritische Ereignisse auch unter eingeschränkten Netzwerkbedingungen zuverlässig erkannt und verarbeitet werden. Darüber hinaus verantworten Sie Retention‑Konzepte, Log‑Rotation‑Mechanismen und effiziente Datenmanagement‑Strategien für ressourcenbeschränkte Umgebungen.
  • Ein weiterer Schwerpunkt Ihrer Tätigkeit liegt in der kontinuierlichen Performance‑Optimierung des Monitoring‑Stacks unter Berücksichtigung begrenzter CPU‑, Speicher‑ und Storage‑Ressourcen auf Fog‑Nodes. Sie integrieren Kubernetes‑Monitoring‑Lösungen, analysieren Betriebs‑ und Performancedaten und identifizieren proaktiv Optimierungspotenziale zur Steigerung von Stabilität, Verfügbarkeit und Effizienz der Plattform.
  • Durch den Einsatz von Infrastructure‑as‑Code‑Ansätzen und YAML‑basierten Konfigurationen automatisieren Sie die Bereitstellung und Verwaltung der Monitoring‑Komponenten und leisten einen wesentlichen Beitrag zur Weiterentwicklung einer robusten, skalierbaren und hochverfügbaren Observability‑Plattform für moderne Edge‑ und Fog‑Computing‑Umgebungen.

Fundierte Erfahrung mit Prometheus, insbesondere:

  • Federation
  • Dashboarding & Visualisierung

Sehr gute Kenntnisse in Grafana, insbesondere:

  • Dashboard‑Entwicklung

Erfahrung mit Loki

Fundierte Kenntnisse in AlertManager, insbesondere:

  • Eskalations‑ und Benachrichtigungskonzepte
  • Erfahrung im Monitoring und Betrieb von Kubernetes‑Umgebungen
  • Verständnis von Container‑Plattformen und Cloud‑Native‑Architekturen
  • Erfahrung mit ressourcenbeschränkten Umgebungen
  • Optimierung von CPU‑, Memory‑ und Storage‑Nutzung
  • Verständnis von Offline‑, Air‑Gap‑ und Disconnected‑Betriebsszenarien

Weitere Anforderungen:

  • Sehr gute Kenntnisse in YAML
  • Ausgeprägtes Verständnis für IT‑Sicherheit und Security Awareness
  • Analytische und strukturierte Arbeitsweise
  • Erfahrung im Site Reliability Engineering oder Infrastruktur‑Betrieb
  • Sehr gutes Deutsch in Wort und Schrift (C1‑Niveau)
  • GitOps‑Ansätze
  • OpenTelemetry und moderne Observability‑Konzepte
  • Erfahrung in kritischen oder hochverfügbaren Infrastrukturen

Was Sie erwartet

Sie erwartet eine spannende Aufgabe im Umfeld moderner Edge‑, Fog‑ und Cloud‑Native‑Technologien. Dabei übernehmen Sie Verantwortung für die Stabilität, Verfügbarkeit und Beobachtbarkeit verteilter Infrastrukturen und gestalten den Aufbau leistungsfähiger Monitoring‑ und Observability‑Lösungen aktiv mit.

Was wir bieten

  • Flexibilität und Work‑Life‑Balance: Flexible Arbeitszeiten, mobiles Arbeiten und hybrides Arbeitsmodell
  • Attraktive Vergütung: Wettbewerbsfähiges Gehaltspaket, das Ihre Expertise honoriert
  • Entwicklungsmöglichkeiten: Umfangreiche Weiterbildungsangebote, Schulungen und Karriereentwicklungsprogramme
  • Modernes Arbeitsumfeld: Moderne Ausstattung und neueste Technologien
  • Starke Unternehmenskultur: Offene, kollegiale Arbeitsatmosphäre mit Teamarbeit und Unterstützung
  • Gesundheit und Wohlbefinden: Gesundheitsfördernde Initiativen und Angebote
  • Zusatzleistungen: Betriebliche Altersvorsorge, Mitarbeiterrabatte und Jobticket‑Optionen

Diese Stelle ist auch in Teilzeit möglich.

Schwerbehinderte Menschen werden bei gleicher Eignung vorrangig berücksichtigt.

Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

Site Reliability Engineer (SRE) (m/w/d)
Site Reliability Engineer (SRE) (m/w/d)

Deutsche Telekom AG • Magdeburg

Hybrid
EUR 75.000 - 105.000
Flexible Arbeitszeiten
Mobiles Arbeiten
Home-Office-Optionen
+1
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)

eddyson • Göttingen

Hybrid
EUR 90.000 - 120.000
Sonderurlaubstage
betriebliche Krankenversicherung
Hansefit
+6
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)
Site Reliability Engineer (SRE) / DevOps Engineer (m/w/d)

eddy's pulse • Göttingen

Hybrid
EUR 70.000 - 100.000
Sonderurlaubstage
Betriebliche Krankenversicherung
Hansefit
+5
Senior Site Reliability Engineer
Senior Site Reliability Engineer

ZABEL • Hamburg

Hybrid
EUR 99.000 - 121.000
Flexible Arbeitszeiten
Remote-Arbeit möglich
Weiterbildung
+4
Site Reliability Engineer (m/w/d)
Site Reliability Engineer (m/w/d)

Assecor GmbH • Berlin

Vor Ort
Vertraulich
Flexible Arbeitszeiten
Entwicklungsmöglichkeiten
Flache Hierarchien
+3
Devops Engineer im Bereich Digitale Identitäten (m/w/d)
Devops Engineer im Bereich Digitale Identitäten (m/w/d)

United States Digital Space LLC • Berlin

Vor Ort
EUR 50.000 - 70.000
Flexible Arbeitsbedingungen
30 Tage Urlaub
Betriebliche Altersvorsorge
+2
Site Reliability Engineer (m/w/d)
Site Reliability Engineer (m/w/d)

Assecor GmbH • Berlin

Hybrid
EUR 55.000 - 75.000
Flexible Arbeitszeiten
Weiterbildungsmöglichkeiten
Betriebliche Altersvorsorge
+2
Site Reliability Engineer (m/w/d) – Konstanz, Berlin oder remote
Site Reliability Engineer (m/w/d) – Konstanz, Berlin oder remote

Jackalope Digital LLC • Konstanz, Berlin

Hybrid
EUR 70.000 - 100.000
Selbstorganisiertes Team
Vielfältiges Tech-Spektrum
Familienfreundliche Arbeitsbedingungen
+1
(Senior) Site Reliability Engineer (m/w/d) | Hamburg
(Senior) Site Reliability Engineer (m/w/d) | Hamburg

ZABEL • Hamburg

Hybrid
EUR 99.000 - 121.000
Hybrid-Arbeitsmodell
Deutschlandticket-Zuschuss
Urban Sports Club-Zuschuss
+2
Site Reliability Engineer (m/w/x) Google Cloud Platform
Site Reliability Engineer (m/w/x) Google Cloud Platform

SII Germany • Berlin

Vor Ort
EUR 60.000 - 80.000
30 Urlaubstage
Mobiles Arbeiten
Zuschüsse zur Altersvorsorge
+2