Erhalte mehr Antworten von Arbeitgebern
Versende in nur wenigen Minuten einen passgenauen Lebenslauf.
Die Deutsche Telekom AG sucht einen Site Reliability Engineer (m/w/d) mit Schwerpunkt Observability, um Transparenz, Stabilität und Zuverlässigkeit unserer Cloud-, Edge- und Kubernetes-Plattformen sicherzustellen.
Sie implementieren OpenTelemetry, Jaeger und SIEM-Integration, automatisieren Prozesse mit Go/Python, und arbeiten an skalierbaren Telemetrie-Architekturen in einer verteilten Infrastruktur.
Arbeitgeber: Deutsche Telekom AG
Beginn ab 01.10.2026
Arbeitsort: verschiedene Arbeitsorte
Anstellungsart: Vollzeit
Als Site Reliability Engineer mit Schwerpunkt Observability tragen Sie maßgeblich dazu bei, Transparenz, Stabilität und Zuverlässigkeit unserer verteilten Cloud-, Edge- und Kubernetes-Plattformen sicherzustellen. Sie übernehmen eine zentrale Rolle bei der Konzeption, Implementierung und kontinuierlichen Weiterentwicklung moderner Observability-Lösungen und schaffen die Grundlage für einen zuverlässigen Betrieb komplexer, cloud-nativer Infrastrukturen.
Sie implementieren und betreiben Jaeger als zentrale Plattform für Distributed Tracing und entwickeln Korrelationsmechanismen zwischen Logs, Metrics und Traces, um Fehlerursachen schnell zu identifizieren. Sie integrieren Security-, Infrastruktur- und Plattform-Events in zentrale SIEM-Lösungen und entwickeln standardisierte Telemetrie- und Instrumentierungskonzepte für Kubernetes- und Cloud‑Native‑Plattformen.
Mit Ihren Programmierkenntnissen in Go, Python oder Shell automatisieren Sie Integrations‑ und Betriebsprozesse und leisten einen wesentlichen Beitrag zur Weiterentwicklung einer skalierbaren Plattform.
Sehr gute Kenntnisse in OpenTelemetry, insbesondere im Umgang mit dem OpenTelemetry Collector, OTLP, SDKs sowie Auto‑Instrumentation.
Eine anspruchsvolle Aufgabe im Umfeld moderner Cloud‑Native, Kubernetes, Edge und Observability‑Technologien. Sie arbeiten in einem technologisch anspruchsvollen Umfeld mit hohem Gestaltungsspielraum und leisten einen wesentlichen Beitrag zur Stabilität, Sicherheit und Skalierbarkeit geschäftskritischer Systeme.