Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)

United States Digital Space LLC

Leipzig

Hybrid

EUR 75.000 - 85.000

Vollzeit

14 Tage+
Bewerbungsgenerator

Mach aus dieser Rolle ein Bewerbungsgespräch — ein Lebenslauf und ein Anschreiben, die genau auf das zugeschnitten sind, was dieser Arbeitgeber sucht.

Schaffe es an den ATS-Filtern vorbei

Benefits dieser Stelle

VSOP-Beteiligung
Hybrid-Arbeitsmodell in Leipzig
WellPass-Mitgliedschaft
Unterstützung beim Umzug nach Leipzig
Flexibles Arbeitszeitmodell

Zusammenfassung

United States Digital Space LLC sucht eine erfahrene:r IT-Infrastruktur-Engineer:in zur Weiterentwicklung einer skalierbaren Plattform in Leipzig. Du betreibst eigenständig Linux-Systeme, integrierst Cloud-Dienste, baust IaC, CI/CD und Monitoring aus und sicherst Betrieb sowie Security ab.

Du bringst umfangreiche PostgreSQL-Erfahrung, Terraform, GitHub Actions und Observability mit. Ein hybrides Modell mit drei Büro-Tagen in Leipzig ist vorgesehen.

Qualifikationen

  • Mehrere Jahre SaaS-Systeme auf Linux-Servern betrieben.

Aufgaben

  • Infrastruktur weiterentwickeln und Linux-Systeme betreiben.
  • Dienste von AWS, Azure und GCP integrieren.
  • Infrastructure as Code, CI/CD und Deployment-Workflows entwickeln.
  • Backups/Restore-Verfahren testen und sicherstellen.
  • Observability-Stack vernetzen, Metriken, Logs und Traces zusammenführen.
  • Sicherheitsmaßnahmen implementieren (Least Privilege, Secrets, Patch-Management).
  • LLM-Serving auf GPU-Infrastruktur prüfen und ggf. anbieten.
  • Probleme analysieren, Prioritäten setzen und Betrieb verbessern.

Kenntnisse

Docker
Docker Compose
Reverse Proxies
API Gateways
PostgreSQL
Backups & Restore
Terraform
CI/CD
GitHub Actions
Observability Stack
Grafana
Loki
Prometheus
Sicherheit (Security)
RAG-Systeme
LLM-Serving
Englisch Kommunikation

Tools

Terraform
GitHub Actions
Grafana
Loki
Prometheus
Traefik
Kong
Docker

Jobbeschreibung

Aufgaben
  • Du entwickelst unsere Infrastruktur für den nächsten Wachstumsschritt weiter. Du betreibst selbst administrierte Linux-Systeme auf europäischen VMs und dedizierten Servern und integrierst Dienste von AWS, Azure und GCP. Dazu gehören Docker Compose, Netzwerke, Reverse Proxies und API Gateways.
  • Du machst Änderungen sicher und reproduzierbar. Du entwickelst Infrastructure as Code, CI/CD und Deployment-Workflows weiter. Automatisierte Prüfungen, nachvollziehbare Konfigurationen und erprobte Rollbacks schaffen Vertrauen in jeden Release.
  • Du verantwortest PostgreSQL im produktiven Betrieb. Du analysierst Performance, optimierst Connection Pooling und Kapazitäten und stellst durch getestete Backup- und Restore-Verfahren sicher, dass wir Daten zuverlässig wiederherstellen können.
  • Du machst das Verhalten unserer Systeme verständlich. Du entwickelst unseren selbst betriebenen Observability-Stack weiter, verbindest Metriken, Logs und Traces und etablierst Alerting, das konkrete Handlungen ermöglicht.
  • Du verankerst Sicherheit im Betrieb. Du setzt Least Privilege, Secrets Management, Vulnerability Scanning und Patch Management konsequent um. Für unser laufendes ISO-27001-Vorhaben implementierst du technische Maßnahmen und automatisierst prüfbare Nachweise.
  • Du gestaltest unsere AI Infrastructure. Du bewertest Inferenzanbieter und Betriebsmodelle anhand von Latenz, Durchsatz, Kosten und Zuverlässigkeit. Perspektivisch erschließt du bei Bedarf eigenes LLM-Serving auf GPU-Infrastruktur. Europäische, souveräne Betriebsoptionen sind dabei ein Teil unserer zukünftigen Strategie.
  • Du verbesserst den Betrieb für das gesamte Team. Du automatisierst wiederkehrende Aufgaben, dokumentierst Betriebsabläufe und untersuchst Störungen systematisch. Erkenntnisse fließen in dauerhafte Verbesserungen ein.

Deine ersten Schwerpunkte legen wir gemeinsam anhand des bestehenden Systems fest. Entscheidend ist, dass du Risiken fundiert bewertest, Prioritäten setzt und Verbesserungen bis in den laufenden Betrieb bringst.

QualifikationDeine technische Grundlage
  • Du hast mehrere Jahre produktive SaaS-Systeme auf selbst administrierten Linux-Servern betrieben. Erfahrung ausschließlich mit vollständig gemanagten Cloud-Diensten reicht für diese Rolle nicht aus.
  • Du beherrschst Docker und Docker Compose in Produktion und hast mit Reverse Proxies oder API Gateways wie Traefik oder Kong gearbeitet.
  • Du bringst praktische PostgreSQL-Betriebserfahrung mit. Backups und Restores hast du selbst eingerichtet und getestet. Performance-Analyse und Connection Pooling sind dir vertraut.
  • Du hast Infrastruktur mit Terraform oder vergleichbaren Werkzeugen verwaltet und CI/CD-Pipelines mit GitHub Actions oder ähnlichen Systemen entwickelt.
  • Du hast einen Observability-Stack selbst betrieben, beispielsweise mit Grafana, Loki und Prometheus.
  • Du kennst die Sicherheitsgrundlagen für produktive Systeme und setzt sie im Alltag um, von Berechtigungen und Secrets bis zu Sicherheitsupdates.
  • Du verstehst die Grundlagen von RAG-Systemen und typische Fehlerquellen im Betrieb. Bei LLM-Serving kannst du Zielkonflikte zwischen Latenz, Durchsatz, Kosten und Betriebsaufwand einordnen.
  • Du verfolgst die Entwicklung von KI-Modellen und Anbietern aus eigenem Interesse und kannst ihre Eignung für konkrete Anforderungen kritisch bewerten.
  • Du kommunizierst sehr sicher auf Englisch, unserer Teamsprache. Deutschkenntnisse sind ein Plus.
Wie du arbeitest

Du verbindest Eigenständigkeit mit sorgfältigem Engineering. Du untersuchst unbekannte Systeme, bis du die relevanten Zusammenhänge verstehst, begründest Architekturentscheidungen und prüfst Änderungen vor dem produktiven Einsatz.

Du hältst Komplexität beherrschbar und legst Wert auf Wartbarkeit, Dokumentation und Automatisierung. Du priorisierst nach Risiko und Wirkung, holst gezielt Input ein und kommunizierst auch bei Störungen ruhig und klar. Technische Zusammenhänge kannst du Menschen ohne technischen Hintergrund verständlich erklären.

KI-Werkzeuge setzt du produktiv und reflektiert ein. Die Verantwortung für technische Entscheidungen und ausgelieferte Änderungen bleibt bei dir.

Zusätzlich hilfreich
  • Hetzner, NixOS oder self-hosted Supabase.
  • Technische Maßnahmen und Nachweise für ISO 27001.
  • SRE-Praktiken wie SLOs, Error Budgets und Incident Reviews.
  • GPU-Betrieb und LLM-Serving, beispielsweise mit vLLM.

Erfahrung im produktiven GPU- oder Inferenzbetrieb ist keine Voraussetzung. Deine Stärke liegt im Plattformbetrieb. Den AI-Infrastructure-Schwerpunkt kannst du bei uns gezielt ausbauen.

Benefits
  • Ein eigener technischer Verantwortungsbereich, in dem du Architektur, Betriebsqualität und die Arbeitsfähigkeit unseres Engineering-Teams unmittelbar beeinflusst.
  • Ein gut finanziertes, wachsendes KI-Startup mit anspruchsvollen Aufgaben und kurzen Entscheidungswegen.
  • Enge Zusammenarbeit mit Engineering und Geschäftsführung und die Möglichkeit, technische Standards langfristig zu prägen.
  • Die Gelegenheit, deine Erfahrung mit AI Infrastructure und dem Betrieb von LLM-Workloads zu vertiefen.
  • 75.000 bis 85.000 € Jahresbruttogehalt plus VSOP-Beteiligung.
  • Eine unbefristete Vollzeitstelle mit flexiblen Arbeitszeiten.
  • Ein hybrides Arbeitsmodell mit mindestens drei gemeinsamen Bürotagen pro Woche in Leipzig. An den übrigen Tagen kannst du mobil arbeiten.
  • Zugang zu einer WellPass-Mitgliedschaft.
  • Unterstützung beim Umzug nach Leipzig, deren Umfang wir individuell mit dir besprechen.

Wir suchen jemanden, der Freude daran hat, Systeme zu verstehen, ihre Qualität zu verbessern und Verantwortung für ihren langfristigen Betrieb zu übernehmen.

Start ist zum nächstmöglichen Zeitpunkt. Wir freuen uns darauf, dich kennenzulernen.

Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.

oder ziehe deine Datei hierhin.

Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)
Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)

MAIA • Leipzig

Hybrid
Confidential
Eigenen technischen Verantwortungs-bzw
VSOP-Beteiligung
Hybrid-Arbeitsmodell in Leipzig
+3
Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)
Senior DevOps / Platform Engineer, AI Infrastructure (m/w/d)

Join • Leipzig

Hybrid
EUR 80.000 - 90.000
WellPass-Mitgliedschaft
Flexible Arbeitszeiten
Hybrides Arbeiten: mind. drei Bürotage
+2
System Administrator (m/w/d)
System Administrator (m/w/d)

Collectivemind • Leonberg

Vor Ort
EUR 70.000 - 110.000
60+ Expert:innen-Rückhalt
Flexible Arbeitszeiten
Weiterbildung & Zertifizierungen im AI
+1
AI Platform Engineer (all genders)
AI Platform Engineer (all genders)

Datagroup AG • Deutschland

Remote
EUR 90.000 - 140.000
Offene Kultur
Umfassende Einarbeitung
Strategische Rolle
+7
Anwendungsarchitekt - Full-Stack Java/Spring, React, K8s (m/w/d)
Anwendungsarchitekt - Full-Stack Java/Spring, React, K8s (m/w/d)

Free resume • München

Hybrid
EUR 90.000 - 130.000
KI-Produktarbeit
Gründerteam Zusammenarbeit
Hybrides Arbeitsmodell München
+2
AI Platform Engineer (all genders)
AI Platform Engineer (all genders)

DATAGROUP • Gemeindeverwaltungsverband Pliezhausen

Vor Ort
EUR 85.000 - 120.000
Individuelles Weiterbildungsbudget für
Klare Karriere- und Entwicklungspfade
Offene Feedback-Kultur
Anwendungsarchitekt - Full-Stack Java/Spring, React, K8s (m/w/d)
Anwendungsarchitekt - Full-Stack Java/Spring, React, K8s (m/w/d)

Join • München

Hybrid
EUR 90.000 - 120.000
KI-Produktarbeit
Gründungsteam-Kollaboration
Hybrides Arbeiten
+2
AI Engineer (m/w/d)
AI Engineer (m/w/d)

ilume • Mainz

Hybrid
EUR 90.000 - 130.000
Betriebliche Altersvorsorge
Flexible Arbeitszeiten
Mobiles Arbeiten / Büro in Mainz
+5
Senior AI Engineer (m/w/d)
Senior AI Engineer (m/w/d)

Communitas Sozialmarketing GmbH • Bad Kreuznach

Vor Ort
EUR 90.000 - 120.000
Gestaltungsspielraum
Kurze Entscheidungswege
Festanstellung
+4
AI Engineer bei der JUST ADD AI (all genders)
AI Engineer bei der JUST ADD AI (all genders)

Justadd • Bremen

Vor Ort
EUR 60.000 - 80.000
Firmen-Fitness
Kostenübernahme für E-Learning-Kurse
Regelmäßige Teamevents
+2