2. GPU Infrastructure Engineer (Senior) (m/w/d)

SOMI Solutions GmbH

Kassel

Vor Ort

EUR 80.000 - 110.000

Vollzeit

Vor 12 Tagen
Bewerbungsgenerator

Verschicke keinen generischen Lebenslauf — erstelle einen Lebenslauf und ein Anschreiben, die genau auf diese Rolle zugeschnitten sind.

Schaffe es an den ATS-Filtern vorbei

Zusammenfassung

SOMI Solutions GmbH in Hessen sucht einen erfahrenen Infrastructure Engineer mit Fokus auf NVIDIA-Technologien, Kubernetes und KI-Anwendungen.

Sie übernehmen die technische Inbetriebnahme der GPU-Systeme, sichern On-Premise-Betrieb, Ressourcenmanagement und Integration in die bestehende Plattform.

Qualifikationen

  • Erfahrung in der technischen Inbetriebnahme GPU-basierter Rechenressourcen und Treiber-/CUDA-Stacks.
  • Integration GPU-gestützter Workloads in Kubernetes-Umgebungen.
  • Konzeption von GPU-Ressourcenverteilung inkl. MIG.
  • Aufbau von LLM-Serving-Infrastrukturen und KI-Diensten.
  • Sicherheit, Monitoring und Dokumentation.

Aufgaben

  • Technische Inbetriebnahme und Konfiguration von GPU-basierten Rechenressourcen
  • Einrichtung und Optimierung des NVIDIA-Treiber- und CUDA-Stacks
  • Integration der GPU-Systeme in bestehende Container- und Kubernetes-Umgebungen
  • Einsatz und Konfiguration des NVIDIA GPU Operators
  • Konzeption und Umsetzung einer geeigneten GPU-Ressourcenverteilung
  • Bewertung und Implementierung von NVIDIA Multi-Instance GPU (MIG)
  • Prüfung weiterer Verfahren für GPU-Sharing, Scheduling und Ressourcensteuerung
  • Sicherstellung der Nutzung der Infrastruktur für native CUDA-Anwendungen
  • Aufbau und Konfiguration von LLM-Serving-Infrastrukturen
  • Arbeit mit Technologien wie vLLM, NVIDIA Triton oder TGI
  • Integration von KI-/LLM-Diensten in bestehende Unternehmens- und Fachanwendungssysteme
  • Unterstützung bei der technischen Anbindung SAP-basierter Verfahren
  • Aufbau bzw. Anpassung von Netzwerk-, Storage- und Sicherheitskomponenten
  • Einrichtung grundlegender Monitoring- und Observability-Funktionen
  • Umsetzung geeigneter Zugriffs- und Sicherheitsmechanismen
  • Unterstützung bei der Härtung containerisierter KI-Anwendungen
  • Analyse und Behebung technischer Probleme im Plattformbetrieb
  • Erstellung technischer Dokumentationen und Betriebsunterlagen
  • Wissenstransfer an interne Infrastruktur-, Plattform- und Betriebsteams

Kenntnisse

GPU-Cluster-Setup
NVIDIA CUDA
Kubernetes
Containerisierung
NVIDIA GPU Operator
MIG (Multi-Instance GPU)
LLM-Serving-Archtik
vLLM/Triton/TGI
Networking & Storage
Monitoring & Observability
Security & Access Management
SAP-Integration
Dokumentation & Wissensaustausch
German (Verhandlungssicher)
English (Fortgeschritten)

Jobbeschreibung

Für die technische Umsetzung einer modernen GPU-Infrastruktur suchen wir einen erfahrenen Infrastructure Engineer mit Schwerpunkt auf NVIDIA-Technologien, Kubernetes und containerisierten KI-Anwendungen.

Du übernimmst eine zentrale Rolle bei der technischen Inbetriebnahme der GPU-Systeme und stellst sicher, dass diese zuverlässig für LLM-Inference ebenso wie für allgemeine CUDA-Workloads genutzt werden können. Dabei stehen ein sicherer On-Premise-Betrieb, effizientes Ressourcenmanagement und eine stabile Integration in die bestehende Plattformlandschaft im Mittelpunkt.

  • Technische Inbetriebnahme und Konfiguration von GPU-basierten Rechenressourcen
  • Einrichtung und Optimierung des NVIDIA-Treiber- und CUDA-Stacks
  • Integration der GPU-Systeme in bestehende Container- und Kubernetes-Umgebungen
  • Einsatz und Konfiguration des NVIDIA GPU Operators
  • Konzeption und Umsetzung einer geeigneten GPU-Ressourcenverteilung
  • Bewertung und Implementierung von NVIDIA Multi-Instance GPU (MIG)
  • Prüfung weiterer Verfahren für GPU-Sharing, Scheduling und Ressourcensteuerung
  • Sicherstellung der Nutzung der Infrastruktur für native CUDA-Anwendungen
  • Aufbau und Konfiguration von LLM-Serving-Infrastrukturen
  • Arbeit mit Technologien wie vLLM, NVIDIA Triton oder TGI
  • Integration von KI-/LLM-Diensten in bestehende Unternehmens- und Fachanwendungssysteme
  • Unterstützung bei der technischen Anbindung SAP-basierter Verfahren
  • Aufbau bzw. Anpassung von Netzwerk-, Storage- und Sicherheitskomponenten
  • Einrichtung grundlegender Monitoring- und Observability-Funktionen
  • Umsetzung geeigneter Zugriffs- und Sicherheitsmechanismen
  • Unterstützung bei der Härtung containerisierter KI-Anwendungen
  • Analyse und Behebung technischer Probleme im Plattformbetrieb
  • Erstellung technischer Dokumentationen und Betriebsunterlagen
  • Wissenstransfer an interne Infrastruktur-, Plattform- und Betriebsteams
  • Technische Inbetriebnahme und Konfiguration von GPU-basierten Rechenressourcen
  • Einrichtung und Optimierung des NVIDIA-Treiber- und CUDA-Stacks
  • Integration der GPU-Systeme in bestehende Container- und Kubernetes-Umgebungen
  • Einsatz und Konfiguration des NVIDIA GPU Operators
  • Konzeption und Umsetzung einer geeigneten GPU-Ressourcenverteilung
  • Bewertung und Implementierung von NVIDIA Multi-Instance GPU (MIG)
  • Prüfung weiterer Verfahren für GPU-Sharing, Scheduling und Ressourcensteuerung
  • Sicherstellung der Nutzung der Infrastruktur für native CUDA-Anwendungen
  • Aufbau und Konfiguration von LLM-Serving-Infrastrukturen
  • Arbeit mit Technologien wie vLLM, NVIDIA Triton oder TGI
  • Integration von KI-/LLM-Diensten in bestehende Unternehmens- und Fachanwendungssysteme
  • Unterstützung bei der technischen Anbindung SAP-basierter Verfahren
  • Aufbau bzw. Anpassung von Netzwerk-, Storage- und Sicherheitskomponenten
  • Einrichtung grundlegender Monitoring- und Observability-Funktionen
  • Umsetzung geeigneter Zugriffs- und Sicherheitsmechanismen
  • Unterstützung bei der Härtung containerisierter KI-Anwendungen
  • Analyse und Behebung technischer Probleme im Plattformbetrieb
  • Erstellung technischer Dokumentationen und Betriebsunterlagen
  • Wissenstransfer an interne Infrastruktur-, Plattform- und Betriebsteams
  • Deutsch: Verhandlungssicher
  • Englisch: Erweiterte Kenntnisse
Hol dir deinen kostenlosen, vertraulichen Lebenslauf-Check.
oder ziehe deine Datei hierhin.
Similar jobs

Ähnliche Jobs, die dir auch gefallen könnten

IT Administrator (m/w/d) Schwerpunkt KI Plattform
IT Administrator (m/w/d) Schwerpunkt KI Plattform

kdw HR GmbH & Co. KG • Altenesch

Vor Ort
EUR 80.000 - 110.000
Unbefristetes Arbeitsverhältnis
Persönliche Betreuung auf Augenhöhe -
Übertarifliche Bezahlung
+5
AI Platform Engineer
AI Platform Engineer

Guldberg GmbH • München

Vor Ort
EUR 60.000 - 80.000
IT-Systemadministrator (m/w/d) – Schwerpunkt AI / KI
IT-Systemadministrator (m/w/d) – Schwerpunkt AI / KI

Beckhoff Automation GmbH • Verl

Vor Ort
EUR 85.000 - 120.000
Infrastructure Engineer (m/w/d)
Infrastructure Engineer (m/w/d)

Computer Futures • Berlin

Hybrid
EUR 110.000 - 150.000
30 Urlaubstage
Hochwertige technische Ausstattung
Dev- ML-Ops- / Cloud- Engineer (m/w/d)
Dev- ML-Ops- / Cloud- Engineer (m/w/d)

LogaRec GmbH • Münster

Hybrid
Confidential
Hybrides oder Remote-Arbeiten
Flexibles Arbeiten
Gestaltungsspielraum
+1
AI Platform Engineer (m/w/d)
AI Platform Engineer (m/w/d)

AI-Z Group • Stuttgart

Vor Ort
EUR 60.000 - 80.000
Transparente Gehaltsentwicklung
Beteiligung am Unternehmenserfolg
Zugang zu NVIDIA DGX Hardware
+3
Engineering Manager (d/f/m)
Engineering Manager (d/f/m)

ZABEL • Berlin

Hybrid
EUR 119.000 - 140.000
Technical Lead – GPU Infrastructure
Technical Lead – GPU Infrastructure

Jobtailor • Deutschland

Remote
EUR 120.000 - 160.000
Softwareentwickler GPU / CUDA (m/w/d) Sonar-Systeme
Softwareentwickler GPU / CUDA (m/w/d) Sonar-Systeme

FERCHAU Engineering GmbH • Bremen

Vor Ort
EUR 70.000 - 90.000
Betriebliche Altersvorsorge
Unbefristeter Arbeitsvertrag
Rabatte bei Reisen, Elektronik oder A‑
+2
Senior Experte für High-Performance Computing (m/w/x)
Senior Experte für High-Performance Computing (m/w/x)

ZEISS Group • Oberkochen

Vor Ort
EUR 70.000 - 90.000