Für die technische Umsetzung einer modernen GPU-Infrastruktur suchen wir einen erfahrenen Infrastructure Engineer mit Schwerpunkt auf NVIDIA-Technologien, Kubernetes und containerisierten KI-Anwendungen.
Du übernimmst eine zentrale Rolle bei der technischen Inbetriebnahme der GPU-Systeme und stellst sicher, dass diese zuverlässig für LLM-Inference ebenso wie für allgemeine CUDA-Workloads genutzt werden können. Dabei stehen ein sicherer On-Premise-Betrieb, effizientes Ressourcenmanagement und eine stabile Integration in die bestehende Plattformlandschaft im Mittelpunkt.
- Technische Inbetriebnahme und Konfiguration von GPU-basierten Rechenressourcen
- Einrichtung und Optimierung des NVIDIA-Treiber- und CUDA-Stacks
- Integration der GPU-Systeme in bestehende Container- und Kubernetes-Umgebungen
- Einsatz und Konfiguration des NVIDIA GPU Operators
- Konzeption und Umsetzung einer geeigneten GPU-Ressourcenverteilung
- Bewertung und Implementierung von NVIDIA Multi-Instance GPU (MIG)
- Prüfung weiterer Verfahren für GPU-Sharing, Scheduling und Ressourcensteuerung
- Sicherstellung der Nutzung der Infrastruktur für native CUDA-Anwendungen
- Aufbau und Konfiguration von LLM-Serving-Infrastrukturen
- Arbeit mit Technologien wie vLLM, NVIDIA Triton oder TGI
- Integration von KI-/LLM-Diensten in bestehende Unternehmens- und Fachanwendungssysteme
- Unterstützung bei der technischen Anbindung SAP-basierter Verfahren
- Aufbau bzw. Anpassung von Netzwerk-, Storage- und Sicherheitskomponenten
- Einrichtung grundlegender Monitoring- und Observability-Funktionen
- Umsetzung geeigneter Zugriffs- und Sicherheitsmechanismen
- Unterstützung bei der Härtung containerisierter KI-Anwendungen
- Analyse und Behebung technischer Probleme im Plattformbetrieb
- Erstellung technischer Dokumentationen und Betriebsunterlagen
- Wissenstransfer an interne Infrastruktur-, Plattform- und Betriebsteams
- Technische Inbetriebnahme und Konfiguration von GPU-basierten Rechenressourcen
- Einrichtung und Optimierung des NVIDIA-Treiber- und CUDA-Stacks
- Integration der GPU-Systeme in bestehende Container- und Kubernetes-Umgebungen
- Einsatz und Konfiguration des NVIDIA GPU Operators
- Konzeption und Umsetzung einer geeigneten GPU-Ressourcenverteilung
- Bewertung und Implementierung von NVIDIA Multi-Instance GPU (MIG)
- Prüfung weiterer Verfahren für GPU-Sharing, Scheduling und Ressourcensteuerung
- Sicherstellung der Nutzung der Infrastruktur für native CUDA-Anwendungen
- Aufbau und Konfiguration von LLM-Serving-Infrastrukturen
- Arbeit mit Technologien wie vLLM, NVIDIA Triton oder TGI
- Integration von KI-/LLM-Diensten in bestehende Unternehmens- und Fachanwendungssysteme
- Unterstützung bei der technischen Anbindung SAP-basierter Verfahren
- Aufbau bzw. Anpassung von Netzwerk-, Storage- und Sicherheitskomponenten
- Einrichtung grundlegender Monitoring- und Observability-Funktionen
- Umsetzung geeigneter Zugriffs- und Sicherheitsmechanismen
- Unterstützung bei der Härtung containerisierter KI-Anwendungen
- Analyse und Behebung technischer Probleme im Plattformbetrieb
- Erstellung technischer Dokumentationen und Betriebsunterlagen
- Wissenstransfer an interne Infrastruktur-, Plattform- und Betriebsteams
- Deutsch: Verhandlungssicher
- Englisch: Erweiterte Kenntnisse