AI Inference Engineer (all genders)

EXXETA AG

Germany (OH)

On-site

USD 60,000 - 90,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

EXXETA AG sucht einen AI Inference Engineer, der die technische Grundlage für produktive AI-Systeme schafft. Ziel ist die Entwicklung und der Betrieb von hochstehenden LLM-Inferenzplattformen, die sicher und skalierbar sind.

Sie bringen Erfahrung in Platform Engineering oder MLOps mit und sind熟悉 mit Kubernetes, Docker, und CI/CD. Fließende Deutsch- und Englischkenntnisse sind erforderlich. Nutzen Sie die Chance, gemeinsam mit Experten innovative AI-Lösungen zu entwickeln.

Qualifications

  • Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps, DevOps oder Backend Engineering.
  • Verständnis moderner LLM-Inferenztechniken und deren Kosten-Nutzen-Analyse.
  • Erfahrungen mit Docker, Kubernetes und CI/CD-Tools.

Responsibilities

  • Entwickeln produktiver LLM-Inferenzplattformen für kundenindividuelle Anforderungen.
  • Integration moderner Inferenz-Engines in Cloud-Umgebungen.
  • Optimierung von GPU- und Speicherressourcen.

Skills

Platform Engineering
Cloud Infrastructure
MLOps
Kubernetes
Docker
Machine Learning Engineering

Tools

Terraform
CI/CD
Linux

Job description

Als AI Inference Engineer baust du die technische Grundlage für produktive AI-Systeme in regulierten Umgebungen. Du entwickelst und betreibst LLM-Inferenzplattformen, die on‑premises oder in privaten Cloud‑Umgebungen laufen – sicher, skalierbar, beobachtbar und wirtschaftlich.

Du sorgst dafür, dass moderne Modelle nicht nur in einer Demo überzeugen, sondern unter realen Produktionsbedingungen zuverlässig funktionieren: mit sauberer GPU‑Planung, niedriger Latenz, kontrollierten Kosten, belastbarem Monitoring und klar definierten Betriebsmodellen.

Was erwartet dich
  • Du konzipierst, entwickelst und betreibst produktive LLM‑Inferenzplattformen für Kunden mit hohen Anforderungen an Datensouveränität, Sicherheit und Betriebskontrolle – on‑premises, in privaten Cloud‑Umgebungen oder souveränen europäischen Cloud‑Setups.
  • Gemeinsam mit Cloud‑ , Plattform‑ , Security‑ und Data‑Engineering‑Teams sowie unseren Kunden überführst du AI‑Use‑Cases in den produktiven Betrieb.
  • Dabei integrierst du moderne Inferenz‑Engines und Open‑Weights‑Modelle in Kubernetes‑, Container‑ und Plattformumgebungen.
  • Außerdem planst und optimierst du GPU‑ und Speicherressourcen sowie Inferenz‑Workloads: Von Modellgrößen, Quantisierung und Batching bis hin zu KV‑Cache‑Strategien, Latenz, Durchsatz und Kosten.
  • Du verantwortest die Runtime produktiver AI‑Systeme, inklusive Modellserving, APIs, Authentifizierung, Secrets, Observability, Logging
  • Aus Kundenprojekten entwickelst du wiederverwendbare Referenzarchitekturen, Deployment‑Templates und Betriebs‑Playbooks und stärkst so unsere Applied‑AI‑Capability.
Was erwarten wir von dir
  • Persönlicher Background: Erfahrung in Platform Engineering, Cloud Infrastructure, MLOps, LLMOps, DevOps, Backend Engineering oder Machine Learning Engineering. Entscheidend ist deine Erfahrung im Aufbau und Betrieb produktiver Systeme und dein Antrieb zu schneller persönlicher Weiterentwicklung
  • Inference Engineering: Du verstehst die technischen und wirtschaftlichen Zusammenhänge moderner LLM‑Inferenz, von Model‑Serving und GPU‑Auslastung über Quantisierung, Batching und KV‑Cache‑Management bis hin zu Latenz, Durchsatz und Kosten.
  • Cloud & Plattformen: Docker, Kubernetes, Helm, Terraform, CI/CD, Linux sowie Observability gehören für dich zum Arbeitsalltag.
  • AI‑Verständnis:Du kannst Transformer‑basierte Modelle wie LLMs und Embeddings einordnen und fundierte technische Entscheidungen für produktive AI‑Systeme treffen.
  • Security & Governance: Themen wie Identitäten, Berechtigungen, Secrets, Logging, Auditierung und Compliance denkst du, insbesondere in regulierten Umgebungen, von Anfang an mit.
  • Kommunikation & Arbeitsweise: Du vermittelst komplexe technische Zusammenhänge verständlich, arbeitest pragmatisch und bewegst dich auch in dynamischen Projektumfeldern sicher.
  • Pluspunkt: Erfahrung mit vLLM, SGLang oder vergleichbaren Inference‑Technologien, GPU‑Clustern, souveränen Cloud‑ oder Private‑Cloud‑Umgebungen.
  • On the road: Du bist reisebereit und flexibel, unsere Kunden bundesweit vor Ort zu beraten.
  • Let’s talk: Du sprichst fließend Deutsch und Englisch – super, dann findest du dich bei Exxeta bestens zurecht
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Production AI Inference Engineer (On-Prem & Private Cloud)
Production AI Inference Engineer (On-Prem & Private Cloud)

EXXETA AG • Germany (OH)

On-site
USD 60,000 - 90,000
AI Engineer (all genders)
AI Engineer (all genders)

EXXETA AG • Germany (OH)

Hybrid
USD 75,000 - 99,000
Forward Deployed AI Engineer (all genders)
Forward Deployed AI Engineer (all genders)

AdEx Partners • Germany (OH)

On-site
USD 102,000 - 138,000
Mitmach-Company
flache Hierarchien
Bonussystem (ohne Kappung)
+5
LLM & Agentic AI Consultant*
LLM & Agentic AI Consultant*

b.telligent • Germany (OH)

Hybrid
USD 102,000 - 149,000
Flexibles Arbeiten
Workation-Möglichkeiten
Zuschuss zum Wellpass
+5
AI Integration & Automation Engineer (m/w/d) GER
AI Integration & Automation Engineer (m/w/d) GER

customssupport • Germany (OH)

On-site
USD 81,000 - 116,000
AI Integration & Automation Engineer (m/w/d) GER
AI Integration & Automation Engineer (m/w/d) GER

Meyandy LLC • Germany (OH)

Hybrid
USD 81,000 - 127,000
AI Research Engineer
AI Research Engineer

United States Digital Space LLC • United States

Hybrid
USD 85,000 - 115,000
Flache Hierarchien
Wettbewerbsfähiges Gehalt + Equity
Dediziertes Compute-Budget
(Senior) AI Engineer (m/w/d)
(Senior) AI Engineer (m/w/d)

MAKONIS GmbH • Germany (OH)

Hybrid
USD 82,000 - 106,000
Home-Office
Mobilitätsbudget
Spannende Projektarbeiten
+2
Senior AI Platform Engineer (m/w/d)
Senior AI Platform Engineer (m/w/d)

Leadvise Reply • Germany (OH)

On-site
USD 104,000 - 161,000
Machine Learning Engineer
Machine Learning Engineer

AImera Group • Germany (OH)

On-site
USD 70,000 - 101,000