LLM Inference Optimization Engineer

GMI Cloud

Mountain View (CA)

On-site

USD 180,000 - 240,000

Full time

13 hours ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

GMI Cloud, a fast-growing AI infrastructure company, is hiring a Machine Learning Engineer, LLM Optimization to build a world-leading inference optimization team. You will drive research, validation, and productionization of advanced optimization techniques to boost latency, throughput, and cost efficiency across the inference platform.

You will focus on B200-first optimization with H200 evolution, collaborating with platform and infra teams to turn new ideas into measurable customer-ready

Qualifications

  • Experience with LLM inference systems and performance optimization.
  • Familiar with inference metrics and tradeoffs (throughput, latency, memory).
  • Hands-on with GPU-based inference and model serving architectures.

Responsibilities

  • Drive frontier research and engineering in LLM inference optimization for high performance.
  • Develop optimization strategies for large-scale LLM serving across runtimes and production platforms.
  • Advance quantization, speculative decoding, KV cache, and memory optimization techniques.

Skills

LLM inference
Python
GPU inference
Performance profiling
System optimization
Benchmarks
observability
Cross-functional collaboration

Tools

SGLang
vLLM
TensorRT-LLM
Triton

Job description

GMI Cloud, a fast-growing AI infrastructure company, is hiring a Machine Learning Engineer, LLM Optimization to build a world-leading inference optimization team. You will drive research, validation, and productionization of advanced optimization techniques to boost latency, throughput, and cost efficiency across the inference platform.

You will focus on B200-first optimization with H200 evolution, collaborating with platform and infra teams to turn new ideas into measurable customer-ready

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

LLM Inference Optimization Engineer
LLM Inference Optimization Engineer

GMI Cloud • San Francisco (CA)

On-site
USD 180,000 - 240,000
LLM Inference Optimization Engineer
LLM Inference Optimization Engineer

GMI Cloud • Mountain View (CA)

On-site
USD 170,000 - 230,000
Machine Learning Engineer (LLM inference)
Machine Learning Engineer (LLM inference)

GMI Cloud • Mountain View (CA)

On-site
USD 180,000 - 240,000
LLM Inference Optimization Engineer — Frontier Performance
LLM Inference Optimization Engineer — Frontier Performance

NLP PEOPLE • Sonoma (CA)

On-site
USD 120,000 - 160,000
Machine Learning Engineer, LLM Inference Optimization in Sonoma
Machine Learning Engineer, LLM Inference Optimization in Sonoma

NLP PEOPLE • Sonoma (CA)

On-site
USD 120,000 - 160,000
Infrastructure Engineer, LLM Inference Optimization
Infrastructure Engineer, LLM Inference Optimization

GMI Cloud • Mountain View (CA)

On-site
USD 170,000 - 230,000
Machine Learning Engineer, LLM Inference Optimization
Machine Learning Engineer, LLM Inference Optimization

GMI Cloud • San Francisco (CA)

On-site
USD 180,000 - 240,000
LLM Inference Performance Engineer - GPU Kernel Optimizer
LLM Inference Performance Engineer - GPU Kernel Optimizer

Intel • Folsom (CA)

Hybrid
USD 171,000 - 315,000
Stock bonuses
Health benefits
Hybrid work model
ML Engineer—LLM Inference & GPU Optimization (Equity)
ML Engineer—LLM Inference & GPU Optimization (Equity)

IC Resources • San Francisco (CA)

On-site
USD 200,000 - 290,000
401(k)
Unlimited PTO
Modern engineering workspace
+1
Edge-to-Cloud LLM Inference Engineer
Edge-to-Cloud LLM Inference Engineer

Insider, Inc. • United States

On-site
USD 100,000 - 140,000