MTS Inference: GPU Kernel & Performance Architect

Sail Research

San Francisco (CA)

On-site

USD 120,000 - 160,000

Full time

14 days+
Application generator

Turn this role into an interview — a resume and cover letter built around what this employer wants.

Get past ATS filters

Benefits offered by this job

Meals provided
Studio Display for every employee

Job summary

Sail Research in San Francisco is looking for a motivated software engineer to optimize token processing at every layer of the stack. You will modify inference engines and analyze GPU performance, ensuring efficient hardware utilization.

The ideal candidate has a solid understanding of LLM mechanics and interests in cutting-edge MLSys research. The company offers benefits like free meals and a Studio Display for every employee.

Qualifications

  • Strong understanding of LLM mechanics, such as KV cache and mixture-of-experts.
  • Interest in MLSys research and current advancements.
  • Familiarity or willingness to learn modern tile-based GPU programming.

Responsibilities

  • Modify and extend state-of-the-art inference engines.
  • Analyze GPU time utilization and explain kernel launches.
  • Design and implement parallelism schemes for unique hardware.

Skills

Understanding of LLM mechanics
GPU programming
Interest in MLSys research

Tools

Triton
CUTLASS
ThunderKittens

Job description

Sail Research in San Francisco is looking for a motivated software engineer to optimize token processing at every layer of the stack. You will modify inference engines and analyze GPU performance, ensuring efficient hardware utilization.

The ideal candidate has a solid understanding of LLM mechanics and interests in cutting-edge MLSys research. The company offers benefits like free meals and a Studio Display for every employee.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Member of Technical Staff - Inference
Member of Technical Staff - Inference

Sail • San Francisco (CA)

On-site
USD 180,000 - 240,000
Member of Technical Staff - Inference
Member of Technical Staff - Inference

Sail Research • San Francisco (CA)

On-site
USD 120,000 - 160,000
Meals provided
Studio Display for every employee
LLM Inference Performance Engineer - GPU Kernel Optimizer
LLM Inference Performance Engineer - GPU Kernel Optimizer

Intel • Folsom (CA)

Hybrid
USD 171,000 - 315,000
Stock bonuses
Health benefits
Hybrid work model
Staff AI Inference Kernel Engineer
Staff AI Inference Kernel Engineer

Sail • San Francisco (CA)

On-site
USD 180,000 - 240,000
Senior GPU Kernel Engineer, High-Performance Compiler
Senior GPU Kernel Engineer, High-Performance Compiler

San Francisco Tensor Company • San Francisco (CA)

On-site
USD 285,000 - 315,000
Relocation assistance
Equity
Senior LLM Inference: GPU Kernel Optimization
Senior LLM Inference: GPU Kernel Optimization

NVIDIA • Austin (TX)

On-site
USD 184,000
Equity
Benefits
ML Systems Engineer: Inference & GPU-Driven Distributed Workloads
ML Systems Engineer: Inference & GPU-Driven Distributed Workloads

Bake AI • San Mateo (CA), Northern (KY)

Hybrid
USD 180,000 - 240,000
Performance Engineer: GPU Kernel & Inference Optimize
Performance Engineer: GPU Kernel & Inference Optimize

WORLD LABS • San Francisco (CA)

On-site
USD 200,000 - 300,000
Senior LLM Inference Engineer: Performance & Optimization
Senior LLM Inference Engineer: Performance & Optimization

Confidential • United States

On-site
USD 180,000 - 240,000
Senior GPU Kernel Optimizer for LLM Inference
Senior GPU Kernel Optimizer for LLM Inference

NVIDIA • Seattle (WA)

On-site
USD 184,000 - 288,000