Director, AI Operations – Optimization

Jobtailor

Illinois

On-site

USD 150,000 - 210,000

Full time

14 days+

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Jobtailor in the United States (Illinois) seeks a senior leader to own AI operations across enterprise AI applications and intelligent automation. You will scale observability, incident response, and runtime governance while aligning with security, architecture, and business stakeholders.

The role centers on scalable processes, mentoring managers and engineers, coordinating with vendors, and driving continuous improvement in production AI reliability.

Qualifications

  • 8+ years in AI operations or enterprise technology functions.
  • 3+ years leading operational teams or large-scale initiatives.
  • Hands‑on experience supporting production AI solutions using LLMs, APIs, orchestration frameworks.
  • Strong experience with observability, incident management, DevOps, and production operations.
  • Experience leading distributed teams and managing contractors/vendors.
  • Proven ability to manage multiple priorities in dynamic environments.

Responsibilities

  • Lead enterprise AI operational activities including runtime monitoring, incident management, and production reliability.
  • Establish and improve AI operations practices, including AIOps and LLMOps processes.
  • Drive runtime stability and service reliability through monitoring, escalation, and root-cause analyses.
  • Ensure governance, safeguards, and secure AI operationalization standards.
  • Collaborate with AI Engineering, Governance, Security, and business stakeholders to ensure readiness.
  • Mentor operations managers, engineers, analysts, and contractors to build a high-performing team.

Skills

AI operations
DevOps
SRE
Observability
Incident management
LLMs
Automation
Cloud platforms

Education

Bachelor’s degree in CS/IS/Engineering

Tools

CI/CD pipelines
Monitoring tools
Observability platforms

Job description

Responsibilities
  • Lead enterprise AI operational activities, including runtime monitoring, operational support, incident management, production reliability, and operational continuity for AI-powered applications and intelligent automation solutions.
  • Establish, implement, and continuously improve AI operational practices, including AIOps and LLMOps processes, runtime observability, operational telemetry, drift detection, release coordination, support workflows, and operational readiness activities.
  • Drive runtime stability and service reliability initiatives through production monitoring, escalation management, root cause analysis, operational playbooks, and service continuity practices.
  • Support enforcement of runtime governance standards, operational safeguards, human oversight controls, and secure operationalization practices for enterprise AI solutions.
  • Ensure operational excellence across AI environments through proactive monitoring, issue prevention, and continuous service improvement efforts.
  • Lead initiatives focused on runtime efficiency, operational scalability, inference utilization, supportability, performance optimization, and sustainable AI operations.
  • Promote standardized operational processes, scalable support models, automation opportunities, and continuous improvement initiatives across AI operations functions.
  • Drive operational maturity by identifying opportunities to enhance performance, reduce operational risk, and improve support effectiveness.
  • Partner closely with AI Engineering & Delivery, AI Governance, AI Quality Engineering, Automation, Architecture, Platform Engineering, Security, Infrastructure, and business stakeholders to ensure operational readiness and runtime reliability.
  • Coordinate operational execution activities across AI operations teams, including operational planning, vendor and contractor management, issue prioritization, escalation management, knowledge transfer, and delivery continuity.
  • Support operational assessments, production readiness reviews, implementation planning, runtime support strategies, and modernization initiatives for prioritized AI capabilities.
  • Collaborate with technical and business leaders to align operational practices with enterprise AI objectives and service expectations.
  • Lead, mentor, and develop operations managers, engineers, analysts, and contractor resources while fostering a high-performing, collaborative, and continuously learning culture.
  • Provide clear communication regarding operational performance, runtime risks, service reliability concerns, optimization opportunities, engineering tradeoffs, and strategic recommendations.
  • Establish accountability for operational outcomes while promoting operational discipline, innovation, and continuous improvement.
  • Research and evaluate emerging AI operational technologies, observability platforms, automation capabilities, optimization techniques, and runtime management practices to drive innovation and operational effectiveness.
Requirements
  • Bachelor’s degree in Computer Science, Information Systems, Engineering, Technology Management, or a related field preferred.
  • 8+ years of experience in AI operations, software engineering, platform operations, engineering delivery, DevOps, Site Reliability Engineering (SRE), infrastructure operations, or related enterprise technology functions required.
  • 3+ years of experience leading operational teams, engineering support organizations, platform operations, or large-scale technology initiatives required.
  • Hands‑on experience supporting, operationalizing, monitoring, or optimizing production AI solutions utilizing large language models (LLMs), APIs, agentic workflows, orchestration frameworks, and modern AI engineering practices required.
  • Strong experience implementing and scaling operational support models, observability practices, incident management processes, DevOps methodologies, runtime operations, or enterprise operational frameworks required.
  • Experience with observability platforms, monitoring tools, incident management processes, runtime operations, CI/CD pipelines, and production support practices required.
  • Experience leading distributed teams, managing contractors and vendors, and delivering operational initiatives within complex and evolving environments required.
  • Experience with cloud platforms, APIs, data integration technologies, automation frameworks, monitoring solutions, DevOps tools, and modern operational toolsets required.
  • Strong analytical, problem‑solving, communication, presentation, stakeholder management, and cross‑functional collaboration skills required.
  • Demonstrated ability to manage multiple priorities in fast‑paced, evolving, and operationally dynamic environments required.
  • Experience supporting enterprise‑scale AI, automation, digital transformation, or platform modernization initiatives preferred.
  • Knowledge of AI governance, responsible AI principles, operational risk management, and production AI lifecycle management preferred.
Hard Skills
  • AI operations
  • software engineering
  • platform operations
  • DevOps
  • Site Reliability Engineering (SRE)
  • incident management
  • observability practices
  • production support
  • large language models (LLMs)
  • automation frameworks
Soft Skills
  • analytical skills
  • problem‑solving
  • communication
  • presentation
  • stakeholder management
  • cross‑functional collaboration
  • leadership
  • mentoring
  • operational discipline
  • continuous improvement
Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Sr. Systems Engineer - AI
Sr. Systems Engineer - AI

Kansas Ag Connection • Kansas City (KS)

On-site
USD 140,000 - 190,000
Sr. Systems Engineer - AI
Sr. Systems Engineer - AI

Dairy Farmers of America • Kansas City (KS)

On-site
USD 98,000 - 139,000
Lead AI Engineer, Business Operations
Lead AI Engineer, Business Operations

Jobtailor • Dallas (TX)

On-site
USD 140,000 - 200,000
Associate Director, AI Engineering – Live Operations
Associate Director, AI Engineering – Live Operations

Jobtailor • New Jersey

On-site
USD 180,000 - 240,000
AI Tech Transformation Manager
AI Tech Transformation Manager

LaPieza • United States

On-site
MXN 1,732,000 - 2,079,000
AI Platform Delivery Director
AI Platform Delivery Director

Jobtailor • Massachusetts

On-site
USD 180,000 - 240,000
AIOps Engineer
AIOps Engineer

Compunnel, Inc. • Reston (VA)

On-site
USD 120,000 - 150,000
Managing Director – Head of AI Operational Architecture & Integration
Managing Director – Head of AI Operational Architecture & Integration

Jobtailor • New Jersey

On-site
USD 180,000 - 240,000
AI-ML Director
AI-ML Director

Jobtailor • Town of Florida (NY)

On-site
USD 150,000 - 210,000
Director, AI Platform – Portfolio Delivery
Director, AI Platform – Portfolio Delivery

Jobtailor • Connecticut

On-site
USD 170,000 - 210,000