Engineering Expert

Turing Global India

United States

Remote

USD 124,000 - 193,000

Full time

14 days+
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Turing Global India seeks experienced AI Evaluation Engineers (Engineering Simulation & Design) to author and validate complex, simulation-based tasks across Electrical, Mechanical, Aerospace, and Robotics domains. You will design multi-constraint problems, configure open-source tools, and build objective autograders to push frontier AI performance.

This contractor role requires 40 hours per week with weekend on-call availability and may run up to 24 weeks.

Qualifications

  • Master’s or PhD in Electrical, Mechanical, or Aerospace engineering.
  • 10+ years hands-on engineering design experience.
  • Proficiency with open-source simulation packages and Python scripting.

Responsibilities

  • Author original multi-constraint engineering design tasks with validated reference solutions.
  • Build, run, and validate environments using open-source tools and Python test benches.
  • Analyze agent execution logs to identify systemic failure modes and refine benchmarks.
  • Collaborate with AI researchers and domain experts to integrate benchmarks into evaluation pipelines.

Skills

AI evaluation
Failure diagnostics
Python scripting
Domain rigor & precision
On-call availability

Education

Master's or PhD in Electrical, Mechanical, or Aerospace

Tools

ngspice
PySpice
OpenFOAM
FEniCSx
CalculiX
OpenModelica
Gmsh

Job description

Role Overview

We are seeking experienced AI Evaluation Engineers (Engineering Simulation & Design) to author and validate "model-breaking," simulation-based engineering design problems to train and evaluate state-of-the-art AI agents. Operating across major engineering disciplinesincluding Electrical, Mechanical, Control Systems, Aerospace, Systems, and Robotics—you will create complex, multi-constraint tasks where AI agents must interpret requirements, navigate trade-offs, configure open-source simulation tools, diagnose failures, and iterate toward valid solutions. You will analyze agent execution logs, expose systemic reasoning gaps, and build automated, objective graders to elevate frontier model performance.

Job Requirements:
  • Education & Expertise: Master’s degree or PhD in Electrical, Mechanical, Aerospace, with 10+ years of hands-on engineering design experience.
  • Simulation Tooling: Proficiency with at least one domain-relevant open-source simulation package (e.g., ngspice, PySpice, OpenFOAM, FEniCSx, CalculiX, python-control, CadQuery, build123d, OpenModelica, Cantera, Gmsh) combined with strong Python scripting skills.
  • AI Evaluation & Failure Diagnostics: Hands-on experience with modern LLMs/coding agents and evaluation concepts (pass@k, failure-mode analysis, nondeterministic behavior), with the ability to audit trajectory logs and isolate core reasoning/tool-use failures.
  • Domain Rigor & Precision: Uncompromising attention to physical plausibility, unit consistency, boundary conditions, convergence criteria, and technical documentation.
  • Availability & Commitment: Talent must have weekend on-call availability (part-time engagement is acceptable).
  • Technical Infrastructure: Personal desktop/laptop equipped with a stable, high-speed internet connection in a remote setup.
Job Responsibilities:
  • Model-Breaking Problem Design: Author original, self-contained engineering design tasks with competing constraints, explicit optimization targets, validated reference solutions, and objective autograders.
  • Environment & Simulation Integration: Build, run, and validate problem environments using open-source simulation tools and custom Python test benches.
  • Trajectory Analysis & Failure Mode Taxonomy: Evaluate coding agent outputs and execution logs across repeated trials to identify systemic failure modes (e.g., misinterpreting simulator feedback, premature design convergence, physically impossible geometries).
  • Difficulty Calibration & Benchmark Refinement: Iteratively refine problem difficulty based on empirical model performance data without introducing ambiguity or missing information.
  • Cross-Functional Collaboration: Partner with AI researchers, pod leads, and domain experts to integrate high-rigor benchmarks into the model evaluation pipeline.
Domains:
  • Electrical Engineering
  • Mechanical Engineering
  • Aerospace Engineering
Education & Experience
  • Master or PhD from relevant engineering domain is a must for this position.
  • Experience in AI evaluation, data annotation, content review, quality assurance, or a related analytical role is required.
Offer Details:
  • Commitments Required: 40 hours per week with 4 hours of overlap with PST.
  • Engagement type: Contractor
  • Engagement Length: upto 24 weeks
Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

Engineering Expert
Engineering Expert

Turing • United States

Remote
USD 120,000 - 180,000
Remote contractor role
LLM Engineering Expert- Simulation & Design
LLM Engineering Expert- Simulation & Design

Dover • United States

Remote
USD 1,200 - 2,500
LLM Engineering Expert (Freelancing)
LLM Engineering Expert (Freelancing)

Zettamine Labs • United States

Remote
USD 165,000 - 276,000
AI Evaluation Engineer - Simulation & Design
AI Evaluation Engineer - Simulation & Design

Turing • United States

Remote
USD 120,000 - 180,000
Remote contractor role
Global AI Evaluation Engineer - Simulation & Design
Global AI Evaluation Engineer - Simulation & Design

Dover • United States

Remote
USD 1,200 - 2,500
AI Evaluation Engineer: Simulation & Design (Contract)
AI Evaluation Engineer: Simulation & Design (Contract)

Turing Global India • United States

Remote
USD 124,000 - 193,000
Electrical Engineering AI Evaluation Expert
Electrical Engineering AI Evaluation Expert

OpenTrain AI, Inc. • Northern (KY)

Hybrid
USD 99,000 - 165,000
Engineering Subject Matter Expert (AI Training)
Engineering Subject Matter Expert (AI Training)

Weekday 1 • United States

Remote
USD 28,000 - 55,000
Remote | Technical Problem Author (Multi-Domain) — $60–$110/hour
Remote | Technical Problem Author (Multi-Domain) — $60–$110/hour

24-Mag Llc • Northern (KY), New York (NY)

Hybrid
USD 83,000 - 152,000
Remote | AI Software Engineering Domain Expert — $100–$200/hour
Remote | AI Software Engineering Domain Expert — $100–$200/hour

24-Mag Llc • Northern (KY), New York (NY)

Hybrid
USD 138,000 - 276,000