AI Evaluation & Reliability Architect

Landing Point

Village of Pelham (NY)

On-site

USD 152,000 - 179,000

Full time

14 days+
Application generator

An application made for this job — a tailored resume and cover letter that speak straight to the posting.

Get past ATS filters

Job summary

Landing Point seeks an AI Evaluation Infrastructure Consultant to ensure the quality and compliance of AI systems across production environments. The role builds evaluation disciplines and tooling, develops golden test sets, and integrates drift detection to support scalable governance.

In collaboration with risk, compliance, and legal teams, you will establish production-readiness gates, run regression and adversarial testing, and provide evaluation evidence for governance and third-party

Qualifications

  • 7+ years of experience in software quality, data science, machine learning, or related fields.
  • Experience designing evaluation methods for LLM or ML systems.
  • Strong understanding of testing methodology and statistical rigor.
  • Experience with bias and fairness evaluation; familiarity with fair-lending concepts is a plus.
  • Ability to define and enforce production-readiness gates and acceptance criteria.
  • Experience partnering with risk, compliance, and legal teams.

Responsibilities

  • Develop evaluation harnesses and tooling for AI systems.
  • Create golden test sets and scenario libraries for expected behaviors and edge cases.
  • Conduct regression testing to identify quality changes.
  • Perform hallucination and grounding/faithfulness testing.
  • Conduct bias and fairness testing to support fair-lending obligations.
  • Implement adversarial and red-team testing.
  • Ensure policy-adherence testing against compliance and regulatory requirements.
  • Monitor drift detection and ongoing production.
  • Manage human and subject-matter-expert evaluation workflows.
  • Establish production-readiness gates for AI systems.
  • Provide evaluation evidence and reporting for AI governance.
  • Define AI vendor acceptance criteria for third-party solutions.

Skills

LLM evaluation methods
Statistical testing
Bias and fairness evaluation
Production-readiness gates
Risk & compliance collaboration

Job description

Landing Point seeks an AI Evaluation Infrastructure Consultant to ensure the quality and compliance of AI systems across production environments. The role builds evaluation disciplines and tooling, develops golden test sets, and integrates drift detection to support scalable governance.

In collaboration with risk, compliance, and legal teams, you will establish production-readiness gates, run regression and adversarial testing, and provide evaluation evidence for governance and third-party

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

AI Evaluation Infrastructure Consultant
AI Evaluation Infrastructure Consultant

Landing Point • Village of Pelham (NY)

On-site
USD 152,000 - 179,000
Remote Enterprise AI Evaluation & Readiness Lead
Remote Enterprise AI Evaluation & Readiness Lead

Ports North • Baltimore (MD)

On-site
USD 138,000 - 207,000
AI Evaluation Scientist: Trust & Safety Leader
AI Evaluation Scientist: Trust & Safety Leader

Steampunk • McLean (VA)

Hybrid
USD 105,000 - 145,000
AI Evaluation Architect: Administrative Workflows
AI Evaluation Architect: Administrative Workflows

OpenTrain AI, Inc. • Northern (KY)

Hybrid
USD 60,000 - 90,000
AI Evaluations Architect, Decision Intelligence
AI Evaluations Architect, Decision Intelligence

Apple Inc. • Cupertino (CA)

On-site
USD 185,000 - 278,000
Medical insurance
Dental coverage
Retirement benefits
+3
AI Evaluation Engineer: RL Environments & Agents
AI Evaluation Engineer: RL Environments & Agents

MaxIT Consulting - Max Corporate Group • San Francisco (CA)

On-site
USD 140,000 - 210,000
AI Evaluation Scientist: Trustworthy Metrics & Testing
AI Evaluation Scientist: Trustworthy Metrics & Testing

Steampunk, Inc. • McLean (VA)

On-site
USD 105,000 - 145,000
AI Evaluation Engineer
AI Evaluation Engineer

DeepRec.ai • Denver (CO)

Remote
USD 180,000
Chief AI Quality, Risk & Evaluation
Chief AI Quality, Risk & Evaluation

Agilent Technologies • Santa Clara (CA)

On-site
USD 180,000 - 260,000
Senior AI Test & Evaluation Engineer
Senior AI Test & Evaluation Engineer

Motion • Birmingham (AL), Northern (KY)

Hybrid
USD 120,000 - 180,000