QA Engineer (AI)

Apptad Inc

Frisco (TX)

On-site

USD 120,000 - 180,000

Full time

10 days ago
Application generator

Stand out for this role — generate a tailored resume and cover letter in about a minute.

Get past ATS filters

Job summary

Apptad Inc. is seeking an AI test engineer to design and execute test plans for AI/ML features, including model outputs, prompts, and integrated app behavior.

You will build automated test suites for functional, regression, integration, and API testing, and collaborate with data scientists to define acceptance criteria and quality metrics. You will evaluate model outputs for accuracy, bias, and edge cases, develop evaluation datasets, and perform adversarial testing to surface safety and

Qualifications

  • Experience testing LLM/GenAI products and evaluating non-deterministic outputs.
  • Strong Python skills for writing eval scripts and data validation.
  • Proficiency with SQL and data quality validation techniques.
  • Familiarity with AI evaluation frameworks and model safety testing.
  • Experience in building automated test suites and CI/CD integration.

Responsibilities

  • Design and execute test plans for AI/ML features and model outputs.
  • Build automated test suites for functional, regression, API testing.
  • Evaluate model outputs for accuracy, bias, and edge cases.
  • Develop evaluation datasets and scoring rubrics for benchmarks.
  • Perform adversarial testing to surface safety and robustness issues.
  • Validate data pipelines feeding AI models and collaborate with ML teams.
  • Test latency, scalability, and reliability of AI services under load.
  • Contribute to CI/CD pipelines with model-evaluation tests.

Skills

LLM/GenAI testing
Python
AI evaluation frameworks
SQL
Test automation

Tools

LangSmith
Promptfoo
OpenAI Evals
TruLens

Job description

Job Description

Design and execute test plans for AI/ML-driven features, including model outputs, prompts, and integrated application behavior

Build and maintain automated test suites covering functional, regression, integration, and API testing

Evaluate model outputs for accuracy, consistency, bias, hallucination, and edge-case failures

Develop evaluation frameworks and golden datasets/test cases to benchmark model performance over time

Test prompt engineering changes, model version upgrades, and fine-tuning outputs for regressions

Perform adversarial and red-team style testing to surface safety, security, and robustness issues

Validate data pipelines feeding into AI models (data quality, schema, drift detection)

Collaborate with data scientists/ML engineers to define acceptance criteria and quality metrics for models

Test latency, scalability, and reliability of AI services under load

Contribute to CI/CD pipelines, integrating automated and model-evaluation tests

Hands-on experience testing LLM-based products (chatbots, copilots, RAG systems, AI agents) - designing test cases for non-deterministic, generative outputs

Practical experience with AI/LLM evaluation frameworks (e.g., Ragas, DeepEval, LangSmith, Promptfoo, OpenAI Evals, TruLens) - building eval suites, scoring rubrics, and golden datasets

Working knowledge of eval metrics for generative AI: hallucination rate, faithfulness/groundedness, relevance, answer correctness, toxicity/bias scoring, BLEU/ROUGE/semantic similarity where applicable

Experience with prompt regression testing - validating prompt changes and model/version upgrades against baseline eval sets

Strong proficiency in Python for writing eval scripts, test harnesses, and data validation logic

Familiarity with SQL and data validation techniques

The environment is primarily Microsoft Azure-based, with Snowflake also playing a key role. Their GenAI initiatives largely leverage OpenAI and Claude models.

Must have skills:

LLM/GenAI product testing

Python expertise

AI evaluation frameworks

SQL

Test automation

Get your free, confidential resume review.

or drag and drop your file here.

Similar jobs

Similar jobs worth comparing

1. AI - QA & Prompt Analyst
1. AI - QA & Prompt Analyst

Trinityaiboston • Boston (MA)

Hybrid
USD 110,000 - 150,000
AI Engineer
AI Engineer

Falcon Smart IT (FalconSmartIT) • Los Angeles (CA)

On-site
USD 190,000 - 260,000
AI Engineer
AI Engineer

Asterism IT Solutions • Illinois

On-site
USD 140,000 - 170,000
Application Engineer Senior (7+ Years)
Application Engineer Senior (7+ Years)

Digipulse Technologies, Inc • United States

Remote
USD 120,000 - 170,000
AI Agentic Tester
AI Agentic Tester

Delan Associates, Inc • Denver (CO)

On-site
USD 90,000 - 120,000
GenAI/LLM Test Engineer
GenAI/LLM Test Engineer

BrickRed Systems LLC • Bellevue (WA)

On-site
USD 120,000 - 160,000
AI Agentic Tester
AI Agentic Tester

Delan Associates, Inc • St. Louis (MO)

On-site
USD 90,000 - 130,000
QA Engineer, LLM & GenAI Testing
QA Engineer, LLM & GenAI Testing

Apptad Inc • Frisco (TX)

On-site
USD 120,000 - 180,000
QA Engineer
QA Engineer

WebSenor Ltd • United States

On-site
USD 70,000 - 110,000
AI Software Test Engineer
AI Software Test Engineer

Spectraforce Technologies • Ann Arbor (MI)

On-site
USD 90,000 - 130,000