Data Engineer - Pharma R&D

Roche Holding AG

Hyderabad

On-site

INR 1,800,000 - 3,200,000

Full time

4 days ago
Be an early applicant

Get more replies from employers

Send a job-specific resume in minutes.

Job summary

Roche Holding AG, acteur majeur de la santé, recherche un Data Engineer – Clinical Study Design à Hyderabad pour concevoir et opérer les flux de données dédiés à la conception d’études cliniques via Study Designer. Vous transformez des données cliniques en pipelines fiables et évolutifs, consolidant les couches relationnelles et les graphes pour livrer insights et soutiens à la conception d’études.

Le candidat idéal possède des compétences en ingénierie de données, en données cliniques et une

Qualifications

  • Diplôme Bachelor en informatique, ingénierie des données ou domaine connexe.
  • 5–8 ans d'expérience dans des plateformes de données de production et pipelines.
  • Expérience avec des graphes biomédicaux (reliant drugs → targets → diseases → trials).
  • Connaissance de PubMed/MEDLINE, ClinicalTrials.gov API ou EMA/CTIS.
  • Apache Spark ou Databricks pour traitement par lots de grands documents.

Responsibilities

  • Concevoir des pipelines d’ingestion pour protocoles cliniques, ICF et publications.
  • Concevoir des modèles de données dans Amazon Aurora et GraphDB pour les entités d’essais.
  • Développer des pipelines d’embeddings et vectorisation pour le RAG.
  • Construire et maintenir des flux ETL/ELT pour des données cliniques.
  • Valider la qualité des données (extraction, co-référencement).
  • Fournir des API de données avec Python/FastAPI pour le frontend et LangGraph.
  • Mettre en place la traçabilité et l’audit des recommandations d’essais.

Skills

Python
SQL
Graph databases
AWS
NLP
FastAPI
AI/ML data
ETL/ELT

Education

Bachelor's degree in Computer Science or related

Tools

Amazon Aurora
GraphDB
Neptune/Neo4j
PubMed/MedLINE API
ClinicalTrials.gov API
Spark/Databricks
OpenSearch/pgvector/Pinecone
Terraform

Job description

Chez Roche, vous pouvez être vous-même et être apprécié pour les qualités uniques que vous apportez. Notre culture encourage l'expression personnelle, le dialogue ouvert et les connexions authentiques, où vous êtes valorisé, accepté et respecté pour ce que vous êtes, vous permettant de prospérer tant personnellement que professionnellement. Voici comment nous visons à prévenir, arrêter et guérir les maladies et à garantir à chacun l'accès aux soins de santé aujourd'hui et pour les générations à venir. Rejoignez Roche, où chaque voix compte.

La position

Job Description:

The Data Engineer – Clinical Study Design sits at the intersection of data architecture, clinical science, and technology delivery, helping build the data foundation behind Study Designer, a digital product transforming how studies are designed. This role combines strong data engineering skills, an understanding of clinical study data and workflows, and technical curiosity to translate complex clinical data structures into reliable, scalable pipelines and models that power the platform's insights. The ideal candidate is curious, collaborative, AI-minded, and passionate about using data to enable smarter, faster, and more effective clinical study design.

Key Responsibilities
  • Build ingestion pipelines for clinical trial protocols, ICF documents, SmPCs, CSRs, and published articles (PubMed, CTIS, ClinicalTrials.gov) - handling PDF parsing, text extraction, and structured data normalization

  • Design and implement data models in Amazon Aurora (relational) and GraphDB (knowledge graph) to represent trial design entities: endpoints, eligibility criteria, study arms, interventions, therapeutic areas, and their relationships

  • Develop embedding and vectorization pipelines to prepare extracted clinical text for RAG-based retrieval in LangGraph agentic workflows - chunking strategies, metadata enrichment, and vector store population

  • Build and maintain ETL/ELT workflows that transform unstructured clinical content into queryable, linked data across both relational and graph stores

  • Implement data quality validation specific to clinical data - protocol section classification accuracy, entity extraction completeness, cross-reference integrity (NCT IDs, EudraCT numbers, MeSH terms)

  • Build data serving APIs (Python/FastAPI) that expose curated datasets to the Angular frontend and LangGraph agent layer

  • Set up data lineage tracking and audit trails to support regulatory traceability of AI-generated trial design recommendations

Preferred Qualifications:

  • Education: Bachelor's degree in Computer Science, Data Engineering, or a related discipline.

  • 5-8 years of experience building production grade data platforms and pipelines.

  • Experience with biomedical knowledge graphs (e.g., linking drugs -> targets -> diseases -> trials)

  • Prior work with PubMed/MEDLINE data, ClinicalTrials.gov API, or EMA/CTIS data

  • Apache Spark or Databricks for batch processing of large document

Required Skills

  • Python — Primary language; experience with PDF/document parsing libraries (PyMuPDF, pdfplumber, unstructured.io, or similar)

  • SQL — Advanced PostgreSQL-compatible SQL (Aurora); schema design, migrations, query optimization, indexing strategies for clinical data volumes

  • Graph Databases — Hands‑on with Neptune, Neo4j, or similar; SPARQL or Cypher query language; ontology/knowledge graph modeling for biomedical entities

  • AWS — Aurora (PostgreSQL), S3, Lambda, Step Functions, SQS/SNS, IAM; infrastructure for data pipeline orchestration

  • NLP / Document Processing — Text extraction from PDFs, section classification, named entity recognition for clinical/biomedical text; familiarity with embedding models and vector stores (OpenSearch, pgvector, or Pinecone)

  • FastAPI — Building data serving endpoints; async patterns; integration with the application backend

  • AI/ML Data Infrastructure — Preparing data for LangChain/LangGraph consumption; RAG pipeline design (chunking, retrieval, reranking); prompt-data integration patterns

  • Pipeline Orchestration — Experience with workflow orchestration tools (Airflow, Prefect, Step Functions, or Temporal); designing DAGs for multi‑stage data pipelines with dependency management, retry logic, and monitoring

  • CI/CD & IaC — Terraform or CDK, Docker, Git; automated pipeline testing and deployment on AWS

#Hyderabad2026

Qui nous sommes

Un avenir plus sain nous pousse à innover. Ensemble, plus de 100 000 employés à travers le monde sont dédiés à faire progresser la science et à garantir à chacun l'accès aux soins de santé aujourd'hui et pour les générations à venir. Nos efforts aboutissent à plus de 26 millions de personnes traitées avec nos médicaments et plus de 30 milliards de tests réalisés avec nos produits de Diagnostique. Nous nous encourageons mutuellement à explorer de nouvelles possibilités, à favoriser la créativité et à conserver nos grandes ambitions, afin de fournir des solutions de santé qui changent des vies et ont un impact mondial.

Construisons ensemble un avenir plus sain.

Roche est un employeur offrant l'équité en matière d'emploi.

Get your free, confidential resume review.
or drag and drop your file here.
Similar jobs

Similar jobs worth comparing

Data Scientist f Submission Data and Content Generation & Reuse (AIDCG) - Pharma R&D
Data Scientist f Submission Data and Content Generation & Reuse (AIDCG) - Pharma R&D

Roche Holding AG • Hyderabad

On-site
INR 2,500,000 - 4,000,000
Senior Analyst (Data Strategy & Acquisition)
Senior Analyst (Data Strategy & Acquisition)

Roche Holding AG • Hyderabad

On-site
INR 1,800,000 - 3,200,000
Head of Forward-Deployed Data Engineering, India Center
Head of Forward-Deployed Data Engineering, India Center

Roche Holding AG • Hyderabad

On-site
INR 4,000,000 - 8,000,000
IT Software Engineer - RDT Digital Operations and Reliability
IT Software Engineer - RDT Digital Operations and Reliability

Roche Holding AG • Hyderabad

On-site
INR 1,800,000 - 2,600,000
Head - AI & Digital Solutions
Head - AI & Digital Solutions

Roche Holding AG • New Delhi

On-site
INR 3,500,000 - 6,500,000
Data & Insights Enablement - Lead Analyst
Data & Insights Enablement - Lead Analyst

Roche Holding AG • Hyderabad

On-site
INR 2,600,000 - 4,200,000
UX/UI Engineer Study Designer - RDT Biometrics and Clinical Evidence
UX/UI Engineer Study Designer - RDT Biometrics and Clinical Evidence

Roche Holding AG • Hyderabad

On-site
INR 1,800,000 - 2,800,000
IT Software Engineering Expert - RDT Digital Operations and Reliability
IT Software Engineering Expert - RDT Digital Operations and Reliability

Roche Holding AG • Hyderabad

On-site
INR 1,200,000 - 1,800,000
Data Engineer - Pharma R&D
Data Engineer - Pharma R&D

F. Hoffmann-La Roche AG • Hyderabad

On-site
INR 1,400,000 - 2,200,000
Head of RDT Pharma Medicines, Data & AI Center of Excellence, India Center
Head of RDT Pharma Medicines, Data & AI Center of Excellence, India Center

Roche Holding AG • Hyderabad

On-site
INR 6,000,000 - 9,000,000