Our vision is to transform how the world uses information to enrich life for all.
Job Roles & Responsibilities
- Design and implement scalable, reliable data architectures on Google Cloud Platform (GCP).
- Define data models, warehouse structures, and data lake strategies using BigQuery and GCS.
- Establish best practices for schema design, partitioning, and clustering for performance optimization.
- Very Strong Experience in Python, SQL, PySpark.
- Build and maintain end-to-end ETL/ELT pipelines using GCP services such as: BigQuery, WorkFlow, Dataproc, Cloud Run , Cloud Functions, Pub/Sub, Cloud Composer.
- Develop batch and real-time data processing pipelines.
- Implement CI/CD pipelines for data workflows using Cloud Build / Terraform.
- Ensure high performance, reliability, and fault tolerance in pipelines.
- Design and execute data migration strategies from on-prem / legacy systems to GCP.
- Integrate multiple data sources (structured, semi-structured, unstructured).
- Handle large-scale data ingestion using streaming and batch approaches.
- Implement data validation, monitoring, and quality checks.
- Ensure adherence to data governance, security, and compliance policies.
- Build frameworks for data lineage and observability - Cloud Monitoring / Logging and BigQuery audit logs.
- Optimize BigQuery queries, storage costs, and pipeline performance, Tune Spark/PySpark jobs in Dataproc environments.
- Implement query optimization and cost-efficient designs.
- Work closely with: Data Scientists, Data Analysts, Product & Business teams
- Translate business requirements into scalable technical solutions
Nice To Have
- Exposure to AI/ML data pipelines (Vertex AI / ADK).
- Experience with streaming frameworks (Kafka, Pub/Sub).
- Strong understanding of data warehousing concepts.
All qualified applicants will receive consideration for employment without regard to race, color, religion, sex, sexual orientation, gender identity, national origin, veteran or disability status.