Director Analytics Infrastructure, Pipeline Operations
Novartis
Key Responsibilities:
- Design and implement intelligent, self-healing data pipelines using AI/ML for automated data quality monitoring, anomaly detection, and remediation.
- Build and maintain centralized feature stores for feature reusability across models and use cases.
- Create curated data repositories for data science/AI workflows (training datasets, evaluation datasets, and production serving layers).
- Develop automated feature engineering pipelines that transform raw data into analytics-ready features with lineage tracking.
- Partner with Enterprise IT to optimize analytics platform architecture for high-performance ML workloads.
- Build automated pipelines integrating diverse data sources (sales, CRM, patient claims, real-world evidence, and unstructured data).
- Create self-service data access layers for independent querying/extraction by data scientists and analysts.
- Establish SLAs for data availability, freshness, and quality; implement monitoring and observability.
Essential Requirements:
- Advanced degree in Computer Science, Data Engineering, or related field.
- 10+ yearsβ experience in data engineering, ML/AI engineering, or analytics infrastructure.
- 5+ years leading teams building enterprise-scale data platforms and feature stores.
- Expert knowledge of feature store technologies (Feast, Tecton, SageMaker Feature Store, Databricks Feature Store).
- Deep expertise in modern data platforms for ML workloads (Databricks, Auto ML, Snowflake, BigQuery).
- Strong proficiency in Python, SQL, Spark/PySpark.
- Experience with orchestration tools (Airflow, Prefect, dbt) and CI/CD for data pipelines.
- Understanding of data governance, privacy (HIPAA, GDPR), and life sciences compliance.