Johnson & Johnson logo

Principal Scientist, Data Science (Data Products, Integration & Analysis)

Johnson & Johnson
August 13, 2026
Remote friendly (Cambridge, MA)
United States
IT
Position Summary
- Lead design, implementation, and evolution of scientific data products and integration strategies supporting AI-enabled drug discovery and development.
- Create scalable, interoperable, AI-ready data products connecting discovery, preclinical, clinical, safety, and real-world evidence; enable validated-biomarker data assets.
- Establish data architecture, integration strategy, metadata framework, and productization approach for semantic reasoning, knowledge graphs, GraphRAG, advanced analytics, and agentic AI.
- Partner with scientific stakeholders, knowledge architects, AI engineers, and platform teams to define the future-state scientific data ecosystem and deliver high-quality products.

Mission
- Build and operationalize AI-ready scientific data products for seamless integration, harmonization, and reuse across the drug discovery/development lifecycle.

Key Responsibilities
- Define and execute data product strategy across discovery, translational science, preclinical safety, clinical development, pharmacovigilance, and real-world evidence.
- Design data integration/harmonization (SEND, SDTM, ADaM, MedDRA, imaging, omics, biomarkers, pathology, real-world data).
- Lead AWS deployment strategy; deliver scalable pipelines/products; ensure security/governance/AI-readiness alignment.
- Develop curated datasets, semantic-ready products, feature stores, metadata products, scientific data services, and AI-ready assets.
- Define metadata standards and quality frameworks; implement lineage/provenance/traceability and FAIR principles; monitor quality controls.
- Build predictive AI/ML models for translational safety decision making.

Required Qualifications
- Master’s or PhD in CS, Data Engineering, Bioinformatics, Biomedical Informatics, Information Systems, Computational Biology, or related discipline.
- 5+ years experience in scientific data engineering/architecture/products or life sciences informatics; enterprise-scale product delivery.
- Experience in drug discovery/development/clinical research/pharmacovigilance and building predictive models in these domains.

Technical Expertise
- Data architecture, modeling, product design, cloud-native platforms, metadata management, data governance, predictive model development.
- AWS platforms; data lakes/lakehouses; distributed processing; APIs/data services; data cataloging/lineage solutions.
- Familiarity with SEND/SDTM/ADaM/MedDRA.

Preferred Qualifications/Skills
- Knowledge graphs/semantic architectures/GraphRAG; AI-ready products and feature stores; ontology-driven integration; experience with cloud/external platform teams; regulated scientific environments.
- Preferred familiarity: FHIR, OMOP, DICOM, biomarker/omics standards.
- Preferred skills: Advanced Analytics, Critical Thinking, Data Analysis, Data Quality, Data Science, Data Visualization, Digital Fluency, Process Improvements, Strategic Thinking, Workflow Analysis.

Benefits (time off)
- Vacation: 120 hours/year; Sick: 40 hours/year (CO 48; WA 56); Holiday incl. Floating Holidays: 13 days/year; Work/Personal/Family Time: up to 40 hours/year; Parental Leave: 480 hours; Bereavement: 240 hours (immediate)/40 hours extended family; Caregiver Leave: 80 hours (52-week rolling period); Volunteer Leave: 32 hours/year; Military Spouse Time-Off: 80 hours/year.