Responsibilities
- Design and implement data models, schemas, and ontologies for chemical, biological, and automation-generated data.
- Define/maintain controlled vocabularies, metadata standards, and FAIR-compliant frameworks.
- Implement semantic standards (RDF, OWL, SPARQL) and ontology engineering for interoperable, machine-readable data.
- Design and implement lakehouse architecture (Databricks, Snowflake, or equivalent), including storage patterns, partitioning, and query optimization.
- Build/optimize ETL/ELT pipelines (Spark, dbt, or similar) to produce analytical and ML-ready data.
- Implement real-time/streaming integration (Kafka, Kinesis, event-driven patterns) connecting LIMS, instruments, and lab automation.
- Build knowledge graphs (Neo4j, Amazon Neptune, TigerGraph) capturing molecular/target/pathway/experimental relationships.
- Architect specialized systems (TileDB arrays, MongoDB document stores, vector DBs for ML/RAG) and enable cross-data querying/traversal.
- Partner with scientific software engineers, Methods4Insight, and Tech@Lilly; support build-vs-buy decisions.
Required Qualifications
- M.S. or PhD in CS, Data Science, Bioinformatics, Computational Biology, Information Science, or related STEM.
- Data architecture/engineering/scientific informatics: MS 6+ years; PhD 2+ years.
- Deep expertise in one focus area: data modeling/ontologies, lakehouse/data platform (Databricks/Snowflake/Spark), or knowledge graphs/specialized DBs (Neo4j/Neptune/MongoDB/TileDB).