Consultant en data scientifique et docteur en chimie, avec plus de 15 ans d'expérience en R&D scientifique et une solide expérience de conduite de projets. J'interviens à l'interface entre les équipes métiers/scientifiques et data/IT pour cadrer des besoins complexes, les traduire en solutions concrètes et accompagner leur mise en oeuvre. Mon activité actuelle combine intégration et harmonisation de données hétérogènes, construction d’un Knowledge Graph à grande échelle et développement de pipelines data. Autonome et force de proposition, j’aime faire le lien entre les besoins métier et les contraintes techniques.
Co-pilote la construction d’un Knowledge Graph Neo4j à l'échelle du milliard, en lien avec les équipes scientifiques, data et IT. Travaille avec des utilisateurs métier, responsables de projets et équipes data sur 5 projets thérapeutiques afin de cadrer les besoins de recherche et de les traduire en solutions data concrètes. Développe 20+ pipelines Python/Kedro sur GCP pour ingérer, transformer et enrichir des données provenant de 10+ sources scientifiques, dont UniProt, Open Targets, ChEMBL, DrugBank et BindingDB. Standardise et harmonise les données de composés, cibles et bio-activités issues de 10+ sources scientifiques, en définissant des règles de qualité, de validation et d’uniformisation afin de produire des données cohérentes et directement exploitables. Maintient la qualité du code sur 20+ pipelines Python/Kedro grâce aux tests unitaires et aux contrôles CI obligatoires via GitHub Actions avant merging. Utilise Gemini CLI pour l'assistance au développement et au refactoring, ainsi que pour traduire des demandes en langage naturel en requêtes Cypher. Applique le clustering et la réduction de dimension (UMAP, t-SNE) à des empreintes moléculaires afin d'explorer l'espace chimique et la similarité entre composés (RDKit). A permis l'exploration intégrée de données de chimie et de biologie ayant contribué à l'identification d'un tool compound pour un programme de criblage phénotypique.
A contribué à des analyses multi-omiques intégrant 450 profils métabolomiques et 2 000 génomes microbiens annotés. A codéveloppé un modèle de classification (Random Forest) à partir de données multi-omiques afin de prédire le phénotype de souches microbiennes. A développé 5 pipelines analytiques automatisés avec Azure et Databricks, améliorant la reproductibilité et la mise à l'échelle des analyses biologiques. A assuré l'interface entre équipes scientifiques et data sur 2 projets de recherche translationnelle, en traduisant les questions biologiques en besoins analytiques et en facilitant le dialogue entre microbiologistes, bioinformaticiens, data scientists et data architects.
A réalisé 6 essais applicatifs clients dans le cadre de réponses à des appels d'offres. A assuré la formation, le conseil technique et le support pour la mise en œuvre de méthodes analytiques.
A piloté 10+ programmes de recherche en métabolomique LC-HRMS, de la conception expérimentale à l'analyse des données, leur interprétation et la restitution de rapports scientifiques. A mis en œuvre des workflows d'analyse statistique et métabolomique avec R et W4M. A géré les activités du laboratoire, supervisé 1 technicien et encadré 5 stagiaires de master et 1 doctorant.
A piloté 15 projets clients en métabolomique et lipidomique pour des partenaires industriels et académiques, en coordonnant la conception expérimentale, les workflows LC-HRMS et la livraison de résultats scientifiques exploitables. A identifié et caractérisé la structure de 100+ biomarqueurs potentiels (métabolites, lipides et peptides).
Led 15 metabolomics and lipidomics projects for pharmaceutical companies and academic partners, including experimental design and LC-HRMS testing Processed, analyzed and interpreted scientific data, delivering project results to clients and partners Identified and structurally characterized approximately 100 potential biomarkers, including metabolites, lipids and peptides Contributed to business development through commercial prospecting and B2B trade shows