Ingénieur Data très motivé et orienté vers les résultats, avec plus de 7 ans d’expérience dans la conception, la construction et la maintenance de solutions de données robustes et évolutives. Capacité avérée à concrétiser les besoins de l’entreprise en informations exploitables sur les données. Expertise dans l’ingestion, la transformation et la livraison de données à travers diverses structures de données.
• Conception et déploiement d’une architecture Data Lakehouse sur AWS reposant sur Kubernetes via EKS et sur Docker, permettant le traitement quotidien de millions d’événements comportementaux issus de Piano Analytics tout en garantissant une haute disponibilité et une scalabilité horizontale des services analytique. • Industrialisation de pipelines ELT et ETL haute performance développés en PySpark sur AWS Glue et en Python, accompagnée de l’unification de sources de données hétérogènes telles qu’Auth0 pour la gestion des identités, Actito pour le marketing, GLI pour les paiements ainsi que les APIs Google et Apple, afin de constituer une source de vérité unique dédiée au pilotage du business. • Direction technique de la migration stratégique des workloads depuis Google Cloud incluant BigQuery et Dataflow vers une stack cible basée sur AWS et Snowflake, avec une analyse approfondie des flux existants et un re-design complet des architectures visant l’optimisation des performances de traitement et la réduction des coûts d’infrastructure selon une approche FinOps. • Mise en place d’une culture DataOps reposant sur l’automatisation complète du provisionnement des ressources cloud via Terraform incluant la gestion du VPC, des sous-réseaux et des règles de sécurité ainsi que le déploiement de services tels que S3, IAM , SSM, RDS, Lambda, Athena, AWS Glue et les composants réseau associés, combinée à la sécurisation du cycle de livraison à l’aide de GitLab CI/CD intégrant des tests unitaires, la validation automatique des schémas et le packaging conteneurisé afin de garantir des déploiements fiables et sans régression. • Développement de modèles de données analytiques permettant une meilleure segmentation et gestion du churn et Industrialisation de la plateforme en production, avec gestion du cycle de vie complet des pipelines, monitoring, alerting et optimisation des performances. • Garantie de l’excellence opérationnelle de la plateforme par un monitoring proactif reposant sur Datadog et CloudWatch, une gestion rigoureuse de la qualité des données, la rédaction de documentations techniques de référence sur Confluence incluant workflows, décisions d’architecture et analyses de causes racines RCA, ainsi que la mise en conformité des traitements avec les exigences de gouvernance et du RGPD. • Structuration de l’entrepôt de données Snowflake à travers la mise en œuvre de schémas en étoile et en flocon et le développement de modèles analytiques avancés dédiés au suivi de l’engagement client et à la prédiction du churn, en collaboration étroite avec les équipes métiers pour transformer les besoins marketing en indicateurs de performance exploitables. • mise en place de workflows automatisés et déploiements via GitLab CI/CD, intégrant tests unitaires, packaging Docker et déploiement sur différents environnements (dev, QA, prod) • Pilotage et gestion de la production des plateformes data incluant le suivi des traitements batch , la gestion des incidents et des astreintes, l’analyse et la résolution des incidents de production, l’amélioration continue de la stabilité des pipelines ainsi que la coordination avec les équipes techniques et métiers afin d’assurer la continuité de service et le respect des engagements opérationnels. Environnement technique : AWS Glue, PySpark, Terraform, SQL, Python, Amazon S3, AWS Lambda, Amazon RDS, Amazon SSM, Amazon Step Functions, Amazon Athena, Amazon Elastic Kubernetes, Docker, Gitlab CI, Linux, Snowflake, Git, Jira
Senior Data Engineer intervenant comme référent Data au sein de l’équipe Libé Data Team, j’ai piloté la conception et l’industrialisation de la plateforme data du journal Libération, en définissant les architectures Lakehouse, les standards d’ingestion et de modélisation, ainsi que les pratiques DataOps garantissant scalabilité, fiabilité et performance. Environnement technique : AWS Glue PySpark Terraform SQL Python Amazon S3 AWS Lambda Amazon RDS Amazon SSM Amazon Step Functions Amazon Athena Amazon Elastic Kubernetes Docker Gitlab CI Linux Snowflake Git Jira
• Développement et maintenance d’une application Pricing Engine, un framework Python - Pyspark - SQL, utilisé pour ingérer des données provenant de différents systèmes (List Price & Standard Discount) comme Salesforce, CPQ et SAP au niveau des données brutes. Il a utilisé les solutions globales de l’entreprise telles que le cadre UDL pour élargir et accélérer l’ingestion de multiples sources de données nécessaires au développement de produits de données. • Orchestration de pipelines via Lambda (Java) ou jobs planifiés , Manipulation de RDD, DataFrame, Dataset (Java API) et Développement de pipelines de données en Pyspark (ETL/ELT) • Pilote le cycle de vie complet du développement de produits de données, de la collecte des besoins au déploiement. Collaboration avec les Business Analysts pour comprendre les besoins de l’entreprise et les traduire en solutions techniques avec les architectes de données. • Développement et maintenance de pipelines de données robustes utilisant Python , Pyspark, Informatica et les services AWS (EC2 , S3, EMR, DynamoDB, Lambda , Redshift ...) et les technologies Big Data (Apache Spark , Kafka ..) pour ingérer (Batch , Streaming), transformer et charger de grands volumes de données provenant de diverses sources dans un entrepôt de données PriceFX • Maintien du pipeline CI/CD pour faciliter l’intégration et la livraison continues des produits de données, y compris les tests automatisés, l’analyse de la compatibilité du code et le déploiement dans les environnements de production pour le Pricing Engine. • Fourniture d’un support technique de niveau 3 pour l’environnement de données de Pricing & Quotation, en réglant les problèmes complexes, en diagnostiquant les pannes et en rectifiant les erreurs. • Présentation de rapports mensuels à l’équipe CAB, détaillant tous les changements apportés à la plateforme, y compris les améliorations de la sécurité et les optimisations des performances, afin de garantir la sécurité permanente du système et la conformité avec les meilleures pratiques. • Mise en œuvre de processus ETL et ELT à l’aide du Informatica et d’IICS afin d’automatiser l’intégration des données et d’en garantir la qualité. • construction et optimisation de modèles de données à des fins d’analyse, en utilisant AWS Redshift comme principal entrepôt de données. • Développement et gestion de l’infrastructure (Clusters , Workloads) AWS avec Terraform (S3, IAM, VPC, EC2, RDS, Lambda ..). • Mise en œuvre de politiques et de procédures de gouvernance des données pour maintenir l’intégrité et la cohérence des données à l’aide de Collibra DIP. • Développement du cycle de vie complet des API, de la collecte des besoins au déploiement de la production, Collaboration avec des développeurs tiers pour assurer l’intégration transparente des API dans leurs applications. • Mise à jour et documentation de tous les nouveaux changements, développements et problèmes critiques. Contribution à la base de connaissances en créant des pages Confluence détaillant la résolution des problèmes, y compris l’analyse des causes profondes RCA , les artefacts de changement, les revues de code, les solutions et les conseils sur les meilleures pratiques. • Intégration de tests automatisés dans les workflows de données : tests unitaires sur les scripts Python/SQL, tests de validation de schéma, qualité et fraîcheur des données. • Déploiement de workflows reproductibles avec versioning de code, environnement et données, facilitant l’auditabilité et le rollback. • Animation des comités CAB mensuels : synthèse des changements, suivi des risques, validation des mises en production et conformité sécurité. • Mise en place de logs structurés, tableaux de bord, métriques de performance et alertes automatisées. • Optimisation continue : tuning des traitements, réduction des incidents, fiabilisation des SLA/KPI production. • Contribution à la mise en place de règles de gouvernance (qualité, métadonnées, nomenclature, lifecycle des données). Environnement technique : Amazon Redshift, Amazon EC2, Informatica, IICS, Apache Kafka, Terraform, SQL, Python, Java, Amazon S3, Amazon EMR, Amazon Athena, DynamoDB, CodeCommit, Scripting Shell, Linux, Ansible, Git, Jira, Confluence, Collibra, Tableau, Servicenow
En tant que Data Engineer au sein de l’équipe Global Pricing and Quotation Devops, j’ai activement contribué à la conception, au développement et au déploiement de produits de données sur la Data Plateform Inteldatastore. Environnement technique : Amazon Redshift Amazon EC2 Informatica IICS Apache Kafka Terraform SQL Python Java Amazon S3 Amazon EMR Amazon Athena DynamoDB CodeCommit Scripting Shell Linux Ansible Git Jira Confluence Collibra Tableau Servicenow
• Développement et mise en œuvre de règles de transformation et de contrôle des données à l’aide d’Alteryx, garantissant l’intégrité et la cohérence des données. • Soutien et suivi des initiatives POC au sein du Digital Lab et de la Data Platform. • Conception et mise en œuvre de flux de travail Alteryx pour intégrer de manière transparente des données provenant des systèmes SAP et Salesforce et les ingérer dans Azure Blob Storage et Azure Synapse. • Orchestration de workflows PySpark via Azure Data Factory avec gestion des dépendances, reprise sur erreur et monitoring des performances via Databricks Jobs API • Utilisation de scripts Python pour extraire du texte de diverses sources et maintenir des normes élevées de qualité des données. • Centralisation des données entre Dremio et Azure SQL via Jobs PySpark customisés avec optimisation des lectures/écritures et gestion des schémas évolutifs • Construction et déploiement des modèles ML POC en utilisant Azure Databricks et Dataiku pour obtenir des informations basées sur les données. • Création de tableaux de bord et de rapports visuellement captivants à l’aide de Power BI et de Tableau afin de communiquer efficacement les données aux parties prenantes. • Développement de modèles ML POC avec PySpark MLlib sur Azure Databricks pour le clustering client, la prédiction de churn et la classification textuelle. Environnement technique : Apache Spark, Hadoop, Azure Blob Storage, Snowflake, Azure SQL, Azure Databricks, Azure Data Factory, Alteryx, Python, Dremio, Tableau, Power BI, Docker, Git, Jira, Confluence, Veracode, Servicenow
J’ai intégré le département informatique de PwC en tant qu’ingénieur en données et j’apporte ma contribution au Digital Lab et à l’équipe chargée de la plateforme de données. Environnement technique : Apache Spark Hadoop Azure Blob Storage Snowflake Azure SQL Azure Databricks Azure Data Factory Alteryx Python Dremio Tableau Power BI Docker Git Jira Confluence Veracode Servicenow
• Développement d’un module personnalisé de gestion de la construction utilisant Odoo, Django et Python, améliorant la visibilité et l’efficacité des projets. • Création et mise à jour d’indicateurs de performance liés à l’avancement du projet, à la gestion des stocks et à la performance en matière de coûts (JCS vs. EP) à l’aide de Tableau et de SQL. • Conception, modélisation et optimisation de schémas analytiques dans BigQuery, en appliquant les bonnes pratiques (partitionnement, clustering, optimisation des coûts), afin d’améliorer les performances des requêtes analytiques et la scalabilité des analyses. • Mise en œuvre de pipelines de traitement de données sur GCP, en exploitant Dataflow pour le traitement batch et/ou streaming, permettant l’ingestion, la transformation et le chargement des données vers BigQuery. • Réalisation d’une analyse des causes profondes et mise en œuvre de mesures correctives pour les incidents de production, en faisant preuve de solides compétences en matière d’analyse et de résolution de problèmes. • Développement et mise en œuvre d’un protocole d’échange de données entre SAP et CEGID ORLI, en utilisant Talend et Python pour les scripts et en assurant un flux de données et une intégration transparents. • Développement de pipelines de données en Java (ETL/ELT) • Implémentation de logique métier complexe en Java dans des jobs Talend • Création de routines Java personnalisées (validation, transformation, enrichissement). Environnement technique : Talend, Java, SQL Server, Tableau, Python, Git, Excel, BigQuery, Data Warehousing, Jira, Confluence, easyvista, Dataflow
En tant que Développeur Business Intelligence chez Timsoft, j’ai été un membre clé de l’équipe Data, intervenant sur la conception, le développement et le déploiement de solutions BI et Data Analytics. Environnement technique : Talend Java SQL Server Tableau Python Git Excel BigQuery Data Warehousing Jira Confluence easyvista Dataflow