Data & Cloud Engineer with over 20 years of experience in architecture, data platform design, and data pipeline orchestration. Certified in GCP and AWS, with strong skills in big data technologies such as Spark, Hadoop, and Kafka. Experienced in DevOps practices and cloud solutions.
« Move to the cloud » : Mise en place d’une data Platform AWS RedShift et migration de l’ERP (mysql) et le cube (sql server) vers redshift. • Mise en place d’une nouvelle pipeline CI/CD décidée pour la data Platform • Conception et modélisation du Datawarehouse sous AWS RedShift. • Mise en place de l’architecture technique de la solution en trois couches : Medallion Architecture • Rédaction des spécifications techniques des besoins logiciels et des modes opératoires • Mise en place du pipeline data airflow: collecte, normalisation, qualité des données et alimentation du data warehouse sous RedShift • Audit et Monitoring la solution avec datadog • Mise en place d’une couche audit & qualité de données • Modélisation / Création des couches sémantiques sous PowerBI • Mise en place de tableau de bord (powerbi) pour l’audit de la qualité des données • Mise en place du data pipeline : Airflow • Intégration des données (évènements sur les contrats d’assurances en temps réel) basé sur Kafka. Environnement technique : Cloud: AWS (S3, RedShift, EMR, Lambda, AWS Glue) Langages : Batch, pyspark (apache spark), python Autres: DBT, Airflow, AWS Glue, datadog, Kafka
PROJET 1 : « Solutions DATA dans le cloud AWS » : Mise en place d’un DWH dans le cloud GCP avec BigQuery. • Conception et modélisation du Datawarehouse sous BiqQuery. • Mise en place de l’architecture technique de la solution en trois couches : Medallion Architecture • Optimisation des coûts : Traitement et stockage • Rédaction des spécifications techniques des besoins logiciels et des modes opératoires • Mise en place du pipeline data (spark, airflow): collecte, normalisation, qualité des données et alimentation du datawarehouse sous BiqQuery PROJET 2 : « RUFUS » : Refonte du référentiel FTTH (fibre optique) et mise en place d’un nouveau référentiel unique des PTO (Point de Terminaison Optique) avec PostgreSQL comme SGBDR cible. • Analyse et Conception du modèle de données du Référentiel (MCD+MPD) • Mise en place l’architecture de la solution • Développement des scripts de structure et procédures stockées • Mise en place des blocs technique pour l’initialisation du référentiel RUFUS tout en respectant les contraintes fonctionnelles • Rédaction des documentations techniques et des modes opératoires • Chiffrage et encadrement • Synchronisation avec Redis • Mise en place des scripts de migration des données Oracle, Cassandra vers PostgreSQL • Mise en place de data pipeline pour interfaçage avec Cassandra et synchronisation des données (apache spark, pyspark, airflow) • Optimisation des requêtes et des traitements • Industrialisation des processus de chargement des données (fichiers plats) Environnement technique : Cloud: GCP (cloud storage, bigquery, dataproc) Langages : Batch, pyspark (apache spark), python ETL : Airflow, batch Ops: Terraform, Ansible, Kubernates CI/CD: Git