Ingénieur Big Data avec une expertise approfondie dans la mise en place de solutions de traitement de données massives. Expérience significative dans l'utilisation de technologies Big Data et Cloud pour transformer et analyser des données complexes.
● Traitement de chaque chaîne (breakdown, records) via AWS EMR. ● In → Raw : réception des fichiers dans un bucket in ; à l’arrivée des fichiers, une notification S3 déclenche la Lambda lambda_in2raw pour transférer les fichiers vers le bucket raw. ● Traitement EMR : lancement d’un cluster EMR après le transfert vers raw afin de transformer les fichiers bruts en Parquet, appliquer les transformations et les merges nécessaires, puis stocker les résultats dans le bucket prepared. Le lancement de l’EMR est déclenché par une Lambda (lbd_emr) via CloudWatch ou notification S3. ● Snowflake : chargement des données finales depuis le bucket prepared via Snowpipe ou scripts de chargement S3. Utilisation de procédures stockées Snowflake, déclenchées par des Lambdas, pour effectuer certaines agrégations. ● Elasticsearch : ajout d’un step EMR pour l’indexation des données. Utilisation d’API Gateway pour interroger les données indexées, destinées au front ou à d’autres équipes. Environnement technique : Spark, Scala, Python, AWS S3, AWS EMR, AWS Lambda, AWS Step Functions, AWS DMS, Snowflake, Git
● Développement et déploiement des différentes briques de la plateforme sur AWS. - Projet divisé en 5 briques: Uniformisation, Transformer, Diff, Merger, Extraction. ● Uniformisation : validation des schémas des rapports reçus des plateformes. ● Transformer : application de règles de transformation via des UDF spécifiques à chaque store. ● Diff : calcul des différentiels entre un rapport (Parquet) et des référentiels (Parquet) afin d’identifier les nouvelles valeurs à ajouter, avec génération de fichiers CSV. ● Merger : identification des produits issus des rapports et récupération des informations nécessaires via des jointures successives entre rapports et référentiels. ● Extraction : utilisation d’AWS DMS pour migrer les données vers AWS S3 (référentiels utilisés par le merger). Environnement technique : Spark, Scala, Python, AWS S3, AWS EMR, AWS Lambda, AWS Step Functions, AWS DMS, Snowflake, Git, dbt
● Implémentation de nouveaux processeurs NiFi pour la validation de différents formats de fichiers (CSV, Avro, Parquet, XML) à partir d’un fichier de configuration YAML. ● Développement de jobs utilitaires pour la fusion de fichiers Avro, puis migration vers une solution basée sur Hive. ● Développement d’un outil de merge de régions HBase selon une taille limite par région. ● Développement d’une chaîne d’ingestion des données d’analyse des ventes ADEO par pays et par famille de produits, basée sur Hive, Spark et Avro, orchestrée quotidiennement par Oozie. Environnement technique : Java, Spark, Hive, Hadoop, HDFS, HBase, Apache NiFi, JUnit, Avro, Git, Jenkins, Nexus, Kerberos
● Développement d’un module Core comprenant : - la gestion des objets métiers (Comptes, Opérations, etc.), - la gestion des formats de données (EBCDIC, CopyCobol). ● Gestion des appels aux différents référentiels stockés en base de données. - Développement de jobs Spark pour l’alimentation du Data Lake HDFS à partir des flux EBCDIC. ● Exposition des données HDFS via des tables Hive, puis analyse via Spark ; écriture des résultats dans des tables finales d’agrégation. ● Développement et déploiement de workflows et coordinateurs Oozie pour l’ordonnancement complet du cycle de vie de la solution. Environnement technique : Java, Spark, Hive, HDFS, Git, Oozie, Jenkins, Nexus