Profil anonyme

Ingénieur Big Data · Expert

Ingénieur Big Data

Réf. JS-C02745
javapythonAWSMySQL💼 9 ans d'XP
🚀 Proposer un projet
E-mail
🔒 Réservé employeur
Téléphone
🔒 Réservé employeur
LinkedIn
🔒 Réservé employeur
CV
🔒 Réservé employeur

À propos du candidat

Ingénieur Big Data avec une expertise approfondie dans la mise en place de solutions de traitement de données massives. Expérience significative dans l'utilisation de technologies Big Data et Cloud pour transformer et analyser des données complexes.

🔒 Quelques mots masquésInscrire mon entreprise pour tout voir

Compétences

javapythonAWSMySQLHadoopSparkScalaTerraformSnowflakeHiveHBaseOozieNiFiRedisAWS RDSdbtRecueil des besoins et assistanceRédaction des spécifications fonctionnellesRédaction des spécifications techniquesChiffrage des tâches

Expérience professionnelle

D
🔒
Data Engineer

● Traitement de chaque chaîne (breakdown, records) via AWS EMR. ● In → Raw : réception des fichiers dans un bucket in ; à l’arrivée des fichiers, une notification S3 déclenche la Lambda lambda_in2raw pour transférer les fichiers vers le bucket raw. ● Traitement EMR : lancement d’un cluster EMR après le transfert vers raw afin de transformer les fichiers bruts en Parquet, appliquer les transformations et les merges nécessaires, puis stocker les résultats dans le bucket prepared. Le lancement de l’EMR est déclenché par une Lambda (lbd_emr) via CloudWatch ou notification S3. ● Snowflake : chargement des données finales depuis le bucket prepared via Snowpipe ou scripts de chargement S3. Utilisation de procédures stockées Snowflake, déclenchées par des Lambdas, pour effectuer certaines agrégations. ● Elasticsearch : ajout d’un step EMR pour l’indexation des données. Utilisation d’API Gateway pour interroger les données indexées, destinées au front ou à d’autres équipes. Environnement technique : Spark, Scala, Python, AWS S3, AWS EMR, AWS Lambda, AWS Step Functions, AWS DMS, Snowflake, Git

1 octobre 2021 - 1 janvier 2026
D
🔒
Data Engineer

● Développement et déploiement des différentes briques de la plateforme sur AWS. - Projet divisé en 5 briques: Uniformisation, Transformer, Diff, Merger, Extraction. ● Uniformisation : validation des schémas des rapports reçus des plateformes. ● Transformer : application de règles de transformation via des UDF spécifiques à chaque store. ● Diff : calcul des différentiels entre un rapport (Parquet) et des référentiels (Parquet) afin d’identifier les nouvelles valeurs à ajouter, avec génération de fichiers CSV. ● Merger : identification des produits issus des rapports et récupération des informations nécessaires via des jointures successives entre rapports et référentiels. ● Extraction : utilisation d’AWS DMS pour migrer les données vers AWS S3 (référentiels utilisés par le merger). Environnement technique : Spark, Scala, Python, AWS S3, AWS EMR, AWS Lambda, AWS Step Functions, AWS DMS, Snowflake, Git, dbt

1 janvier 2019 - 1 septembre 2021
D
🔒
Développeur Big Data

● Implémentation de nouveaux processeurs NiFi pour la validation de différents formats de fichiers (CSV, Avro, Parquet, XML) à partir d’un fichier de configuration YAML. ● Développement de jobs utilitaires pour la fusion de fichiers Avro, puis migration vers une solution basée sur Hive. ● Développement d’un outil de merge de régions HBase selon une taille limite par région. ● Développement d’une chaîne d’ingestion des données d’analyse des ventes ADEO par pays et par famille de produits, basée sur Hive, Spark et Avro, orchestrée quotidiennement par Oozie. Environnement technique : Java, Spark, Hive, Hadoop, HDFS, HBase, Apache NiFi, JUnit, Avro, Git, Jenkins, Nexus, Kerberos

1 septembre 2017 - 1 novembre 2018
D
🔒
Développeur Big Data

● Développement d’un module Core comprenant : - la gestion des objets métiers (Comptes, Opérations, etc.), - la gestion des formats de données (EBCDIC, CopyCobol). ● Gestion des appels aux différents référentiels stockés en base de données. - Développement de jobs Spark pour l’alimentation du Data Lake HDFS à partir des flux EBCDIC. ● Exposition des données HDFS via des tables Hive, puis analyse via Spark ; écriture des résultats dans des tables finales d’agrégation. ● Développement et déploiement de workflows et coordinateurs Oozie pour l’ordonnancement complet du cycle de vie de la solution. Environnement technique : Java, Spark, Hive, HDFS, Git, Oozie, Jenkins, Nexus

1 novembre 2016 - 1 septembre 2017

Formation

D
École Nationale de Sciences de l’Informatique (ENSI), Tunisie
Diplôme d’Ingénieur
30 juillet 2015 - 30 juillet 2015
B
Établissement non précisé
Baccalauréat
30 juin 2010 - 30 juin 2010
Ce profil vous intéresse ?
Inscrivez votre société pour voir l'identité, le CV et les coordonnées.
Créer mon compte entreprise →