Qu'est-ce que Spark ?
Spark fournit un moteur d’analyse unifié qui s’exécute sur un cluster de machines. Il propose plusieurs modules : Spark Core pour le calcul distribué, Spark SQL pour les requêtes structurées, Spark Streaming pour le traitement de flux en temps réel, MLlib pour le machine learning et GraphX pour le traitement de graphes. Les données peuvent être lues depuis de nombreux formats (JSON, Parquet, CSV, bases de données, systèmes de fichiers distribués) et stockées dans des systèmes tels que HDFS, S3 ou des bases NoSQL.
Qui utilise Spark ?
Les profils qui maîtrisent Spark sont généralement des Data Engineers, des Data Scientists, des analystes en Business Intelligence, des ingénieurs en machine learning et des architectes de données. Ils possèdent des compétences en programmation (Scala, Java, Python, R), en concepts de calcul distribué et en manipulation de données massives.