(musique électronique) Bienvenue dans Big Data Systems et Analytics. Dans ces leçons, vous découvrirez les systèmes de stockage conçu pour le big data, comme Hadoop et son architecture, qui inclut Hadoop Distributed File System, MapReduce, et différents types de nœuds disponibles. Pour traiter le big data, il faut une application centralisée qui vous permet de soumettre, puis de stocker des données dans une base de données relationnelle, mais ce n'est pas possible pour stocker de grands ensembles de données dans une base de données relationnelle car la base de données développera un goulot d'étranglement. Ces applications ne prennent généralement en charge que les petits systèmes qui ne peut pas gérer le Big Data. Google a résolu ce problème avec le modèle de programmation MapReduce. L'algorithme MapReduce exécute les fonctions suivantes. Diviser un gros travail en plus petites parties. Exécution de petits travaux en toute autonomie. Intégration des résultats dans un seul ensemble de données. Si vous avez un gros problème à résoudre, alors vous pouvez diviser l'algorithme en plusieurs tâches plus petites, et chaque tâche s'exécute indépendamment sur les infrastructures distribuées. Hadoop est conçu pour exécuter l'algorithme MapReduce. Les systèmes Hadoop exécutent l'algorithme MapReduce, qui décompose le travail en plusieurs petites tâches. Il traite les données en parallèle, ce qui signifie que ces petites tâches sont effectuées simultanément afin qu'il puisse effectuer une analyse statistique sur d'énormes quantités de données à la fois. Autres avantages de l'utilisation de l'architecture Hadoop sont que cela peut nous aider à gérer une situation où si un nœud tombe en panne, puis un autre nœud se chargera du traitement. Hadoop peut traiter les données jusqu'à la taille d'un pétaoctet en parallèle. Il fournit également une solution d'évolutivité, ce qui signifie que le nœud peut être ajouté dynamiquement pour traiter plus de données. Le système de fichiers distribué Hadoop fournit fiabilité, évolutivité et disponibilité. Les données sont répliquées dans tout le système pour le traitement dans une bannière distribuée. Les fichiers sont distribués en gros blocs et sont répliquées pour permettre des lectures parallèles optimisées. Avec MapReduce, Hadoop exécute le travail en utilisant les données stockées sur le système de fichiers distribué à l'aide de l'algorithme MapReduce. Cela nous aide à faire des calculs efficacement avec les données stockées. Apache Pig est un projet open-source construit sur le dessus des algorithmes MapReduce. Cela nous aide à créer le programme d'analyse des données. Vous pouvez analyser les grands ensembles de données à l'aide d'Apache Pig. Cela nous aide également à afficher les données sous forme de flux de données. Vous devez écrire le programme d'analyse de données en utilisant le langage Pig, et ce programme sera converti dans la carte et réduire les tâches en interne. L'utilisation de Pig présente plusieurs avantages. C'est similaire au langage de requête structuré. Si vous connaissez le langage de requête, alors il est facile de ramasser cette langue. Il prend en charge les opérateurs tels que les jointures et le tri, semblable à la base de données relationnelle. Il peut gérer à la fois des données structurées et non structurées. Apache Pig est un langage de haut niveau construit sur la couche d'abstraction MapReduce. MapReduce peut être difficile à apprendre par rapport à Apache Pig, mais étant un expert en programmation Java peut aider à son apprentissage. Apache Pig vous permet également d'écrire un exemple de script qui est déjà compilé et générera la tâche MapReduce en interne. La tâche MapReduce nécessite un temps de compilation plus long et permet aux développeurs de stocker les données n'importe où dans le pipeline. Il fournit les bibliothèques qui nous permettent de créer les tâches d'extraction, de transformation et de chargement. Voici quelques-unes des utilisations les plus courantes d'Apache Pig. Convertir les données au format parquet. Recherchez des fichiers journaux dans des pétaoctets de données. Traiter des données de grande taille et générer des agrégats. Effectuez une conversion d'image. Apache Hive est aussi une plateforme pour générer des opérations MapReduce. Hive prend en charge les requêtes ad hoc pour générer des agrégats de données et fournit également diverses techniques qui aident avec l'analyse de grands ensembles de données. Il prend en charge un langage similaire au langage de requête du serveur SQL. Hive fonctionne généralement bien avec des données structurées par rapport à Apache Pig et fonctionne sur différents types de données, telles que structurées, non structurées et semi-structurées. Hive nous permet d'écrire le script en utilisant HiveQL, un traitement de requêtes et un langage déclaratif.