(música electrónica) Bienvenido a Big Data Systems and Analytics. En estas lecciones, aprenderá acerca de los sistemas de almacenamiento diseñado para big data, como Hadoop y su arquitectura, que incluye el sistema de archivos distribuido Hadoop, MapReduce, y diferentes tipos de nodos disponibles. Para procesar big data, necesita una aplicación centralizada que le permite enviar y luego almacenar datos en una base de datos relacional, pero no es posible para almacenar grandes conjuntos de datos en una base de datos relacional porque la base de datos desarrollará un cuello de botella. Estas aplicaciones normalmente solo admiten sistemas pequeños que no puede manejar grandes datos. Google resolvió este problema con el modelo de programación MapReduce. El algoritmo MapReduce realiza las siguientes funciones. Dividir un gran trabajo en partes más pequeñas. Ejecutar trabajos más pequeños de forma independiente. Integración de resultados en un único conjunto de datos. Si tienes un gran problema que resolver, entonces puedes dividir el algoritmo en varias tareas más pequeñas, y cada tarea se ejecuta de forma independiente en infraestructura distribuida. Hadoop está diseñado para ejecutar el algoritmo MapReduce. Los sistemas Hadoop ejecutan el algoritmo MapReduce, que divide el trabajo en varias tareas pequeñas. Procesa los datos en paralelo, lo que significa que estas tareas más pequeñas se llevan a cabo simultáneamente para que pueda realizar análisis estadísticos en grandes cantidades de datos a la vez. Otros beneficios de usar la arquitectura Hadoop son que puede ayudarnos a manejar una situación donde si un nodo falla, luego otro nodo se encargará del procesamiento. Hadoop puede procesar los datos hasta el tamaño de un petabyte en paralelo. También proporciona una solución de escalabilidad, lo que significa que el nodo se puede agregar dinámicamente para procesar más datos. El sistema de archivos distribuidos de Hadoop proporciona confiabilidad, escalabilidad y disponibilidad. Los datos se replican en todo el sistema. para su procesamiento en un banner distribuido. Los archivos se distribuyen en grandes bloques. y se replican para permitir lecturas paralelas optimizadas. Con MapReduce, Hadoop ejecuta el trabajo utilizando los datos almacenados en el sistema de archivos distribuido utilizando el algoritmo MapReduce. Nos ayuda a hacer cálculos de manera eficiente. con los datos almacenados. Apache Pig es un proyecto de código abierto construido sobre de los algoritmos de MapReduce. Nos ayuda a crear el programa de análisis de datos. Puede analizar grandes conjuntos de datos utilizando Apache Pig. También nos ayuda a mostrar los datos como flujos de datos. Necesitas escribir el programa de análisis de datos. usando el lenguaje Pig, y este programa se convertirá en el mapa y reducir las tareas internamente. Hay varios beneficios de usar Pig. Es similar al lenguaje de consulta estructurado. Si conoce el lenguaje de consulta, entonces es fácil aprender este lenguaje. Soporta operadores como uniones y clasificación, similar a la base de datos relacional. Puede manejar tanto datos estructurados como no estructurados. Apache Pig es un lenguaje de alto nivel Construido sobre la capa de abstracción de MapReduce. MapReduce puede ser difícil de aprender en comparación con Apache Pig, pero siendo un experto en programación Java puede ayudar a aprenderlo. Apache Pig también le permite escribir un script de muestra que ya está compilado y generará el trabajo de MapReduce internamente. El trabajo de MapReduce requiere un tiempo de compilación más largo y permite a los desarrolladores almacenar los datos en cualquier parte de la tubería. Proporciona las bibliotecas que nos permiten crear los trabajos de extracción, transformación y carga. Estos son algunos de los usos más comunes de Apache Pig. Convierta los datos en formato parquet. Busque archivos de registro de los petabytes de datos. Procese datos de gran tamaño y genere agregados. Realizar la conversión de imágenes. Apache Hive también es una plataforma para generar operaciones de MapReduce. Hive proporciona soporte para consultas ad hoc para generar agregados de datos y también proporciona varias técnicas que ayudan con el análisis de grandes conjuntos de datos. Soporta lenguaje similar al lenguaje de consulta del servidor SQL. Hive generalmente funciona bien con datos estructurados en comparación con Apache Pig y funciona en diferentes tipos de datos, como estructurados, no estructurados y semiestructurados. Hive nos permite escribir el script usando HiveQL, un procesamiento de consultas y un lenguaje declarativo.