(música suave) ¿Qué es exactamente el Big Data? Big data significa grandes cantidades de datos que crecen exponencialmente con el tiempo. Debido a su gran tamaño, big data no se puede almacenar en plataformas de bases de datos tradicionales. Así que tendrás que explorar diferentes formas para su almacenamiento y procesamiento. Aquí hay algunas formas en que se usan los grandes datos. Redes sociales. Si cuentas fotos, videos y mensajes, entonces al menos 100 terabytes de datos por hora o más se cargan en los sitios de redes sociales todos los días, análisis de aviones aéreos, las empresas de fabricación de aeronaves a menudo tienen contratos con compañías aéreas para el mantenimiento de aeronaves. Las empresas tienen análisis que deben ejecutarse. en los datos generados por la aeronave en vuelo. El tamaño de los datos suele ser de 10 terabytes por hora o más. Análisis de turbinas, empresa de fabricación de turbinas tener un contrato con centrales eléctricas que están transmitiendo los datos que se ingresan en el análisis. El análisis genera resultados que pueden mostrar información y alertas por un total de alrededor de 80 terabytes por mes. Todos los casos anteriores son ejemplos perfectos del uso de big data. No es posible procesar o almacenar los datos. utilizando el modelo de base de datos relacional tradicional en estos ejemplos. Así que hay que buscar otras soluciones. Los principales factores que impulsan el crecimiento. de big data incluyen aprendizaje automático, inteligencia artificial, análisis predictivo y alertas de fraude en tiempo real. Hay tres tipos de big data, datos estructurados. Este tipo de datos a menudo utiliza una fila o formato de columna es fácil de almacenar y búsqueda y está altamente organizado. Se puede almacenar en bases de datos relacionales. como Postgre SQL o servidor SQL. Soporta varios formatos predefinidos y análisis cuantitativo y se utiliza a menudo en campos como el servicio al cliente o sistemas de nómina de empleados. Datos no estructurados. Se estima que hasta el 90% de los datos no están estructurados. Este tipo de datos contiene un modelo sin esquema. No tiene ningún modelo predefinido y requiere un manejo especial para el almacenamiento de datos. Contiene varias matrices de formatos y la fuente. de datos pueden ser de dispositivos móviles, correo electrónico o páginas web. Este tipo de datos también es más cualitativo en comparación con los datos estructurados. Y necesita tener un almacenamiento de datos especial para ello en lugar de una base de datos relacional. No es posible mostrar estos datos. en un formato de fila o columna debido a la estructura de los datos. Datos semiestructurados, este tipo de datos tiene una estructura que no está formateada en tablas como datos estructurados. Sin embargo, todavía se organiza a través de un método diferente. típicamente etiquetas u otros indicadores. También se le puede llamar estructura autodescriptiva. y se usa más comúnmente en bases de datos orientadas a objetos. Es particularmente importante planificar cómo estructurar una gran cantidad de datos. Puede convertir la información en datos para aprovechar de los grandes conjuntos de datos. Un ejemplo de un minorista en línea que aprovecha de grandes conjuntos de datos puede ser cuando el minorista recopila datos del patrón de compra de un usuario, luego comienza a mostrar los anuncios como, un artículo complementario comúnmente comprado junto con un artículo el cliente ya compró, alertas de reducción de precio para artículos, el cliente compra con frecuencia o mostrar anuncios en sitios web su base de clientes visita a menudo. Toda esta información se genera a partir de la analítica. el minorista en línea usa, los análisis se ejecutan usando big data. Luego se generan nuevos datos para aumentar las ventas de la empresa. El uso de big data requiere que pensemos sobre cómo almacenar grandes datos, cómo escalar el almacenamiento y hacerlo altamente disponible. Cómo aumentar el poder de procesamiento de datos, cómo entender los diferentes tipos de datos disponibles, cómo diferenciar entre generado por máquina y datos generados por humanos y cómo procesar grandes conjuntos de datos de diferentes fuentes de datos o fuentes de datos de transmisión en tiempo real.