(música eletrônica) Bem-vindo ao Big Data Systems and Analytics. Nestas lições, você aprenderá sobre sistemas de armazenamento projetado para big data, como o Hadoop e sua arquitetura, que inclui o Hadoop Distributed File System, MapReduce, e diferentes tipos de nós disponíveis. Para processar big data, você precisa de um aplicativo centralizado que permite enviar e armazenar dados em um banco de dados relacional, mas não é possível para armazenar grandes conjuntos de dados em um banco de dados relacional porque o banco de dados desenvolverá um gargalo. Esses aplicativos normalmente suportam apenas pequenos sistemas que não pode lidar com big data. O Google resolveu este problema com o modelo de programação MapReduce. O algoritmo MapReduce executa as seguintes funções. Dividir um grande trabalho em partes menores. Executando trabalhos menores de forma independente. Integrando resultados em um único conjunto de dados. Se você tem um grande problema para resolver, então você pode dividir o algoritmo em várias tarefas menores, e cada tarefa é executada independentemente em infraestrutura distribuída. O Hadoop foi projetado para executar o algoritmo MapReduce. Os sistemas Hadoop executam o algoritmo MapReduce, que divide o trabalho em várias pequenas tarefas. Ele processa os dados em paralelo, significando que essas tarefas menores são realizadas simultaneamente para que possa realizar análises estatísticas em grandes quantidades de dados de uma só vez. Outros benefícios de usar a arquitetura Hadoop é que ele pode nos ajudar a lidar com uma situação onde se um nó falhar, então outro nó cuidará do processamento. O Hadoop pode processar os dados até o tamanho de um petabyte em paralelo. Ele também fornece uma solução de escalabilidade, o que significa que o nó pode ser adicionado dinamicamente para processar mais dados. O sistema de arquivos distribuídos Hadoop fornece confiabilidade, escalabilidade e disponibilidade. Os dados são replicados em todo o sistema para processamento em um banner distribuído. Os arquivos são distribuídos em grandes blocos e são replicados para permitir leituras paralelas otimizadas. Com o MapReduce, o Hadoop executa o trabalho usando os dados armazenados no sistema de arquivos distribuído usando o algoritmo MapReduce. Ele nos ajuda a fazer cálculos de forma eficiente com os dados armazenados. Apache Pig é um projeto de código aberto que é construído em cima de algoritmos MapReduce. Ele nos ajuda a criar o programa de análise de dados. Você pode analisar os grandes conjuntos de dados usando o Apache Pig. Também nos ajuda a exibir os dados como fluxos de dados. Você precisa escrever o programa de análise de dados usando a linguagem Pig, e este programa será convertido em mapear e reduzir tarefas internamente. Existem vários benefícios de usar o Pig. É semelhante à linguagem de consulta estruturada. Se você conhece a linguagem de consulta, então é fácil pegar essa linguagem. Ele suporta operadores como joins e sorting, semelhante ao banco de dados relacional. Ele pode lidar com dados estruturados e não estruturados. Apache Pig é uma linguagem de alto nível construído na camada de abstração MapReduce. O MapReduce pode ser difícil de aprender em comparação com o Apache Pig, mas sendo um especialista em programação Java pode ajudar a aprender. O Apache Pig também permite que você escreva scripts de amostra que já está compilado e vai gerar o trabalho MapReduce internamente. O trabalho MapReduce requer um tempo de compilação mais longo e permite que os desenvolvedores armazenem os dados em qualquer lugar do pipeline. Ele fornece as bibliotecas que nos permitem criar os trabalhos de extração, transformação e carregamento. Aqui estão alguns dos usos mais comuns para o Apache Pig. Converta dados em formato parquet. Pesquise arquivos de log dos petabytes de dados. Processe dados de grande porte e gere agregados. Execute a conversão de imagem. Apache Hive também é uma plataforma para gerar operações MapReduce. O Hive oferece suporte para consultas ad hoc para gerar agregados de dados e também fornece várias técnicas que ajudam com a análise de grandes conjuntos de dados. Ele suporta linguagem semelhante para a linguagem de consulta do SQL Server. O Hive geralmente funciona bem com dados estruturados comparado ao Apache Pig e funciona em diferentes tipos de dados, como estruturadas, não estruturadas e semiestruturadas. Hive nos permite escrever o script usando HiveQL, um processamento de consulta e linguagem declarativa.