IFCD73

Cloudera – Desarrollo con Spark y Hadoop

Conocer los sistemas Apache Hadoop y Apache Spark y sus usos más comunes respecto alprocesamiento de datos.

Diseñado y producido por Smartmind

Disponibilidad:

Descatalogado

Contenidos

IFCD73 — Cloudera - Desarrollo con Spark y Hadoop

Módulo 1

Fundamentos de Hadoop y Spark

Objetivo. Conocer los fundamentos de las herramientas Apache Hadoop y Apache Spark y sus utilidades en el proceso de datos.

Contenidos: 6

Conocimiento/capacidades cognitivas y prácticas

Introducción a Apache Hadoop y el ecosistema Hadoop o Aspectos generales de Apache Hadoop o Proceso de datos o Ejercicios prácticos

Archivos de almacenamiento de Apache Hadoop o Componentes del Clúster Apache Hadoop o Arquitectura HDFS o Uso de HDFS

Proceso de datos en un clúster de Apache Hadoop o Arquitectura YARN o Trabajando con YARN

Fundamentos de Apache Spark o ¿Qué es Apache Spark? o Arranque del Spark Shell o Uso de Spark Shell o Primeros pasos con Datasets y Dataframes o Operaciones en Dataframe

Trabajo con Dataframes y Schemas o Crear Dataframes a partir de Data Sources o Guardar DataFrames en Data Sources o DataFrame Schemas o Primeros pasos con Datasets y Dataframes o Rapidez y lentitud de ejecución

Análisis de datos con consultas de DataFrame o Consultar DataFrames con el empleo de expresiones de columna o Agrupación y agregación de consultas o Unión de DataFrames

HABILIDADES DE GESTIÓN, PERSONALES Y SOCIALES

Concienciación de la importancia del conocimiento de estas dos herramientas Apache, para poder incluirlas en el trabajo diario y su importancia y consecuencias en los objetivos de la empresa.

Conocimiento del papel personal a jugar en la estrategia general de la empresa, gracias al conocimiento de las herramientas que se tratan en el módulo y sus consecuencias a medio y largo plazo.

Módulo 2

RDDs

Objetivo. Comprender el papel de los RDD dentro de Apache Spark y su uso con datos.

Contenidos: 4

Conocimiento/capacidades cognitivas y prácticas

RDDs: Sumario o Vistazo general sobre RDD o RDD Data Sources o Creando y guardando RDDs o Operaciones con RDDs

Transformación de datos con RDDs o Escritura y paso de funciones de transformación o Ejecuciones de transformación o Conversión entre RDDs y DataFrames

Agregación de datos con Pair RDDs o Key-Value Pair RDDs o Map-Reduce o Otras operaciones Pair RDD

Consulta y vistas de tablas mediante SQL o Datasets y DataFrames o Creación de Datasets o Ejecución y guardado de Datasets o Operaciones de Dataset

HABILIDADES DE GESTIÓN, PERSONALES Y SOCIALES

Concienciación del uso de datos con RDDs y su influencia en la consecución de los objetivos de la empresa.

Conocimiento del papel personal en la buena gestión de los conocimientos de esta temática para integrarlos dentro de los objetivos integrales de la empresa.

Módulo 3

Aplicaciones con Spark y estructuras streaming con Kafka

Objetivo. Conocer el funcionamiento de Spark relativo a las aplicaciones, así como el de las estructuras de streaming con Kafka y sus usos más comunes.

Contenidos: 9

Conocimiento/capacidades cognitivas y prácticas

Creación, configuración y ejecución de aplicaciones Spark o Creación de una aplicación Spark o Compilar y ejecutar la aplicación o Application Deployment Mode o La interfaz Spark Application Web UI o Configuración de las propiedades de la aplicación

Procesamiento distribuido Spark o Apache Spark en un Clúster o Particiones RDD o Ejemplo: Particionamiento en consultas o Etapas y Tareas o Planificación de tareas de ejecución o Ejemplo: Programar la ejecución de Catalyst o Ejemplo: Programar la ejecución de un RDD

Persistencia de datos distribuidos o Persistencia en Datasets y DataFrames o Persistencia en niveles de almacenamiento o Visualización de RDDs persistentes

Patrones comunes al procesar datos con Spark o Casos comunes de uso de Spark o Algoritmos de iteración en Apache Spark o Machine Learning o Caso práctico

Introducción a las Estructuras Streaming o Visión general de Apache Spark Streaming o Creación de Streaming DataFrames o Transformación de Dataframes o Ejecución de consultas Streaming

Estructuras Streaming con Apache Kafka o Vistazo general o Recepción de mensajes Kafka o Envío de mensajes Kafka

Agregación y unión de Streaming Dataframes o Agregación Streaming o Unión de Streaming Dataframes

Conclusión

Procesamiento de mensajes con Apache Kafka o ¿Qué es Apache Kafka? o Visión general de Apache Kafka o Escalado de Apache Kafka o Arquitectura de un Clúster Apache Kafka o Herramientas Apache Kafka de la linea de comandos

HABILIDADES DE GESTIÓN, PERSONALES Y SOCIALES

Concienciación del uso de aplicaciones con Spark y los usos de Kafka, así como dominio de las herramientas para su aportación a los objetivos de la empresa.

Conocimiento del papel personal en la buena gestión de los conocimientos de esta temática para integrarlos dentro de los objetivos integrales de la empresa.