Big Data: Ecosistema Hadoop y Spark
Big Data
Avanzado

Big Data: Ecosistema Hadoop y Spark

Comprende y aplica arquitecturas de Big Data para procesar grandes volúmenes de información mediante Spark, Kafka y entornos Data Lake.

Nivel

Avanzado

Modalidad

En vivo

Duración

40 horas

01 · RESULTADOS

Objetivos de aprendizaje

Qué lograrás dominar al completar este programa.

OBJETIVO 01

Diseñar arquitecturas modernas de Big Data y Data Lakes

OBJETIVO 02

Procesar grandes volúmenes de datos mediante Apache Spark

OBJETIVO 03

Construir pipelines de procesamiento de eventos y streaming con Kafka

OBJETIVO 04

Optimizar procesamiento distribuido, rendimiento y uso de recursos en la nube

02 · METODOLOGÍA

Metodología TechSkillsPeru

Aprendizaje práctico orientado a resultados profesionales.

01

Clases prácticas

Sesiones en vivo o bajo demanda con enfoque técnico y aplicado.

02

Labs reales

Resolución de problemas utilizando herramientas de la industria.

03

Proyecto final

Construye un resultado tangible para tu portafolio profesional.

03 · PLAN ACADÉMICO

Estructura del curso

Módulos y lecciones detalladas del programa.

01

Arquitectura Big Data

3 lecciones

  • HDFS y ecosistema de Hadoop

    Comprende los principios del almacenamiento distribuido y el papel de HDFS en el ecosistema Hadoop.

  • Data Lakes vs Data Warehouses

    Compara Data Lakes y Data Warehouses y reconoce cuándo utilizar cada arquitectura.

  • Compute vs Storage separado

    Comprende la separación entre almacenamiento y cómputo en arquitecturas modernas de datos.

02

Procesamiento con Spark

3 lecciones

  • RDDs vs DataFrames

    Compara RDDs y DataFrames y comprende cuándo utilizar cada abstracción.

  • Spark SQL

    Consulta y transforma grandes volúmenes de datos mediante Spark SQL.

  • Optimización de memoria y Catalyst Optimizer

    Identifica costos de particionado y shuffle y aplica estrategias para optimizar trabajos.

03

Streaming en Tiempo Real

3 lecciones

  • Apache Kafka

    Comprende tópicos, productores, consumidores y patrones de mensajería distribuida.

  • Spark Structured Streaming

    Construye procesos de streaming para analizar eventos a medida que llegan.

  • Windowing y Watermarks

    Gestiona eventos fuera de orden mediante ventanas y marcas de agua.

04

Producción y despliegue y entornos cloud

3 lecciones

  • Pipeline ETL completo

    Construye un pipeline completo desde la ingesta y transformación hasta el almacenamiento.

  • Despliegue en Databricks/AWS

    Comprende alternativas para ejecutar cargas de Big Data en plataformas cloud administradas.

  • Proyecto integrador

    Diseña una arquitectura de datos orientada a procesamiento batch, streaming o ambos enfoques.

04 · REQUISITOS

Requisitos previos

Condiciones recomendadas para aprovechar el programa.

REQUISITO 01

Python intermedio

REQUISITO 02

Conocimientos sólidos de SQL y línea de comandos

05 · SOPORTE

Preguntas frecuentes

Respuestas a las consultas habituales sobre el programa.

¿Se usan clusters reales?

Sí, utilizaremos Databricks Community Edition y clusters efímeros en AWS para evitar costos locales.

¿Hay mentoría?

Incluye mentorías técnicas 1:1 para la revisión del proyecto final de Big Data.

SOLUCIONES CORPORATIVAS

Capacita a todo tu equipo

Si buscas entrenar a 5 o más colaboradores, ofrecemos planes corporativos con facturación electrónica, reportes de avance y personalización del currículo.

Solicitar cotización