
Big Data: Ecosistema Hadoop y Spark
Comprende y aplica arquitecturas de Big Data para procesar grandes volúmenes de información mediante Spark, Kafka y entornos Data Lake.
Nivel
Avanzado
Modalidad
En vivo
Duración
40 horas
01 · RESULTADOS
Objetivos de aprendizaje
Qué lograrás dominar al completar este programa.
Diseñar arquitecturas modernas de Big Data y Data Lakes
Procesar grandes volúmenes de datos mediante Apache Spark
Construir pipelines de procesamiento de eventos y streaming con Kafka
Optimizar procesamiento distribuido, rendimiento y uso de recursos en la nube
02 · METODOLOGÍA
Metodología TechSkillsPeru
Aprendizaje práctico orientado a resultados profesionales.
Clases prácticas
Sesiones en vivo o bajo demanda con enfoque técnico y aplicado.
Labs reales
Resolución de problemas utilizando herramientas de la industria.
Proyecto final
Construye un resultado tangible para tu portafolio profesional.
03 · PLAN ACADÉMICO
Estructura del curso
Módulos y lecciones detalladas del programa.
01Arquitectura Big Data
3 lecciones
Arquitectura Big Data
3 lecciones
HDFS y ecosistema de Hadoop
Comprende los principios del almacenamiento distribuido y el papel de HDFS en el ecosistema Hadoop.
Data Lakes vs Data Warehouses
Compara Data Lakes y Data Warehouses y reconoce cuándo utilizar cada arquitectura.
Compute vs Storage separado
Comprende la separación entre almacenamiento y cómputo en arquitecturas modernas de datos.
02Procesamiento con Spark
3 lecciones
Procesamiento con Spark
3 lecciones
RDDs vs DataFrames
Compara RDDs y DataFrames y comprende cuándo utilizar cada abstracción.
Spark SQL
Consulta y transforma grandes volúmenes de datos mediante Spark SQL.
Optimización de memoria y Catalyst Optimizer
Identifica costos de particionado y shuffle y aplica estrategias para optimizar trabajos.
03Streaming en Tiempo Real
3 lecciones
Streaming en Tiempo Real
3 lecciones
Apache Kafka
Comprende tópicos, productores, consumidores y patrones de mensajería distribuida.
Spark Structured Streaming
Construye procesos de streaming para analizar eventos a medida que llegan.
Windowing y Watermarks
Gestiona eventos fuera de orden mediante ventanas y marcas de agua.
04Producción y despliegue y entornos cloud
3 lecciones
Producción y despliegue y entornos cloud
3 lecciones
Pipeline ETL completo
Construye un pipeline completo desde la ingesta y transformación hasta el almacenamiento.
Despliegue en Databricks/AWS
Comprende alternativas para ejecutar cargas de Big Data en plataformas cloud administradas.
Proyecto integrador
Diseña una arquitectura de datos orientada a procesamiento batch, streaming o ambos enfoques.
04 · REQUISITOS
Requisitos previos
Condiciones recomendadas para aprovechar el programa.
Python intermedio
Conocimientos sólidos de SQL y línea de comandos
05 · SOPORTE
Preguntas frecuentes
Respuestas a las consultas habituales sobre el programa.
¿Se usan clusters reales?
Sí, utilizaremos Databricks Community Edition y clusters efímeros en AWS para evitar costos locales.
¿Hay mentoría?
Incluye mentorías técnicas 1:1 para la revisión del proyecto final de Big Data.
Capacita a todo tu equipo
Si buscas entrenar a 5 o más colaboradores, ofrecemos planes corporativos con facturación electrónica, reportes de avance y personalización del currículo.
Solicitar cotización