Transición Drone FPV con IA: creá un efecto de vuelo entre dos tomas
Ver ebookQué es un data pipeline y para qué sirve: guía para ingenieros de datos y analistas

Dan Patiño
AI Strategy & Innovation en Coderhouse
Data
Qué es un data pipeline y para qué sirve: guía para ingenieros de datos y analistas
Publicado el
Un data pipeline es el conjunto de pasos automatizados que mueve datos desde donde se generan hasta donde se usan, transformándolos en el camino. Es la infraestructura invisible detrás de cualquier dashboard que se actualiza solo, de cualquier modelo de machine learning que recibe datos frescos y de cualquier reporte que no requiere que alguien pegue información a mano en una planilla.
Esta guía explica cómo funciona un pipeline, en qué se diferencian ETL y ELT, qué herramientas se usan en la práctica y cómo aprender a construirlos, tanto si trabajás en análisis como si apuntás a ingeniería de datos.
Qué es exactamente un data pipeline
Pensalo como una cadena de producción. En un extremo entran datos crudos desde múltiples fuentes: una base de datos transaccional, la API de un CRM, archivos que un proveedor deja en una carpeta, eventos de una aplicación. En el otro extremo sale información ordenada, consistente y lista para consultar.
Entre los dos extremos hay tres funciones que todo pipeline cumple:
Ingesta: traer los datos desde la fuente, sea por lotes programados o en flujo continuo.
Transformación: limpiar, normalizar, unificar formatos, calcular métricas derivadas, aplicar reglas de negocio.
Carga y orquestación: depositar el resultado en el destino y coordinar que cada paso corra en el orden correcto, con reintentos y alertas si algo falla.
Lo que convierte un script en un pipeline es justamente lo último: la orquestación. Un script que corre cuando alguien lo ejecuta no es un pipeline. Un proceso que corre solo, en un orden definido, y avisa cuando falla, sí lo es.
ETL y ELT: la diferencia que importa
ETL (Extract, Transform, Load) | ELT (Extract, Load, Transform) | |
|---|---|---|
Orden | Se transforma antes de cargar | Se carga crudo y se transforma en el destino |
Dónde ocurre la transformación | En un servidor intermedio | Dentro del data warehouse |
Ventaja principal | Solo se almacena lo procesado; útil con restricciones de almacenamiento o datos sensibles | Flexibilidad: si cambia la regla de negocio, se recalcula sin volver a extraer |
Límite | Rehacer una transformación implica reprocesar desde la fuente | Consume más almacenamiento y cómputo en el warehouse |
Contexto típico | Sistemas heredados, entornos regulados | Arquitecturas modernas en la nube |
ELT se volvió dominante porque el almacenamiento en la nube se abarató y el cómputo del warehouse se volvió elástico. La consecuencia práctica es relevante para tu perfil: cada vez más transformación se escribe en SQL dentro del warehouse, lo que acerca el rol de analista al de ingeniero de datos.
Batch y streaming
Batch: el pipeline corre cada cierto tiempo —cada hora, cada noche— y procesa todo lo acumulado. Cubre la enorme mayoría de casos: reportes, dashboards, cálculo de métricas. Es más simple de construir, depurar y mantener.
Streaming: los datos se procesan a medida que llegan, con latencia de segundos. Se justifica cuando la decisión no puede esperar: detección de fraude, precios dinámicos, monitoreo de sistemas. Es notablemente más complejo de operar.
El error clásico de los proyectos nuevos es empezar por streaming sin necesidad real. Si nadie va a mirar el dato antes de mañana, batch alcanza.
Las herramientas del stack actual
Orquestación: Apache Airflow
Es el estándar para definir dependencias entre tareas, programar ejecuciones y manejar fallas. Los flujos se definen en Python como grafos de tareas. La documentación oficial de Airflow es el punto de partida obligado. Alternativas modernas: Dagster y Prefect, con mejor experiencia de desarrollo y foco en los datos, no solo en las tareas.
Transformación: dbt
Permite escribir transformaciones en SQL con modularidad, control de versiones, testing y documentación automática. Cambió la forma de trabajar de los equipos de analytics porque trajo prácticas de ingeniería de software al SQL. La documentación de dbt incluye una guía de inicio con un proyecto de ejemplo completo.
Procesamiento a escala: Apache Spark
Para volúmenes que no caben en memoria de una sola máquina. Se usa vía Databricks o servicios gestionados en la nube. No es el primer paso de una ruta de aprendizaje, pero aparece en descripciones de puesto de data engineering con frecuencia.
Destino: data warehouse y data lake
BigQuery, Snowflake y Redshift son los warehouses más comunes; los data lakes almacenan datos crudos en su formato original. Si la distinción todavía no te queda clara, esta guía sobre qué es un data warehouse y cuáles son sus características principales lo desarrolla en detalle.
Ingesta gestionada
Fivetran, Airbyte y Stitch resuelven conectores hacia fuentes comunes sin escribir código. Ahorran semanas de trabajo repetitivo y son cada vez más frecuentes en equipos chicos.
Qué distingue un pipeline bien construido
Idempotencia. Si corre dos veces con los mismos datos, el resultado es idéntico. Sin esto, un reintento duplica registros.
Observabilidad. Se sabe qué corrió, cuánto tardó y qué falló, sin tener que revisar logs manualmente.
Tests de calidad de datos. Validaciones automáticas: nulos donde no debería haberlos, valores fuera de rango, filas duplicadas. Es la diferencia entre detectar un problema al ejecutar o cuando un director pregunta por un número raro.
Documentación del linaje. Poder rastrear de dónde viene cada campo del dashboard hasta su fuente original.
Manejo explícito de errores. Qué pasa si la API no responde, si el archivo llega vacío o si el esquema cambió sin aviso.
Cómo aprender a construir pipelines
SQL avanzado primero. Es la base de toda la transformación moderna. Funciones de ventana, CTEs, optimización de consultas.
Python para ingesta. Consumir una API, manejar paginación, escribir en una base de datos, gestionar errores y reintentos.
Un pipeline propio de punta a punta. Elegí una API pública, ingestá datos diariamente, transformalos y armá un dashboard sobre el resultado. Este proyecto solo vale más que cualquier certificación en una entrevista.
Orquestación. Recién acá incorporá Airflow o Dagster. Antes no tenés nada que orquestar.
Buenas prácticas de ingeniería. Git, testing, entornos separados, revisión de código.
Cursos recomendados de Coderhouse
Base indispensable: el Curso de SQL y el Curso de Python.
Especialización: el Curso de Data Engineering aborda directamente la construcción de pipelines.
Si venís del lado del análisis: el Curso de Data Analytics o la Carrera de Data Analytics te dan el contexto de negocio que después se traduce en mejores decisiones de diseño.
Preguntas frecuentes
¿Cuál es la diferencia entre un data pipeline y un ETL?
ETL es un tipo de pipeline: uno donde la transformación ocurre antes de la carga. "Data pipeline" es el término general que incluye ETL, ELT, procesos de streaming y flujos de datos hacia modelos de machine learning.
¿Necesito saber programar para trabajar con pipelines?
Para diseñarlos y mantenerlos, sí: SQL siempre y Python en la mayoría de los casos. Existen herramientas visuales de ingesta que reducen el código, pero la lógica de transformación y el manejo de errores siguen requiriendo criterio técnico.
¿Qué es más pedido en el mercado: Airflow o dbt?
Cumplen funciones distintas y con frecuencia se usan juntos: dbt para transformar dentro del warehouse, Airflow para orquestar todo el flujo. Si venís del análisis, dbt suele ser el paso más natural y de aprendizaje más rápido.
¿Cuánto tiempo lleva construir el primer pipeline propio?
Un pipeline simple —una API pública, transformación en SQL, ejecución diaria programada— es alcanzable en dos a cuatro semanas si ya manejás SQL y Python básico. Lo que lleva más tiempo no es construirlo: es hacerlo robusto frente a fallas.
¿Un analista de datos necesita entender de pipelines?
Cada vez más. Entender de dónde viene cada tabla y con qué frecuencia se actualiza permite diagnosticar por qué un número cambió y evita conclusiones erróneas por datos incompletos. Es además el camino natural hacia roles de analytics engineering, que suelen estar mejor pagos.

Sobre el autor
Soy Dan Patiño, responsable de AI Strategy & Innovation en Coderhouse. Mi día a día consiste en fusionar la gestión táctica del e-commerce (CRO, Email Marketing y SEO) con el desarrollo de soluciones disruptivas. Me especializo en crear apps internas con IA para automatizar tareas y potenciar la innovación dentro del equipo. Creo fielmente que la tecnología es el mejor aliado de la estrategia. Para profundizar en mi recorrido profesional, te espero en mi perfil de LinkedIn.
