CODER SALE 💥

Aprovecha hasta 35% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

|

Hasta el 23/08 ⏰

CODER SALE 💥

Aprovecha hasta 35% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

|

Hasta el 23/08 ⏰

Hasta el 23/08 ⏰

CODER SALE 💥

Aprovecha hasta 35% OFF y hasta 12 cuotas sin interés en CURSOS y CARRERAS

La guía completa de Pandas: del DataFrame básico al análisis avanzado para analistas de datos

Tutoriales gratuitos

Aprendécreando

Guías prácticas y gratuitas para incorporar nuevas herramientas de IA a tu trabajo.

Transición Drone FPV con IA: creá un efecto de vuelo entre dos tomas

Ver ebook

Tareas programadas en ChatGPT: automatizá tus recordatorios diarios

Ver ebook

Efecto café antigravedad: creá una foto con el líquido suspendido

Ver ebook
ChatGPTClaudeVeo 3Nano BananaMidjourney
Ver tutoriales

Francisco Rhaiel

AI Growth Engineer

Data

La guía completa de Pandas: del DataFrame básico al análisis avanzado para analistas de datos

Publicado el

Pandas es la librería que convierte a Python en una herramienta de análisis de datos. Con ella se cargan, limpian, transforman y analizan tablas de millones de filas con unas pocas líneas de código. Esta guía recorre los cuatro bloques que hay que dominar: estructuras básicas, transformación, limpieza y análisis exploratorio.

La razón por la que un analista aprende Pandas es simple: hay un techo en lo que se puede hacer con una planilla. Ese techo aparece cuando el archivo tiene más filas de las que abre Excel, cuando el mismo proceso de limpieza hay que repetirlo todos los lunes, o cuando la lógica de transformación es demasiado compleja para sostenerla con fórmulas anidadas. Pandas resuelve los tres casos.

Dos referencias para tener abiertas mientras estudiás: la documentación oficial de Pandas, que es de las mejores del ecosistema Python, y la guía 10 minutes to pandas, un recorrido rápido por las operaciones más usadas que sirve como repaso permanente.

Bloque 1 — Series y DataFrames: las dos estructuras

Todo en Pandas gira alrededor de dos objetos:

  • Series: una columna. Un array de valores con un índice asociado.

  • DataFrame: una tabla. Un conjunto de Series que comparten índice.

El índice es el concepto que más confunde al principio y el que más problemas evita cuando se entiende. No es un número de fila cualquiera: es una etiqueta que Pandas usa para alinear datos automáticamente en operaciones entre tablas. Si sumás dos Series con índices distintos, Pandas alinea por índice, no por posición.

Para cargar datos, las funciones de lectura cubren casi todo lo que vas a necesitar: archivos CSV y Excel, JSON, consultas SQL directas contra una base y datos desde una API. Al leer un CSV, tres parámetros que conviene usar desde el principio:

  • sep — separador. En archivos de la región suele ser punto y coma, no coma.

  • parse_dates — indicar qué columnas son fechas al cargar evita horas de conversión posterior.

  • dtype — forzar el tipo de columnas que parecen números pero no lo son, como códigos postales o números de documento con ceros a la izquierda.

Lo primero que hay que hacer después de cargar, siempre: revisar la forma de la tabla, los tipos de dato de cada columna, las primeras filas y un resumen estadístico. Cinco líneas que ahorran errores de interpretación durante todo el análisis.

Bloque 2 — Filtros, agrupaciones y merges

Selección y filtrado

Hay dos formas de acceder a los datos y conviene usarlas bien desde el principio: loc selecciona por etiqueta y iloc por posición numérica. Mezclarlas es la fuente número uno de errores silenciosos en scripts de análisis.

El filtrado por condición usa máscaras booleanas: se escribe la condición, Pandas genera una serie de verdaderos y falsos, y se usa para quedarse con las filas que cumplen. Para condiciones múltiples, cada una va entre paréntesis y se combinan con los operadores de ampersand y barra vertical. Cuando el filtro tiene tres o más condiciones encadenadas, conviene el método query, que se lee bastante mejor.

Agrupaciones

La operación groupby sigue una lógica de tres pasos: dividir la tabla en grupos según una o más columnas, aplicar una función de agregación a cada grupo y combinar los resultados. Es la operación más usada del día a día de un analista.

Tres variantes que conviene dominar:

  • Agregación simple: total de ventas por región.

  • Agregaciones múltiples: por región, la suma, el promedio y el conteo, todo en una sola operación con nombres de columna definidos por vos.

  • Transform: devuelve un resultado del mismo tamaño que la tabla original. Sirve para calcular, por ejemplo, cuánto representa cada venta sobre el total de su región sin perder el detalle.

La tabla pivote cumple una función parecida a la de las planillas y es la forma más rápida de armar un cruce de dos dimensiones para revisar rápido.

Merges y concatenaciones

Combinar tablas es donde más se rompe un análisis. Cuatro tipos de unión: interna (solo coincidencias), izquierda (todas las filas de la primera), derecha y externa (todo). La izquierda es la más usada, porque normalmente querés conservar la tabla principal y enriquecerla.

La regla de oro: verificá la cantidad de filas antes y después de cada merge. Si el resultado tiene más filas que la tabla original, hay duplicados en la clave de unión y tu total está inflado. Este chequeo de una línea evita el error más caro y más frecuente del análisis de datos.

Bloque 3 — Limpieza de datos y manejo de nulos

En un proyecto real, esta etapa se lleva la mayor parte del tiempo. Las decisiones importantes:

  • Detectar nulos y, sobre todo, entender por qué faltan. No es lo mismo un dato ausente al azar que uno que falta sistemáticamente en un segmento: en el segundo caso, cualquier promedio va a estar sesgado.

  • Decidir qué hacer: eliminar filas solo si son pocas y la ausencia es aleatoria; imputar con mediana cuando hay valores extremos; imputar con el valor anterior en series temporales; o dejar el nulo explícito cuando "no hay dato" es información en sí misma.

  • Duplicados: antes de eliminarlos, verificá qué columnas definen la unicidad. Dos transacciones con el mismo monto el mismo día pueden ser legítimas.

  • Normalización de texto: espacios sobrantes, mayúsculas inconsistentes y acentos generan categorías fantasma. "Buenos Aires", "buenos aires" y "Buenos Aires " son tres categorías distintas para Pandas.

  • Tipos de dato: convertir fechas y números que llegaron como texto. Las columnas categóricas con pocos valores únicos conviene convertirlas al tipo categoría: reduce mucho el uso de memoria en tablas grandes.

  • Outliers: detectarlos con el rango intercuartílico y decidir caso por caso. Un valor extremo puede ser un error de carga o el dato más importante del dataset.

Una práctica que separa el trabajo profesional del improvisado: escribir la limpieza como una secuencia de pasos encadenados y reproducibles, no como celdas sueltas ejecutadas en cualquier orden. Cuando el dato se actualice el mes que viene, vas a correr el mismo proceso en segundos.

Bloque 4 — Análisis exploratorio completo

El análisis exploratorio no es una lista de funciones sino una secuencia de preguntas:

  1. ¿Qué tengo? Dimensiones, tipos, período cubierto, granularidad de cada fila.

  2. ¿Está completo? Nulos por columna, huecos en la serie temporal, categorías inesperadas.

  3. ¿Cómo se distribuye? Medidas de tendencia central y dispersión. Comparar promedio y mediana revela asimetría al instante.

  4. ¿Qué se relaciona con qué? Correlaciones entre variables numéricas y comparación de métricas entre segmentos.

  5. ¿Cómo evoluciona? Agrupación temporal por mes o semana, promedios móviles y variaciones respecto al período anterior.

  6. ¿Qué llama la atención? Valores extremos, quiebres bruscos, categorías con comportamiento distinto al resto.

Para series temporales, Pandas tiene dos herramientas que valen su peso en oro: el remuestreo, que cambia la granularidad temporal de diaria a mensual con una línea, y las ventanas móviles, que suavizan el ruido y hacen visible la tendencia.

Errores frecuentes que conviene evitar

  • Encadenar indexaciones. Modificar un DataFrame accediendo con dos corchetes seguidos genera advertencias y comportamientos impredecibles. Usá loc en un solo paso.

  • Iterar fila por fila. Recorrer un DataFrame con un bucle es órdenes de magnitud más lento que usar operaciones vectorizadas. Si escribiste un for sobre filas, casi siempre hay una alternativa mucho mejor.

  • No verificar después del merge. Ya mencionado, y vale repetirlo porque es el error más costoso.

  • Promediar promedios. El promedio de los promedios por grupo no es el promedio general si los grupos tienen tamaños distintos.

  • Trabajar sin copia. Modificar un subconjunto sin copiarlo explícitamente puede alterar la tabla original sin que te des cuenta.

Un proyecto de práctica que sirve de portafolio

Tomá un dataset público de tu país —datos de comercio exterior, movilidad urbana, precios o empleo— y recorré el ciclo completo: carga, exploración inicial, limpieza documentada, tres preguntas de negocio respondidas con agrupaciones, dos visualizaciones y una conclusión de un párrafo con recomendación accionable. Ese notebook, bien comentado, vale más en una entrevista que cualquier certificado. Si querés ver qué otras herramientas complementan bien este stack, en esta guía sobre el primer modelo de machine learning con scikit-learn está el paso siguiente natural.

Cursos recomendados de Coderhouse

  • Nivel inicial — Curso de Python: si todavía no manejás la sintaxis del lenguaje, este es el punto de partida antes de Pandas.

  • Nivel intermedio — Curso de Data Analytics: el ciclo completo de análisis, desde la extracción hasta la comunicación de resultados.

  • Complemento indispensable — Curso de SQL: en la práctica los datos vienen de una base, y filtrar en la base antes de traerlos a Pandas es lo que hace viable trabajar con volúmenes grandes.

  • Recorrido completo — Carrera de Data Science: para quien quiera avanzar hacia modelado y machine learning.

Preguntas frecuentes

¿Hay que saber Python antes de aprender Pandas?

Alcanza con los fundamentos: variables, tipos de dato, listas, diccionarios, funciones y condicionales. No hace falta programación orientada a objetos ni estructuras avanzadas. Con dos o tres semanas de Python básico ya se puede empezar.

¿Pandas reemplaza a Excel?

Los complementa. Excel sigue siendo insuperable para exploración rápida, edición manual y compartir con gente no técnica. Pandas gana cuando hay volumen grande, procesos que se repiten, transformaciones complejas o necesidad de reproducibilidad. Un analista usa las dos según el caso.

¿Hasta qué tamaño de datos funciona bien?

Como referencia práctica, Pandas trabaja cómodo con tablas de hasta unos pocos millones de filas en una computadora estándar, porque carga todo en memoria. Más allá de eso conviene filtrar en la base con SQL antes de traer los datos, o pasar a herramientas pensadas para procesamiento distribuido.

¿Cuánto tiempo lleva aprenderlo?

Con unas seis a ocho horas semanales, en cuatro semanas se cubren los cuatro bloques a nivel funcional. La fluidez real llega después de aplicarlo a tres o cuatro datasets distintos, porque cada conjunto de datos trae problemas de limpieza nuevos.

¿Sirve Pandas si mi objetivo es machine learning?

Es requisito previo. Todo el trabajo de preparación de datos —limpieza, creación de variables, división de conjuntos— se hace con Pandas antes de entrenar cualquier modelo. En proyectos reales, esa preparación se lleva más tiempo que el modelado en sí.

Sobre el autor

Francisco Rhaiel

Soy Francisco Rhaiel, AI Growth Engineer en Coderhouse. Mi día a día consiste en automatizar y optimizar procesos aplicando lo último en inteligencia artificial, incluyendo Agentic AI y Gen AI. Soy graduado de la Universidad Torcuato Di Tella (UTDT) en Tecnología Digital, y mi recorrido me llevó a especializarme en la intersección entre tecnología, datos y negocio. Me mueve aprender, construir y aplicar tecnologías innovadoras para resolver problemas reales. Para profundizar en mi trayectoria, te espero en mi perfil de LinkedIn.

Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Argentina

© 2026 Coderhouse. Todos los derechos reservados.

Argentina

© 2026 Coderhouse. Todos los derechos reservados.

Argentina

© 2026 Coderhouse. Todos los derechos reservados.

Argentina

© 2026 Coderhouse. Todos los derechos reservados.