Transición Drone FPV con IA: creá un efecto de vuelo entre dos tomas
Ver ebookAutoML: qué es, cómo funciona y cómo entrenar modelos de machine learning sin saber programar

Dan Patiño
AI Strategy & Innovation en Coderhouse
Inteligencia Artificial
AutoML: qué es, cómo funciona y cómo entrenar modelos de machine learning sin saber programar
Publicado el
AutoML permite entrenar modelos de machine learning sin escribir código: cargás los datos, elegís qué querés predecir y la plataforma prueba automáticamente decenas de algoritmos y configuraciones hasta encontrar el mejor. Sirve muy bien para problemas tabulares estándar y se queda corto cuando el problema es raro, los datos están sucios o necesitás explicar cada decisión del modelo.
Esta guía explica qué es AutoML, cómo funciona por dentro, qué herramientas existen, qué puede y qué no puede hacer, y en qué momento conviene aprender machine learning tradicional en lugar de delegarlo a una plataforma.
Qué es AutoML
AutoML (Automated Machine Learning) automatiza las etapas más tediosas y repetitivas del proceso de construir un modelo predictivo. Lo que antes exigía un científico de datos probando manualmente algoritmos y ajustando parámetros, hoy lo resuelve un sistema que explora el espacio de posibilidades por su cuenta.
Si todavía no tenés claro el concepto de fondo, conviene empezar por esta explicación de qué es el machine learning y para qué sirve, porque AutoML automatiza el proceso pero no cambia la lógica subyacente.
Qué automatiza exactamente
Preprocesamiento: detección de tipos de dato, tratamiento de valores nulos, codificación de variables categóricas y normalización de escalas.
Ingeniería de atributos: generación de variables derivadas, como extraer día de la semana de una fecha o combinar columnas.
Selección de algoritmo: prueba regresión logística, árboles, random forest, gradient boosting y redes neuronales sobre los mismos datos.
Ajuste de hiperparámetros: busca la combinación óptima de configuración para cada algoritmo.
Validación: divide los datos en entrenamiento y prueba, y compara los modelos con métricas estándar.
El resultado es un ranking de modelos con su performance, y en la mayoría de las plataformas, la posibilidad de desplegar el ganador como una API en un clic.
Las herramientas principales
Herramienta | Tipo | Ideal para |
|---|---|---|
Vertex AI (Google Cloud) | Cloud, paga | Datos tabulares, imágenes y texto sin escribir código |
H2O AutoML | Open source + versión enterprise | Equipos que quieren control y explicabilidad |
AutoKeras | Open source (Python) | Deep learning sobre imágenes y texto |
Azure Automated ML | Cloud, paga | Organizaciones con stack Microsoft |
PyCaret | Open source (Python) | Prototipado rápido en notebooks |
Vertex AI unificó los productos de AutoML de Google en una sola plataforma. Permite entrenar sobre datos tabulares o imágenes sin escribir código ni preparar las particiones de datos, y desplegar el modelo para inferencia online o por lotes, según el análisis técnico de plataformas AutoML de AltexSoft.
La guía oficial de Vertex AI para principiantes es un buen punto de entrada si querés probar la plataforma sin experiencia previa en modelado.
H2O.ai es usada por más de 20.000 empresas y hace foco en la interpretabilidad: ofrece técnicas visuales para explicar por qué el modelo llegó a determinada predicción, algo clave en sectores regulados como banca y salud.
AutoKeras está construido sobre Keras y apunta a deep learning automatizado. Al ser open source y gratuito, es la puerta de entrada más accesible para trabajar con datos no estructurados como imágenes y texto.
Qué puede hacer bien AutoML
Clasificación binaria: predecir si un cliente va a darse de baja, si una transacción es fraudulenta, si un lead va a convertir.
Clasificación multiclase: categorizar tickets de soporte, clasificar productos, segmentar clientes en grupos predefinidos.
Regresión: estimar el precio de un inmueble, proyectar demanda, predecir el valor de vida de un cliente.
Series temporales: proyectar ventas o consumo con estacionalidad.
Establecer un baseline: incluso los equipos técnicos lo usan para saber rápido qué performance es alcanzable antes de invertir semanas en un modelo a medida.
Qué NO puede hacer
Acá está el punto que las plataformas no publicitan:
No arregla datos malos. Si tu dataset tiene sesgos, filtraciones de información futura o etiquetas mal cargadas, AutoML va a producir un modelo con métricas excelentes que falla en producción. Ese es el error más caro y más frecuente.
No define el problema. Decidir qué predecir, con qué horizonte temporal y qué métrica optimizar es una decisión de negocio que ninguna herramienta toma por vos.
No entiende el contexto. Un modelo que predice bajas de clientes usando "canceló la suscripción el mes pasado" como variable tiene 99% de precisión y cero utilidad.
No maneja bien problemas atípicos. Sistemas de recomendación complejos, procesamiento de lenguaje específico de un dominio o datos con estructura de grafo requieren enfoques a medida.
No garantiza explicabilidad total. Algunas plataformas ofrecen herramientas de interpretación, pero si tenés que justificar cada decisión ante un regulador, un modelo simple y entendible suele ser mejor que el más preciso.
Cuándo conviene aprender machine learning tradicional
AutoML es una excelente puerta de entrada, no un reemplazo del conocimiento. Necesitás bajar al detalle cuando:
El modelo tiene que integrarse en un producto con requisitos de latencia o costo muy específicos.
Los datos requieren transformaciones que dependen del dominio y que ninguna heurística automática va a descubrir.
Tenés que diagnosticar por qué el modelo falla con cierto segmento de usuarios.
Trabajás en un contexto regulado donde hay que documentar y defender cada decisión metodológica.
Querés trabajar profesionalmente de esto: las entrevistas técnicas preguntan por los fundamentos, no por qué botón apretar.
La ruta más razonable es intermedia: usá AutoML para validar rápido si un problema es resoluble con los datos que tenés, y aprendé los fundamentos para poder auditar el resultado. Si querés dar ese paso, esta guía para entrenar tu primer modelo de machine learning con scikit-learn es un buen punto de arranque práctico.
Cómo empezar con AutoML esta semana
Elegí un problema concreto y medible. "Predecir qué clientes no van a renovar el próximo mes" funciona; "usar IA para mejorar el negocio" no.
Armá una tabla plana. Una fila por caso, una columna por variable, y una columna con lo que querés predecir. Mínimo unos cientos de casos históricos.
Revisá filtraciones. Sacá toda columna que en el momento real de la predicción todavía no exista. Este chequeo es el que más errores evita.
Entrená y leé las métricas. No mires solo la precisión general: revisá cómo se comporta el modelo en la clase minoritaria, que suele ser la que te importa.
Validá contra la realidad. Antes de automatizar decisiones, corré el modelo en paralelo durante unas semanas y compará sus predicciones con lo que efectivamente pasó.
Cursos recomendados de Coderhouse
Estos programas cubren el recorrido desde entender los conceptos hasta construir modelos propios:
Curso de Introducción a la Inteligencia Artificial — nivel inicial, ideal para entender qué puede y qué no puede hacer un modelo antes de usar cualquier plataforma.
Curso de Data Analytics — nivel intermedio, para dominar la preparación de datos, que es donde se juega el 80% del resultado.
Carrera de Data Scientist — el recorrido completo hacia el rol, con machine learning tradicional y proyectos aplicados.
Curso de AI Engineering — nivel avanzado, para llevar modelos a producción con evaluación y monitoreo.
Preguntas frecuentes
¿AutoML reemplaza a los científicos de datos?
No. Automatiza la parte mecánica del proceso —probar algoritmos y ajustar parámetros— pero no la parte que define el resultado: entender el negocio, elegir qué predecir, preparar los datos y validar que el modelo sirva en el mundo real. Lo que hace es liberar tiempo del profesional para esas tareas de mayor valor.
¿Es realmente gratis usar AutoML?
Depende. Las bibliotecas open source como AutoKeras, PyCaret o H2O AutoML son gratuitas, pero corren en tu máquina o en tu infraestructura. Las plataformas cloud cobran por tiempo de cómputo de entrenamiento y por predicción, así que un experimento largo sobre un dataset grande puede tener un costo relevante. Fijá presupuesto antes de entrenar.
¿Cuántos datos necesito para entrenar un modelo con AutoML?
Como referencia práctica, para un problema tabular de clasificación conviene tener al menos unos cientos de casos de la clase minoritaria y varios miles de filas en total. Con menos, el modelo va a memorizar en lugar de generalizar. La calidad y representatividad de los datos importa más que la cantidad absoluta.
¿Puedo confiar en el modelo que me da la plataforma?
Solo después de validarlo vos. Las métricas de entrenamiento suelen ser optimistas porque el modelo se evalúa sobre datos parecidos a los que vio. La prueba real es medirlo sobre datos de un período posterior al de entrenamiento y ver si mantiene la performance. Si cae fuerte, hay algo mal en cómo se armó el dataset.
¿Sirve AutoML para perfiles de negocio sin conocimientos técnicos?
Sirve para explorar y para generar hipótesis, siempre que el resultado lo revise alguien que entienda de datos. El riesgo de usarlo sin criterio no es que no funcione, sino que funcione aparentemente bien y se tomen decisiones sobre un modelo mal construido. Lo más sano es que un perfil de negocio lo use para prototipar y valide el resultado con alguien técnico.

Sobre el autor
Soy Dan Patiño, responsable de AI Strategy & Innovation en Coderhouse. Mi día a día consiste en fusionar la gestión táctica del e-commerce (CRO, Email Marketing y SEO) con el desarrollo de soluciones disruptivas. Me especializo en crear apps internas con IA para automatizar tareas y potenciar la innovación dentro del equipo. Creo fielmente que la tecnología es el mejor aliado de la estrategia. Para profundizar en mi recorrido profesional, te espero en mi perfil de LinkedIn.
