Transición Drone FPV con IA: creá un efecto de vuelo entre dos tomas
Ver ebookScikit-learn para no científicos: cómo construir tu primer modelo de machine learning sin hacer un doctorado

Francisco Rhaiel
AI Growth Engineer
Data
Scikit-learn para no científicos: cómo construir tu primer modelo de machine learning sin hacer un doctorado
Publicado el
Construir tu primer modelo de machine learning no requiere un doctorado ni matemáticas avanzadas. Con Python básico y la librería scikit-learn podés armar un clasificador funcional en cinco pasos. Esta guía te lleva de la mano, pensada para analistas que nunca entrenaron un modelo.
Si ya manejás planillas, filtros y algo de Python, estás más cerca de lo que creés. Machine learning, en esencia, es enseñarle a un programa a reconocer patrones en datos para hacer predicciones. scikit-learn se encarga de la matemática pesada; vos te concentrás en preparar los datos y leer los resultados.
Qué necesitás antes de empezar
Python instalado (o un entorno como Google Colab, que corre en el navegador sin instalar nada).
Las librerías scikit-learn, pandas y numpy.
Un dataset: para practicar sirven los que trae scikit-learn, como el clásico dataset de flores Iris, o datasets públicos de plataformas como Kaggle.
La documentación oficial de scikit-learn es una de las mejores del ecosistema y conviene tenerla a mano.
Los 5 pasos para tu primer modelo
1. Cargar los datos
Importás el dataset y lo mirás con pandas para entender qué columnas tenés. En ML, las columnas de entrada se llaman features y la que querés predecir es el target.
2. Separar entrenamiento y prueba
Dividís los datos en dos grupos: uno para entrenar el modelo y otro para evaluarlo. La función train_test_split lo hace en una línea. Esto evita el error más común: evaluar el modelo con los mismos datos que usó para aprender.
3. Elegir y entrenar el modelo
Para empezar, un clasificador simple como RandomForestClassifier o LogisticRegression funciona muy bien. Entrenar es literalmente llamar al método .fit() con tus datos de entrenamiento.
4. Hacer predicciones
Con .predict() el modelo clasifica los datos de prueba que nunca vio. Acá empieza lo interesante: ver si acierta.
5. Evaluar el resultado
Medís la accuracy (porcentaje de aciertos) y revisás una matriz de confusión para ver en qué se equivoca. Si el resultado no convence, volvés a ajustar features o probás otro modelo.
Errores típicos que conviene evitar
Datos sucios: valores faltantes o formatos inconsistentes arruinan cualquier modelo. La limpieza es el 80% del trabajo.
Evaluar con datos de entrenamiento: da resultados engañosamente buenos.
Buscar el modelo perfecto de entrada: mejor un modelo simple que funcione que uno complejo que no entendés.
Una vez que tengas tu modelo, comunicar los resultados es tan importante como construirlo: sobre eso escribimos en herramientas de visualización de datos para empresas.
Cursos recomendados de Coderhouse
Curso de Python: la base para todo lo que hagas en data science.
Curso de Data Analytics: para analizar y modelar datos con criterio.
Curso de SQL: porque antes de modelar hay que saber extraer y preparar los datos.
Preguntas frecuentes
¿Necesito saber matemáticas avanzadas para usar scikit-learn?
No para empezar. scikit-learn abstrae la matemática compleja. Entender conceptos básicos de estadística ayuda a interpretar resultados, pero no es un requisito para tu primer modelo.
¿Qué dataset conviene usar para practicar?
Los datasets que vienen con scikit-learn, como Iris o el de dígitos, son ideales porque están limpios y bien documentados. Después podés pasar a datos reales de tu trabajo.
¿Cuánto tarda en armarse un primer modelo?
Con los datos ya preparados, el código de un modelo básico se escribe en menos de una hora. Lo que más tiempo lleva siempre es limpiar y entender los datos.
¿scikit-learn sirve para proyectos reales o solo para aprender?
Sirve para ambos. Muchísimas empresas usan scikit-learn en producción para modelos de clasificación, regresión y segmentación. Es una herramienta profesional, no solo educativa.

Sobre el autor
Soy Francisco Rhaiel, AI Growth Engineer en Coderhouse. Mi día a día consiste en automatizar y optimizar procesos aplicando lo último en inteligencia artificial, incluyendo Agentic AI y Gen AI. Soy graduado de la Universidad Torcuato Di Tella (UTDT) en Tecnología Digital, y mi recorrido me llevó a especializarme en la intersección entre tecnología, datos y negocio. Me mueve aprender, construir y aplicar tecnologías innovadoras para resolver problemas reales. Para profundizar en mi trayectoria, te espero en mi perfil de LinkedIn.
