
Tomás Cabiche
Chief Growth Officer
Data
De analista a ML Practitioner: la ruta real que siguen los data analysts que migran a machine learning
Publicado el
Si sos data analyst y estás mirando hacia machine learning, la buena noticia es que ya recorriste más de la mitad del camino. La mala es que casi nadie te dice cuál es la mitad que falta, y por eso mucha gente se pierde en cursos de álgebra lineal que nunca va a usar o en tutoriales de modelos que no sabe cómo poner en producción.
Esta es la ruta que siguen en la práctica quienes hacen la transición: qué de lo que ya sabés se transfiere, qué hay que sumar, en qué orden y cómo demostrarlo.
Lo que ya tenés y no valorás lo suficiente
Un analista que llega a machine learning parte con ventajas que un programador puro no tiene:
SQL y manipulación de datos. En un proyecto de ML real, entre el 60% y el 80% del tiempo se va en preparar datos. Ese es exactamente tu terreno.
Entendimiento del negocio. Sabés qué significa cada columna, qué valores son imposibles y qué sesgos tiene la fuente. Un modelo entrenado sin ese contexto aprende basura con mucha precisión.
Criterio estadístico aplicado. Ya interpretás distribuciones, detectás outliers y desconfiás de correlaciones espurias. Es la base de la evaluación de modelos.
Comunicación de resultados. Saber explicar un hallazgo a alguien que no es técnico es una de las habilidades peor distribuidas en equipos de machine learning.
Lo que falta: cuatro bloques concretos
1. Python con foco en datos (4 a 6 semanas)
No necesitás convertirte en desarrollador. Necesitás manejar con soltura pandas para transformación, NumPy para operaciones vectorizadas y matplotlib o seaborn para exploración. Si venís de SQL, el salto conceptual es menor de lo que parece: los GROUP BY se vuelven groupby y los JOIN se vuelven merge.
2. Fundamentos de aprendizaje supervisado (6 a 8 semanas)
El núcleo teórico que sí vas a usar todos los días, y que la documentación de scikit-learn cubre con ejemplos reproducibles:
Separación train/validation/test y por qué mezclarlas invalida todo.
Sobreajuste y regularización: el modelo que aprende de memoria en lugar de generalizar.
Métricas según el problema. Accuracy es engañosa con clases desbalanceadas; precisión, recall, F1 y AUC responden preguntas distintas.
Validación cruzada y por qué un solo split puede mentirte.
Familias de modelos: regresión lineal y logística, árboles, ensambles tipo random forest y gradient boosting. En datos tabulares —que es el 90% de los casos empresariales— el boosting suele ganar.
Un buen punto de entrada práctico es el recorrido que armamos sobre cómo entrenar tu primer modelo con scikit-learn siendo analista.
3. Ingeniería de features y preparación (4 semanas)
Es donde más rinde tu experiencia previa. Codificación de variables categóricas, tratamiento de nulos con criterio de negocio, escalado, manejo de fechas y creación de variables derivadas. Acá está la mayor parte de la mejora real de un modelo, mucho más que en elegir el algoritmo.
4. Puesta en producción básica (4 a 6 semanas)
El diferencial que separa a quien "hizo un curso" de quien puede ocupar el rol:
Versionado de código y de datos.
Empaquetar el modelo como servicio o como proceso batch programado.
Monitoreo de deriva: qué hacés cuando los datos de entrada cambian y el modelo empieza a fallar en silencio.
Reproducibilidad: que otra persona pueda correr tu pipeline y obtener el mismo resultado.
Cronograma realista de la transición
Etapa | Duración con 8-10 h/semana | Resultado verificable |
|---|---|---|
Python para datos | 4 a 6 semanas | Replicar en pandas tres análisis que hoy hacés en SQL |
Aprendizaje supervisado | 6 a 8 semanas | Un modelo de clasificación evaluado correctamente, con baseline |
Feature engineering | 4 semanas | Mejorar una métrica sin cambiar de algoritmo |
Producción y monitoreo | 4 a 6 semanas | Un modelo que corre solo y avisa si algo se rompe |
Proyecto integrador | 4 semanas | Caso completo con datos propios, documentado |
Total: entre 6 y 9 meses de dedicación sostenida. Quienes lo hacen más rápido suelen ser los que aplican lo aprendido en su trabajo actual desde la primera semana.
Los tres proyectos que validan la transición
Un reclutador no evalúa cuántos cursos hiciste. Evalúa si podés resolver un problema de punta a punta. Estos tres proyectos cubren lo que se pregunta en entrevistas:
Predicción con datos de tu industria. Churn, demanda, riesgo crediticio, lo que conozcas. La ventaja de usar tu dominio es que podés defender cada decisión de modelado con argumentos de negocio.
Comparación honesta contra un baseline. Mostrá primero la regla simple —"predecir siempre el promedio", "usar la última compra"— y después cuánto mejora tu modelo. Es la señal más fuerte de madurez técnica.
Un modelo desplegado. Aunque sea una función que corre en la nube y devuelve una predicción por API. Cambia por completo la conversación en una entrevista.
Errores que alargan la transición
Empezar por deep learning. Es la parte más visible y la menos usada en problemas tabulares de empresa. Llegá a redes neuronales después de dominar los ensambles.
Estudiar matemática en abstracto. La intuición de gradiente, distancia y probabilidad alcanza para empezar. La formalización viene sola cuando la necesitás.
Coleccionar notebooks de Kaggle. Los datasets de competencia están limpios y no reflejan el trabajo real. Sirven para practicar algoritmos, no para demostrar que podés resolver un problema desde cero.
No medir el impacto de negocio. Un modelo con 0,92 de AUC que nadie usa vale menos que uno con 0,78 que cambió una decisión operativa. La guía Rules of Machine Learning de Google insiste en el mismo punto: primero una heurística simple en producción, después el modelo sofisticado.
Cursos recomendados de Coderhouse
La ruta se puede recorrer con formaciones escalonadas según desde dónde partas:
Si te falta Python: el Curso de Python cubre el primer bloque completo.
Si querés el marco de data science: el Curso de Fundamentos para la Ciencia de Datos ordena los conceptos antes de entrar a los modelos.
Para el núcleo de machine learning: el Curso de Data Science y Machine Learning aborda algoritmos, evaluación y proyecto aplicado.
Para el recorrido completo: la Carrera de Data Scientist integra las cuatro etapas, incluida la puesta en producción, que es la parte que más cuesta cubrir por cuenta propia.
Preguntas frecuentes
¿Cuánto tiempo tarda un data analyst en pasar a machine learning?
Entre 6 y 9 meses con una dedicación de 8 a 10 horas semanales, si ya manejás SQL y estadística descriptiva. El plazo se acorta bastante cuando podés aplicar lo aprendido en tu trabajo actual, porque cada proyecto real reemplaza semanas de práctica aislada. Quienes empiezan desde cero en programación suelen necesitar entre 12 y 15 meses.
¿Necesito saber mucha matemática para hacer machine learning?
Necesitás intuición, no formalismo. Entender qué significa minimizar un error, por qué escalar variables cambia el resultado y cómo se interpreta una probabilidad alcanza para trabajar con modelos tabulares. El álgebra lineal y el cálculo profundos importan si querés investigar o diseñar arquitecturas nuevas, que no es el caso de la mayoría de los roles aplicados del mercado.
¿Qué diferencia hay entre un data analyst y un ML practitioner?
El analista explica lo que pasó y por qué; el ML practitioner construye sistemas que predicen o deciden de forma automática y repetida. Cambia el entregable: en lugar de un reporte o un tablero, el resultado es un modelo que corre en producción, se monitorea y se reentrena. También cambia la responsabilidad, porque un modelo que se degrada afecta decisiones sin que nadie lo note hasta que es tarde.
¿Conviene la transición si ya tengo un buen puesto como analista?
Depende del tipo de problemas que te interesen, más que del salario. La brecha salarial existe pero es menor de lo que se suele decir en los niveles iniciales, y un analista senior con fuerte criterio de negocio puede ganar lo mismo que un ML practitioner de nivel medio. La razón más sólida para migrar es que te atraiga construir sistemas automáticos en lugar de responder preguntas puntuales.
¿Qué herramienta conviene aprender primero: scikit-learn o una plataforma en la nube?
scikit-learn. Es la biblioteca donde vas a entender qué hace cada paso, con una interfaz consistente que te obliga a pensar en entrenamiento, validación y predicción por separado. Las plataformas gestionadas de la nube automatizan decisiones que conviene entender antes de delegar; una vez que dominás el flujo manual, aprenderlas lleva días.

Sobre el autor
Soy Tomás Cabiche, Chief Growth Officer y Cofundador de Coderhouse. Lidero las áreas de crecimiento y marketing, impulsando la expansión de la compañía y el desarrollo de nuevos productos educativos basados en inteligencia artificial. Mi día a día combina la mirada estratégica del negocio con la ejecución, buscando siempre que la tecnología y los datos estén al servicio del crecimiento. Para conocer más sobre mi recorrido profesional, te espero en mi perfil de LinkedIn.
Artículos destacados
Ver todos los artículos
Guía de Rol
Business Intelligence como carrera: qué hace un BI Analyst, cuánto gana y cómo entrar al sector
Publicado el
Tutorial: Guía Paso a Paso
APIs de IA para principiantes: cómo conectar GPT, Claude y Gemini a tus proyectos
Publicado el
Comparativa de Herramientas
Business Intelligence vs Data Analytics: diferencias clave, herramientas y qué aprender primero en Argentina
Publicado el
Uso de IA
Agentes de IA: qué son, para qué sirven y cómo empezar a usarlos en tu trabajo
Publicado el
Tutorial: Guía Paso a Paso
Claude Cowork vs. ChatGPT: ¿Cuál es la mejor herramienta?
Publicado el
Ruta de Aprendizaje
¿Cómo aprender inteligencia artificial desde cero? Guía Completa
Publicado el

