CODER WEEK 🔥

Aprovecha hasta 60% Dcto y hasta 12 cuotas en CURSOS y CARRERAS

|

Hasta el 16/09 ⏰

CODER WEEK 🔥

Aprovecha hasta 60% Dcto y hasta 12 cuotas en CURSOS y CARRERAS

|

Hasta el 16/09 ⏰

Hasta el 16/09 ⏰

CODER WEEK 🔥

Aprovecha hasta 60% Dcto y hasta 12 cuotas en CURSOS y CARRERAS

Cursos

Empresas

¿Por qué Coder?

De analista a ML Practitioner: la ruta real que siguen los data analysts que migran a machine learning

Tutoriales gratuitos

Descargartutoriales gratuitos

Tutoriales y videos prácticos gratuitos para incorporar nuevas herramientas de IA y empleabilidad.

Ver los tutoriales

Tomás Cabiche

Chief Growth Officer

Data

De analista a ML Practitioner: la ruta real que siguen los data analysts que migran a machine learning

Publicado el

Si sos data analyst y estás mirando hacia machine learning, la buena noticia es que ya recorriste más de la mitad del camino. La mala es que casi nadie te dice cuál es la mitad que falta, y por eso mucha gente se pierde en cursos de álgebra lineal que nunca va a usar o en tutoriales de modelos que no sabe cómo poner en producción.

Esta es la ruta que siguen en la práctica quienes hacen la transición: qué de lo que ya sabés se transfiere, qué hay que sumar, en qué orden y cómo demostrarlo.

Lo que ya tenés y no valorás lo suficiente

Un analista que llega a machine learning parte con ventajas que un programador puro no tiene:

  • SQL y manipulación de datos. En un proyecto de ML real, entre el 60% y el 80% del tiempo se va en preparar datos. Ese es exactamente tu terreno.

  • Entendimiento del negocio. Sabés qué significa cada columna, qué valores son imposibles y qué sesgos tiene la fuente. Un modelo entrenado sin ese contexto aprende basura con mucha precisión.

  • Criterio estadístico aplicado. Ya interpretás distribuciones, detectás outliers y desconfiás de correlaciones espurias. Es la base de la evaluación de modelos.

  • Comunicación de resultados. Saber explicar un hallazgo a alguien que no es técnico es una de las habilidades peor distribuidas en equipos de machine learning.

Lo que falta: cuatro bloques concretos

1. Python con foco en datos (4 a 6 semanas)

No necesitás convertirte en desarrollador. Necesitás manejar con soltura pandas para transformación, NumPy para operaciones vectorizadas y matplotlib o seaborn para exploración. Si venís de SQL, el salto conceptual es menor de lo que parece: los GROUP BY se vuelven groupby y los JOIN se vuelven merge.

2. Fundamentos de aprendizaje supervisado (6 a 8 semanas)

El núcleo teórico que sí vas a usar todos los días, y que la documentación de scikit-learn cubre con ejemplos reproducibles:

  • Separación train/validation/test y por qué mezclarlas invalida todo.

  • Sobreajuste y regularización: el modelo que aprende de memoria en lugar de generalizar.

  • Métricas según el problema. Accuracy es engañosa con clases desbalanceadas; precisión, recall, F1 y AUC responden preguntas distintas.

  • Validación cruzada y por qué un solo split puede mentirte.

  • Familias de modelos: regresión lineal y logística, árboles, ensambles tipo random forest y gradient boosting. En datos tabulares —que es el 90% de los casos empresariales— el boosting suele ganar.

Un buen punto de entrada práctico es el recorrido que armamos sobre cómo entrenar tu primer modelo con scikit-learn siendo analista.

3. Ingeniería de features y preparación (4 semanas)

Es donde más rinde tu experiencia previa. Codificación de variables categóricas, tratamiento de nulos con criterio de negocio, escalado, manejo de fechas y creación de variables derivadas. Acá está la mayor parte de la mejora real de un modelo, mucho más que en elegir el algoritmo.

4. Puesta en producción básica (4 a 6 semanas)

El diferencial que separa a quien "hizo un curso" de quien puede ocupar el rol:

  • Versionado de código y de datos.

  • Empaquetar el modelo como servicio o como proceso batch programado.

  • Monitoreo de deriva: qué hacés cuando los datos de entrada cambian y el modelo empieza a fallar en silencio.

  • Reproducibilidad: que otra persona pueda correr tu pipeline y obtener el mismo resultado.

Cronograma realista de la transición

Etapa

Duración con 8-10 h/semana

Resultado verificable

Python para datos

4 a 6 semanas

Replicar en pandas tres análisis que hoy hacés en SQL

Aprendizaje supervisado

6 a 8 semanas

Un modelo de clasificación evaluado correctamente, con baseline

Feature engineering

4 semanas

Mejorar una métrica sin cambiar de algoritmo

Producción y monitoreo

4 a 6 semanas

Un modelo que corre solo y avisa si algo se rompe

Proyecto integrador

4 semanas

Caso completo con datos propios, documentado

Total: entre 6 y 9 meses de dedicación sostenida. Quienes lo hacen más rápido suelen ser los que aplican lo aprendido en su trabajo actual desde la primera semana.

Los tres proyectos que validan la transición

Un reclutador no evalúa cuántos cursos hiciste. Evalúa si podés resolver un problema de punta a punta. Estos tres proyectos cubren lo que se pregunta en entrevistas:

  • Predicción con datos de tu industria. Churn, demanda, riesgo crediticio, lo que conozcas. La ventaja de usar tu dominio es que podés defender cada decisión de modelado con argumentos de negocio.

  • Comparación honesta contra un baseline. Mostrá primero la regla simple —"predecir siempre el promedio", "usar la última compra"— y después cuánto mejora tu modelo. Es la señal más fuerte de madurez técnica.

  • Un modelo desplegado. Aunque sea una función que corre en la nube y devuelve una predicción por API. Cambia por completo la conversación en una entrevista.

Errores que alargan la transición

  • Empezar por deep learning. Es la parte más visible y la menos usada en problemas tabulares de empresa. Llegá a redes neuronales después de dominar los ensambles.

  • Estudiar matemática en abstracto. La intuición de gradiente, distancia y probabilidad alcanza para empezar. La formalización viene sola cuando la necesitás.

  • Coleccionar notebooks de Kaggle. Los datasets de competencia están limpios y no reflejan el trabajo real. Sirven para practicar algoritmos, no para demostrar que podés resolver un problema desde cero.

  • No medir el impacto de negocio. Un modelo con 0,92 de AUC que nadie usa vale menos que uno con 0,78 que cambió una decisión operativa. La guía Rules of Machine Learning de Google insiste en el mismo punto: primero una heurística simple en producción, después el modelo sofisticado.

Cursos recomendados de Coderhouse

La ruta se puede recorrer con formaciones escalonadas según desde dónde partas:

Preguntas frecuentes

¿Cuánto tiempo tarda un data analyst en pasar a machine learning?

Entre 6 y 9 meses con una dedicación de 8 a 10 horas semanales, si ya manejás SQL y estadística descriptiva. El plazo se acorta bastante cuando podés aplicar lo aprendido en tu trabajo actual, porque cada proyecto real reemplaza semanas de práctica aislada. Quienes empiezan desde cero en programación suelen necesitar entre 12 y 15 meses.

¿Necesito saber mucha matemática para hacer machine learning?

Necesitás intuición, no formalismo. Entender qué significa minimizar un error, por qué escalar variables cambia el resultado y cómo se interpreta una probabilidad alcanza para trabajar con modelos tabulares. El álgebra lineal y el cálculo profundos importan si querés investigar o diseñar arquitecturas nuevas, que no es el caso de la mayoría de los roles aplicados del mercado.

¿Qué diferencia hay entre un data analyst y un ML practitioner?

El analista explica lo que pasó y por qué; el ML practitioner construye sistemas que predicen o deciden de forma automática y repetida. Cambia el entregable: en lugar de un reporte o un tablero, el resultado es un modelo que corre en producción, se monitorea y se reentrena. También cambia la responsabilidad, porque un modelo que se degrada afecta decisiones sin que nadie lo note hasta que es tarde.

¿Conviene la transición si ya tengo un buen puesto como analista?

Depende del tipo de problemas que te interesen, más que del salario. La brecha salarial existe pero es menor de lo que se suele decir en los niveles iniciales, y un analista senior con fuerte criterio de negocio puede ganar lo mismo que un ML practitioner de nivel medio. La razón más sólida para migrar es que te atraiga construir sistemas automáticos en lugar de responder preguntas puntuales.

¿Qué herramienta conviene aprender primero: scikit-learn o una plataforma en la nube?

scikit-learn. Es la biblioteca donde vas a entender qué hace cada paso, con una interfaz consistente que te obliga a pensar en entrenamiento, validación y predicción por separado. Las plataformas gestionadas de la nube automatizan decisiones que conviene entender antes de delegar; una vez que dominás el flujo manual, aprenderlas lleva días.

Sobre el autor

Tomás Cabiche

Soy Tomás Cabiche, Chief Growth Officer y Cofundador de Coderhouse. Lidero las áreas de crecimiento y marketing, impulsando la expansión de la compañía y el desarrollo de nuevos productos educativos basados en inteligencia artificial. Mi día a día combina la mirada estratégica del negocio con la ejecución, buscando siempre que la tecnología y los datos estén al servicio del crecimiento. Para conocer más sobre mi recorrido profesional, te espero en mi perfil de LinkedIn.

Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.
Imagen promocionando quiz gratis de Coderhouse para encontrar tu formación.