🤝 Apoyar este proyecto · 🏠 Volver al inicio del repositorio
Este directorio reúne cuadernos Colab creados como material de apoyo para un recorrido introductorio de Machine Learning con Python.
Estado del material: curso finalizado. Los cuadernos se conservan como recursos de consulta y práctica.
El material fue pensado para estudiantes que tenian una base inicial en Python y cierto contacto previo con el trabajo con datos usando Pandas. A partir de esa base, los cuadernos avanzan hacia la preparación de datasets, la división de datos, el entrenamiento de modelos, la evaluación de resultados y la comparación entre distintas técnicas de aprendizaje automático.
Este recorrido tiene un objetivo específico: introducir los principales conceptos y procedimientos del machine learning supervisado y no supervisado mediante ejemplos prácticos en Google Colab.
Cada notebook combina explicación conceptual, código Python, análisis de salidas y comentarios sobre la interpretación de los resultados. El foco no se puso únicamente en ejecutar modelos, sino también en comprender qué problema estamos resolviendo, qué decisiones tomamos durante el proceso y cómo evaluar si un modelo es adecuado.
Se trabajaron modelos de regresión, clasificación y clustering. También se incorporaron herramientas habituales del flujo de trabajo en machine learning, como partición de datos, validación cruzada, métricas de evaluación, pipelines y búsqueda de hiperparámetros.
|
Cuaderno 1 · Introducción al Machine Learning Introducción al Machine Learning: analizando el dataset Este primer cuaderno presenta una aproximación inicial al trabajo con datasets en el contexto de machine learning. Se parte del análisis de los datos para comprender su estructura, sus variables y su posible utilidad para construir modelos. |
|
Cuaderno 2 · Repaso de herramientas para análisis de datos Repaso de Pandas, Matplotlib, Seaborn y Plotly Este cuaderno recupera herramientas fundamentales para explorar y visualizar datos antes de entrenar modelos. Incluye operaciones con Pandas y visualizaciones con bibliotecas habituales del ecosistema Python. |
|
Cuaderno 3 · Transformación de datos Transformación de datos: el primer paso hacia el modelo Se trabaja sobre la preparación de los datos antes del modelado. El objetivo es mostrar que un modelo no se entrena directamente sobre cualquier tabla, sino sobre datos organizados y transformados de acuerdo con el problema a resolver. |
|
Cuaderno 4 · División de datos y validación cruzada División de datos y validación cruzada Este cuaderno introduce la separación entre datos de entrenamiento y datos de prueba, junto con la idea de validación cruzada. Se busca evitar evaluaciones engañosas y construir una mirada más confiable sobre el rendimiento de los modelos. |
|
Cuaderno 5 · Regresión lineal y evaluación de modelos Regresión lineal y métricas de evaluación: MAE, MSE, RMSE y R² Se presenta un primer modelo supervisado de regresión. Además de entrenar el modelo, se trabajan métricas de evaluación que permiten interpretar la magnitud de los errores y la calidad general de las predicciones. |
|
Cuaderno 6 · Regresión logística y clasificación Regresión logística y evaluación de clasificadores Este cuaderno introduce un modelo de clasificación y las métricas utilizadas para evaluar clasificadores. Se trabaja con conceptos como matriz de confusión, accuracy, precision, recall y F1-score. |
|
Cuaderno 7 · Clasificación con KNN Clasificación con KNN (K-Nearest Neighbors) Se aborda el algoritmo KNN como modelo de clasificación basado en cercanía entre observaciones. El cuaderno permite analizar la importancia de la escala de las variables y el efecto de elegir distintos valores de k.
|
|
Cuaderno 8 · Árboles de decisión y Random Forest Árboles de decisión y Random Forest Este cuaderno presenta modelos basados en árboles. Se trabaja la diferencia entre un árbol individual y un ensamble como Random Forest, junto con ideas como profundidad, sobreajuste, importancia de variables y comparación de desempeño. |
|
Cuaderno 9A · Introducción al clustering Introducción al clustering con K-Means Introducción al aprendizaje no supervisado mediante el algoritmo K-Means, utilizando datos preparados para comprender la lógica del algoritmo y la formación de grupos. |
|
Cuaderno 9B · K-Means con datos reales K-Means en datos reales: cuando el clustering ayuda, pero no alcanza Aplicación de K-Means sobre datos reales para analizar cómo puede ayudar el clustering y reconocer las limitaciones que aparecen cuando los grupos no están claramente separados. |
|
Cuaderno 9C · Segmentación de clientes Segmentación de clientes con K-Means Uso de K-Means en un caso de segmentación de clientes, integrando la preparación de los datos, la identificación de grupos y la interpretación de los segmentos obtenidos. |
|
Cuaderno 10 · Pipelines y GridSearchCV Automatización del flujo de trabajo con Pipelines y GridSearchCV Este cuaderno está orientado a organizar el flujo completo de trabajo mediante pipelines. También introduce la búsqueda de hiperparámetros con GridSearchCV, una herramienta clave para comparar configuraciones de modelos de manera sistemática. |
|
Cuaderno 11 · Comparación y evaluación de modelos Comparación y evaluación de modelos Se trabaja sobre la comparación entre distintos modelos y métricas. El objetivo es reforzar que no alcanza con entrenar un modelo: también es necesario evaluar resultados, interpretar errores y elegir la alternativa más adecuada para el problema. |
|
Cuaderno 12 · Guardar y recuperar un modelo entrenado Guardar y recuperar un modelo entrenado en scikit-learn En este mini-cuaderno vamos a entrenar rápidamente un modelo de clasificación y luego veremos cómo guardarlo en un archivo para poder reutilizarlo más adelante sin repetir el entrenamiento. |
|
Cuaderno 13 · Exploración y preparación de un dataset clínico Exploración y preparación de un dataset clínico Este cuaderno propone trabajar con un dataset de contexto clínico, poniendo el foco en la exploración inicial, la preparación de variables y las decisiones previas al entrenamiento de modelos. Avanza sobre el entrenamiento, la evaluación y la selección de modelos para integrar varias etapas del flujo de trabajo en un caso más completo. |
A lo largo del recorrido se utilizan principalmente:
- Python
- Google Colab
- Pandas
- NumPy
- Matplotlib
- Seaborn
- Plotly
- scikit-learn
También se trabajaron conceptos generales de análisis exploratorio de datos, preparación de datasets, evaluación de modelos y comunicación de resultados. Para profundizar en esos temas, podes mirar los volumenes I y II de Ciencia de Datos con Python.
Este directorio se relaciona especialmente con las secciones Análisis de Datos con Python y Ciencia de Datos con Python.
La diferencia principal está en el foco. Mientras que otros recorridos se concentran en la manipulación, inspección, limpieza y análisis exploratorio de datos, esta sección utiliza esas herramientas como base para avanzar hacia modelos de machine learning.
Por eso, algunos temas pueden aparecer nuevamente, como Pandas, visualización o preparación de datos, pero aquí se los retoma desde la perspectiva del modelado predictivo y la evaluación de modelos.
Para aprovechar mejor estos cuadernos, conviene tener conocimientos básicos de:
- Sintaxis general de Python
- Listas, diccionarios y funciones
- Uso básico de Pandas
- Lectura e interpretación de tablas
- Nociones iniciales de gráficos y análisis exploratorio
No es necesario tener experiencia previa en machine learning. El recorrido introduce los conceptos principales de manera gradual.
Los materiales fueron desarrollados por Ariel Palazzesi y se publican como parte del proyecto VintaBytes.
