Skip to content

Latest commit

 

History

History
233 lines (192 loc) · 13.9 KB

File metadata and controls

233 lines (192 loc) · 13.9 KB

Machine Learning con Python

1er Semestre 2026

Python Google Colab Pandas NumPy Matplotlib Seaborn scikit-learn

🤝 Apoyar este proyecto · 🏠 Volver al inicio del repositorio


Este directorio reúne cuadernos Colab creados como material de apoyo para un recorrido introductorio de Machine Learning con Python.

Estado del material: curso finalizado. Los cuadernos se conservan como recursos de consulta y práctica.

El material fue pensado para estudiantes que tenian una base inicial en Python y cierto contacto previo con el trabajo con datos usando Pandas. A partir de esa base, los cuadernos avanzan hacia la preparación de datasets, la división de datos, el entrenamiento de modelos, la evaluación de resultados y la comparación entre distintas técnicas de aprendizaje automático.

Este recorrido tiene un objetivo específico: introducir los principales conceptos y procedimientos del machine learning supervisado y no supervisado mediante ejemplos prácticos en Google Colab.

Cada notebook combina explicación conceptual, código Python, análisis de salidas y comentarios sobre la interpretación de los resultados. El foco no se puso únicamente en ejecutar modelos, sino también en comprender qué problema estamos resolviendo, qué decisiones tomamos durante el proceso y cómo evaluar si un modelo es adecuado.

Se trabajaron modelos de regresión, clasificación y clustering. También se incorporaron herramientas habituales del flujo de trabajo en machine learning, como partición de datos, validación cruzada, métricas de evaluación, pipelines y búsqueda de hiperparámetros.


Índice de contenidos

Imagen del Cuaderno 1 Cuaderno 1 · Introducción al Machine Learning

Introducción al Machine Learning: analizando el dataset

Este primer cuaderno presenta una aproximación inicial al trabajo con datasets en el contexto de machine learning. Se parte del análisis de los datos para comprender su estructura, sus variables y su posible utilidad para construir modelos.
Imagen del Cuaderno 2 Cuaderno 2 · Repaso de herramientas para análisis de datos

Repaso de Pandas, Matplotlib, Seaborn y Plotly

Este cuaderno recupera herramientas fundamentales para explorar y visualizar datos antes de entrenar modelos. Incluye operaciones con Pandas y visualizaciones con bibliotecas habituales del ecosistema Python.
Imagen del Cuaderno 3 Cuaderno 3 · Transformación de datos

Transformación de datos: el primer paso hacia el modelo

Se trabaja sobre la preparación de los datos antes del modelado. El objetivo es mostrar que un modelo no se entrena directamente sobre cualquier tabla, sino sobre datos organizados y transformados de acuerdo con el problema a resolver.
Imagen del Cuaderno 4 Cuaderno 4 · División de datos y validación cruzada

División de datos y validación cruzada

Este cuaderno introduce la separación entre datos de entrenamiento y datos de prueba, junto con la idea de validación cruzada. Se busca evitar evaluaciones engañosas y construir una mirada más confiable sobre el rendimiento de los modelos.
Imagen del Cuaderno 5 Cuaderno 5 · Regresión lineal y evaluación de modelos

Regresión lineal y métricas de evaluación: MAE, MSE, RMSE y R²

Se presenta un primer modelo supervisado de regresión. Además de entrenar el modelo, se trabajan métricas de evaluación que permiten interpretar la magnitud de los errores y la calidad general de las predicciones.
Imagen del Cuaderno 6 Cuaderno 6 · Regresión logística y clasificación

Regresión logística y evaluación de clasificadores

Este cuaderno introduce un modelo de clasificación y las métricas utilizadas para evaluar clasificadores. Se trabaja con conceptos como matriz de confusión, accuracy, precision, recall y F1-score.
Imagen del Cuaderno 7 Cuaderno 7 · Clasificación con KNN

Clasificación con KNN (K-Nearest Neighbors)

Se aborda el algoritmo KNN como modelo de clasificación basado en cercanía entre observaciones. El cuaderno permite analizar la importancia de la escala de las variables y el efecto de elegir distintos valores de k.
Imagen del Cuaderno 8 Cuaderno 8 · Árboles de decisión y Random Forest

Árboles de decisión y Random Forest

Este cuaderno presenta modelos basados en árboles. Se trabaja la diferencia entre un árbol individual y un ensamble como Random Forest, junto con ideas como profundidad, sobreajuste, importancia de variables y comparación de desempeño.
Imagen del Cuaderno 9A Cuaderno 9A · Introducción al clustering

Introducción al clustering con K-Means

Introducción al aprendizaje no supervisado mediante el algoritmo K-Means, utilizando datos preparados para comprender la lógica del algoritmo y la formación de grupos.
Imagen del Cuaderno 9B Cuaderno 9B · K-Means con datos reales

K-Means en datos reales: cuando el clustering ayuda, pero no alcanza

Aplicación de K-Means sobre datos reales para analizar cómo puede ayudar el clustering y reconocer las limitaciones que aparecen cuando los grupos no están claramente separados.
Imagen del Cuaderno 9C Cuaderno 9C · Segmentación de clientes

Segmentación de clientes con K-Means

Uso de K-Means en un caso de segmentación de clientes, integrando la preparación de los datos, la identificación de grupos y la interpretación de los segmentos obtenidos.
Imagen del Cuaderno 10 Cuaderno 10 · Pipelines y GridSearchCV

Automatización del flujo de trabajo con Pipelines y GridSearchCV

Este cuaderno está orientado a organizar el flujo completo de trabajo mediante pipelines. También introduce la búsqueda de hiperparámetros con GridSearchCV, una herramienta clave para comparar configuraciones de modelos de manera sistemática.
Imagen del Cuaderno 11 Cuaderno 11 · Comparación y evaluación de modelos

Comparación y evaluación de modelos

Se trabaja sobre la comparación entre distintos modelos y métricas. El objetivo es reforzar que no alcanza con entrenar un modelo: también es necesario evaluar resultados, interpretar errores y elegir la alternativa más adecuada para el problema.
Imagen del Cuaderno 12 Cuaderno 12 · Guardar y recuperar un modelo entrenado

Guardar y recuperar un modelo entrenado en scikit-learn

En este mini-cuaderno vamos a entrenar rápidamente un modelo de clasificación y luego veremos cómo guardarlo en un archivo para poder reutilizarlo más adelante sin repetir el entrenamiento.
Imagen del Cuaderno 13 Cuaderno 13 · Exploración y preparación de un dataset clínico

Exploración y preparación de un dataset clínico

Este cuaderno propone trabajar con un dataset de contexto clínico, poniendo el foco en la exploración inicial, la preparación de variables y las decisiones previas al entrenamiento de modelos. Avanza sobre el entrenamiento, la evaluación y la selección de modelos para integrar varias etapas del flujo de trabajo en un caso más completo.

Herramientas principales

A lo largo del recorrido se utilizan principalmente:

  • Python
  • Google Colab
  • Pandas
  • NumPy
  • Matplotlib
  • Seaborn
  • Plotly
  • scikit-learn

También se trabajaron conceptos generales de análisis exploratorio de datos, preparación de datasets, evaluación de modelos y comunicación de resultados. Para profundizar en esos temas, podes mirar los volumenes I y II de Ciencia de Datos con Python.


Relación con otros recorridos del repositorio

Este directorio se relaciona especialmente con las secciones Análisis de Datos con Python y Ciencia de Datos con Python.

La diferencia principal está en el foco. Mientras que otros recorridos se concentran en la manipulación, inspección, limpieza y análisis exploratorio de datos, esta sección utiliza esas herramientas como base para avanzar hacia modelos de machine learning.

Por eso, algunos temas pueden aparecer nuevamente, como Pandas, visualización o preparación de datos, pero aquí se los retoma desde la perspectiva del modelado predictivo y la evaluación de modelos.


Requisitos sugeridos

Para aprovechar mejor estos cuadernos, conviene tener conocimientos básicos de:

  • Sintaxis general de Python
  • Listas, diccionarios y funciones
  • Uso básico de Pandas
  • Lectura e interpretación de tablas
  • Nociones iniciales de gráficos y análisis exploratorio

No es necesario tener experiencia previa en machine learning. El recorrido introduce los conceptos principales de manera gradual.


Autor, licencia y colaboración

Los materiales fueron desarrollados por Ariel Palazzesi y se publican como parte del proyecto VintaBytes.

Volver al principio