Repositorio de estudio estructurado para el ciclo de formacion en Data Analytics con Python. Cubre el pipeline completo: Python -> NumPy/Pandas -> Carga -> Calidad -> Limpieza -> Transformacion -> Agregacion -> Integracion.
Proyecto Final (Google Colab): https://colab.research.google.com/drive/1qv4klCks0t83VMc_nXEexNzi2EEnZnrZ
data-analysis/
|
+-- clase-01-repaso-python/
| +-- 00-fundamentos.md scope, imports, paths
| +-- 01-tipos-basicos.md int, float, str, bool, casting
| +-- 02-estructuras-datos.md listas, tuplas, dicts, sets, strings
| +-- 03-funciones.md def, *args, **kwargs, lambda
| +-- 04-conceptos-analisis.md pipeline DA, rol de librerias
|
+-- clase-02-numpy-pandas/
| +-- 00-introduccion.md NumPy vs Pandas: cuando usar cada uno
| +-- 01-numpy-arrays.md ndarray, shape, dtype, vectorizacion
| +-- 02-pandas-series.md Series, indexacion, metodos estadisticos
| +-- 03-pandas-dataframe.md creacion, acceso, .info(), .describe()
| +-- 04-operaciones-basicas.md head/tail, seleccion, filtros, conteos
|
+-- clase-03-carga-datos/
| +-- 00-fuentes-datos.md CSV, Excel, JSON, APIs, DB
| +-- 01-csv-excel.md read_csv, read_excel, parametros criticos
| +-- 02-exploracion-inicial.md shape, columns, dtypes, head, nulos
| +-- 03-errores-comunes.md encoding, separador, header, tipos
|
+-- clase-04-calidad-datos/
| +-- 00-evaluacion-calidad.md precision, completitud, consistencia, validez
| +-- 01-valores-nulos.md isnull, dropna, fillna, imputacion
| +-- 02-duplicados.md duplicated, drop_duplicates, analisis causa
| +-- 03-validacion-tipos.md astype, to_numeric, to_datetime, isin
| +-- 04-matriz-decisiones.md cuando eliminar vs imputar
|
+-- clase-05-limpieza-datos/
| +-- 00-pipeline-limpieza.md orden: nulos -> duplicados -> tipos -> outliers -> texto
| +-- 01-normalizacion-texto.md str.lower, str.replace, regex, unicodedata
| +-- 02-manejo-outliers.md IQR, z-score, remover/capear/transformar
| +-- 03-transformaciones-tipo.md astype, Int64, conversiones seguras
| +-- 04-documentacion-cambios.md logging, audit trail, checkpoints
|
+-- clase-06-transformacion-datos/
| +-- 00-seleccion-filtrado.md df[], .loc[], .iloc[], filtros booleanos
| +-- 01-columnas-derivadas.md asignacion, .assign(), .apply(), np.where
| +-- 02-indexacion.md set_index, reset_index, MultiIndex
| +-- 03-transposicion.md .T, .transpose(), casos reales
| +-- 04-operaciones-avanzadas.md .query(), .where(), .mask(), .pipe()
|
+-- clase-07-agregacion-groupby/
| +-- 00-conceptos-agregacion.md sum/mean/count/min/max, equivalencias SQL
| +-- 01-groupby-sintaxis.md sintaxis basica, multiple groupby, transform
| +-- 02-pivot-tables.md pivot_table, index/columns/values/aggfunc
| +-- 03-agg-multiples.md .agg() con multiples funciones, named agg
| +-- 04-casos-complejos.md nested groups, custom aggregations, filter
|
+-- clase-08-integracion-datos/
| +-- 00-conceptos-integracion.md cuando integrar, vertical vs horizontal
| +-- 01-concatenacion.md concat axis=0/1, ignore_index, np.concatenate
| +-- 02-merge-join.md merge on keys, join on index, tipos de how
| +-- 03-validacion-integridad.md shape verification, key mismatch, validate=
| +-- 04-estrategias-produccion.md workflow completo, checkpoints, buenas practicas
|
|+-- pre-entrega/ Actividad intermedia para practicar integracion de tecnicas.
|
|+-- clase-09-estadistica-descriptiva/
| +-- 00-estadistica-descriptiva.md medidas tendencia central, medidas dispersion
| +-- 01-medidas-tendencia.md media, mediana, moda, percentiles
| +-- 02-medidas-dispersion.md varianza, desvio estandar, IQR, rango
| +-- 03-cuartiles-percentiles.md Q1, Q2, Q3, IQR, outliers, boxplot
|
+-- clase-10-exploracion-datos/
| +-- 00-exploracion-datos.md tecnicas EDA, overview dataset, metodologia
| +-- 01-resumen-datos.md describe, info, dtypes, missing analysis
| +-- 02-tecnicas-eda.md analisis univariado, bivariado, multivariado
| +-- 03-presentacion-hallazgos.md documentar hallazgos, resumir, comunicar
|
+-- clase-11-analisis-correlacion/
| +-- 00-conceptos-correlacion.md que es correlacion, cuando usarla, causalidad
| +-- 01-correlacion-pearson.md pearson, interpretacion, limitaciones
| +-- 02-matriz-correlacion.md corr(), heatmap, multicolinealidad
| +-- 03-visualizacion-correlacion.md graficos de correlacion, interpretacion
|
+-- clase-12-consolidacion-datos/
| +-- 00-consolidacion-datos.md preparacion para analisis, validacion final
| +-- 01-preparacion-analisis.md normalizacion, estandarizacion, escalado
| +-- 02-validacion-integridad.md chequeos finales, aseguramiento calidad
| +-- 03-pipeline-completo.md integracion de todas las tecnicas
|
+-- clase-13-visualizacion-matplotlib/
| +-- 00-introduccion-matplotlib.md que es matplotlib, cuando usarla, ventajas
| +-- 01-graficos-basicos.md lineas, barras, scatter, histogramas
| +-- 02-personalizacion.md colores, etiquetas, leyendas, subplots
| +-- 03-mejores-practicas.md errores comunes, accesibilidad, estilos
|
+-- clase-14-visualizacion-seaborn/
| +-- 00-introduccion-seaborn.md que es seaborn, ventajas sobre matplotlib
| +-- 01-graficos-estadisticos.md distribuciones, relaciones, categoricos
| +-- 02-paletas-estilos.md color palettes, themes, customizacion
| +-- 03-object-oriented.md axes, figures, integracion matplotlib
|
+-- clase-15-visualizacion-plotly/
| +-- 00-introduccion-plotly.md visualizacion interactiva, casos de uso
| +-- 01-graficos-dinamicos.md scatter, bar, line interactivos, hover
| +-- 02-dashboards.md creacion de dashboards, multiples graficos
| +-- 03-mejores-practicas-plotly.md performance, buenas practicas, sharing
|
+-- clase-16-cierre-cursada/
| +-- 00-proximo-paso.md machine learning intro, next steps
| +-- 01-regresion-lineal.md conceptos basicos, aplicacion sklearn
| +-- 02-insercion-laboral.md busqueda de trabajo, portafolio, skills
| +-- 03-recursos-continuacion.md libros, cursos, comunidades, github
|+-- _referencia/
| +-- EQUIVALENCIAS_SQL.md Pandas <-> SQL linea por linea
| +-- DICCIONARIO_PANDAS.md API rapida: metodo -> que hace -> ejemplo
| +-- ANTIPATRONES.md Que NO hacer y por que
| +-- CHEATSHEET_OPERACIONES.md One-liners para operaciones comunes
|
|+-- proyecto-final/ Actividad de final de cursada para integrar todas las tecnicas aprendidas en un caso real.
|
+-- README.md
01 Python base
-> 02 NumPy / Pandas (estructuras)
-> 03 Carga de datos
-> 04 Calidad (diagnostico)
-> 05 Limpieza (correccion)
-> 06 Transformacion (preparacion)
-> 07 Agregacion (sintesis)
-> 08 Integracion (union de fuentes)
-> 09 Estadistica (analisis numerico)
-> 10 Exploracion (tecnicas EDA)
-> 11 Correlacion (relaciones)
-> 12 Consolidacion (preparacion final)
-> 13 Visualizacion Matplotlib
-> 14 Visualizacion Seaborn
-> 15 Visualizacion Plotly
-> 16 Cierre (ML intro, insercion laboral)
00-*.md: contexto general, definicion, cuando usar. Max 200 lineas.- Cada archivo incluye seccion de Referencias con links a archivos relacionados.
_referencia/: documentos de consulta rapida transversales a todas las clases.