Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

5 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Data Analysis con Python

Repositorio de estudio estructurado para el ciclo de formacion en Data Analytics con Python. Cubre el pipeline completo: Python -> NumPy/Pandas -> Carga -> Calidad -> Limpieza -> Transformacion -> Agregacion -> Integracion.

Proyecto Final (Google Colab): https://colab.research.google.com/drive/1qv4klCks0t83VMc_nXEexNzi2EEnZnrZ

Estructura

data-analysis/
|
+-- clase-01-repaso-python/
|   +-- 00-fundamentos.md          scope, imports, paths
|   +-- 01-tipos-basicos.md        int, float, str, bool, casting
|   +-- 02-estructuras-datos.md    listas, tuplas, dicts, sets, strings
|   +-- 03-funciones.md            def, *args, **kwargs, lambda
|   +-- 04-conceptos-analisis.md   pipeline DA, rol de librerias
|
+-- clase-02-numpy-pandas/
|   +-- 00-introduccion.md         NumPy vs Pandas: cuando usar cada uno
|   +-- 01-numpy-arrays.md         ndarray, shape, dtype, vectorizacion
|   +-- 02-pandas-series.md        Series, indexacion, metodos estadisticos
|   +-- 03-pandas-dataframe.md     creacion, acceso, .info(), .describe()
|   +-- 04-operaciones-basicas.md  head/tail, seleccion, filtros, conteos
|
+-- clase-03-carga-datos/
|   +-- 00-fuentes-datos.md        CSV, Excel, JSON, APIs, DB
|   +-- 01-csv-excel.md            read_csv, read_excel, parametros criticos
|   +-- 02-exploracion-inicial.md  shape, columns, dtypes, head, nulos
|   +-- 03-errores-comunes.md      encoding, separador, header, tipos
|
+-- clase-04-calidad-datos/
|   +-- 00-evaluacion-calidad.md   precision, completitud, consistencia, validez
|   +-- 01-valores-nulos.md        isnull, dropna, fillna, imputacion
|   +-- 02-duplicados.md           duplicated, drop_duplicates, analisis causa
|   +-- 03-validacion-tipos.md     astype, to_numeric, to_datetime, isin
|   +-- 04-matriz-decisiones.md    cuando eliminar vs imputar
|
+-- clase-05-limpieza-datos/
|   +-- 00-pipeline-limpieza.md    orden: nulos -> duplicados -> tipos -> outliers -> texto
|   +-- 01-normalizacion-texto.md  str.lower, str.replace, regex, unicodedata
|   +-- 02-manejo-outliers.md      IQR, z-score, remover/capear/transformar
|   +-- 03-transformaciones-tipo.md astype, Int64, conversiones seguras
|   +-- 04-documentacion-cambios.md logging, audit trail, checkpoints
|
+-- clase-06-transformacion-datos/
|   +-- 00-seleccion-filtrado.md   df[], .loc[], .iloc[], filtros booleanos
|   +-- 01-columnas-derivadas.md   asignacion, .assign(), .apply(), np.where
|   +-- 02-indexacion.md           set_index, reset_index, MultiIndex
|   +-- 03-transposicion.md        .T, .transpose(), casos reales
|   +-- 04-operaciones-avanzadas.md .query(), .where(), .mask(), .pipe()
|
+-- clase-07-agregacion-groupby/
|   +-- 00-conceptos-agregacion.md  sum/mean/count/min/max, equivalencias SQL
|   +-- 01-groupby-sintaxis.md      sintaxis basica, multiple groupby, transform
|   +-- 02-pivot-tables.md          pivot_table, index/columns/values/aggfunc
|   +-- 03-agg-multiples.md         .agg() con multiples funciones, named agg
|   +-- 04-casos-complejos.md       nested groups, custom aggregations, filter
|
+-- clase-08-integracion-datos/
|   +-- 00-conceptos-integracion.md cuando integrar, vertical vs horizontal
|   +-- 01-concatenacion.md         concat axis=0/1, ignore_index, np.concatenate
|   +-- 02-merge-join.md            merge on keys, join on index, tipos de how
|   +-- 03-validacion-integridad.md shape verification, key mismatch, validate=
|   +-- 04-estrategias-produccion.md workflow completo, checkpoints, buenas practicas
|
|+-- pre-entrega/                       Actividad intermedia para practicar integracion de tecnicas.
|
|+-- clase-09-estadistica-descriptiva/
|   +-- 00-estadistica-descriptiva.md   medidas tendencia central, medidas dispersion
|   +-- 01-medidas-tendencia.md         media, mediana, moda, percentiles
|   +-- 02-medidas-dispersion.md        varianza, desvio estandar, IQR, rango
|   +-- 03-cuartiles-percentiles.md     Q1, Q2, Q3, IQR, outliers, boxplot
|
+-- clase-10-exploracion-datos/
|   +-- 00-exploracion-datos.md         tecnicas EDA, overview dataset, metodologia
|   +-- 01-resumen-datos.md             describe, info, dtypes, missing analysis
|   +-- 02-tecnicas-eda.md              analisis univariado, bivariado, multivariado
|   +-- 03-presentacion-hallazgos.md    documentar hallazgos, resumir, comunicar
|
+-- clase-11-analisis-correlacion/
|   +-- 00-conceptos-correlacion.md     que es correlacion, cuando usarla, causalidad
|   +-- 01-correlacion-pearson.md       pearson, interpretacion, limitaciones
|   +-- 02-matriz-correlacion.md        corr(), heatmap, multicolinealidad
|   +-- 03-visualizacion-correlacion.md graficos de correlacion, interpretacion
|
+-- clase-12-consolidacion-datos/
|   +-- 00-consolidacion-datos.md       preparacion para analisis, validacion final
|   +-- 01-preparacion-analisis.md      normalizacion, estandarizacion, escalado
|   +-- 02-validacion-integridad.md     chequeos finales, aseguramiento calidad
|   +-- 03-pipeline-completo.md         integracion de todas las tecnicas
|
+-- clase-13-visualizacion-matplotlib/
|   +-- 00-introduccion-matplotlib.md   que es matplotlib, cuando usarla, ventajas
|   +-- 01-graficos-basicos.md          lineas, barras, scatter, histogramas
|   +-- 02-personalizacion.md           colores, etiquetas, leyendas, subplots
|   +-- 03-mejores-practicas.md         errores comunes, accesibilidad, estilos
|
+-- clase-14-visualizacion-seaborn/
|   +-- 00-introduccion-seaborn.md      que es seaborn, ventajas sobre matplotlib
|   +-- 01-graficos-estadisticos.md     distribuciones, relaciones, categoricos
|   +-- 02-paletas-estilos.md           color palettes, themes, customizacion
|   +-- 03-object-oriented.md           axes, figures, integracion matplotlib
|
+-- clase-15-visualizacion-plotly/
|   +-- 00-introduccion-plotly.md       visualizacion interactiva, casos de uso
|   +-- 01-graficos-dinamicos.md        scatter, bar, line interactivos, hover
|   +-- 02-dashboards.md                creacion de dashboards, multiples graficos
|   +-- 03-mejores-practicas-plotly.md  performance, buenas practicas, sharing
|
+-- clase-16-cierre-cursada/
|   +-- 00-proximo-paso.md              machine learning intro, next steps
|   +-- 01-regresion-lineal.md          conceptos basicos, aplicacion sklearn
|   +-- 02-insercion-laboral.md         busqueda de trabajo, portafolio, skills
|   +-- 03-recursos-continuacion.md     libros, cursos, comunidades, github
|+-- _referencia/
|   +-- EQUIVALENCIAS_SQL.md       Pandas <-> SQL linea por linea
|   +-- DICCIONARIO_PANDAS.md      API rapida: metodo -> que hace -> ejemplo
|   +-- ANTIPATRONES.md            Que NO hacer y por que
|   +-- CHEATSHEET_OPERACIONES.md  One-liners para operaciones comunes
|
|+-- proyecto-final/               Actividad de final de cursada para integrar todas las tecnicas aprendidas en un caso real.
|
+-- README.md

Progresion

01 Python base
  -> 02 NumPy / Pandas (estructuras)
    -> 03 Carga de datos
      -> 04 Calidad (diagnostico)
        -> 05 Limpieza (correccion)
          -> 06 Transformacion (preparacion)
            -> 07 Agregacion (sintesis)
              -> 08 Integracion (union de fuentes)
                -> 09 Estadistica (analisis numerico)
                  -> 10 Exploracion (tecnicas EDA)
                    -> 11 Correlacion (relaciones)
                      -> 12 Consolidacion (preparacion final)
                        -> 13 Visualizacion Matplotlib
                          -> 14 Visualizacion Seaborn
                            -> 15 Visualizacion Plotly
                              -> 16 Cierre (ML intro, insercion laboral)

Convencion

  • 00-*.md: contexto general, definicion, cuando usar. Max 200 lineas.
  • Cada archivo incluye seccion de Referencias con links a archivos relacionados.
  • _referencia/: documentos de consulta rapida transversales a todas las clases.

About

Repositorio personal de estudio de Análisis de Datos

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Contributors

Languages