Structured data-cleaning pipeline built on the Olist e-commerce dataset, focusing on reproducible ingestion, schema profiling, and light standardization using Python and pandas. Emphasizes clear pipeline stages, auditability, and portfolio-ready documentation.
python pandas ci-cd data-engineering e-commerce parquet schema-validation data-cleaning data-pipeline data-quality data-profiling csv-processing github-actions referential-integrity deterministic-sampling analytics-engineering pipeline-architecture data-auditing reproducible-data
-
Updated
Apr 3, 2026 - Python