Revenue funnel and pipeline analytics: layered SQL warehouse, 21 data tests, filterable PDF dashboard
-
Updated
Aug 5, 2026 - Python
Revenue funnel and pipeline analytics: layered SQL warehouse, 21 data tests, filterable PDF dashboard
Spark–Kafka real-time data pipeline skeleton with Docker Compose, PostgreSQL, and Flask API
DriftSiren is a production-grade platform for real-time data drift and quality monitoring. Built with Next.js, FastAPI, and Docker, it tracks feature drift, provides live alerts, and visualizes metrics on a sleek dashboard. Includes agent, APIs, Celery workers, and Kubernetes-ready setup.
Polars data quality extension
Ce dépôt contient deux exercices indépendants portant sur le nettoyage, la validation et l'analyse de données issues de fichiers CSV. Chaque exercice dispose de son propre script Python, de son fichier CSV associé et d'une documentation dédiée.
Automated data quality monitoring using LLM (GPT-4o) to generate SQL checks from table schemas — runs on schedule via GitHub Actions
Easy to go data quality tool.
End-to-end data quality, statistics, and product analytics pipeline Python, pandas, PostgreSQL, FastAPI, Streamlit
Enterprise Multi-Source ELT, SQL Server 2022 Kimball Data Warehouse, SCD Type 2, Automated Data Quality Quarantine & Power BI Analytics Lifecycle
The main code repository of Referencing Quality Scoring System metrics. Paper: https://www.semantic-web-journal.net/system/files/swj3593.pdf
Fabric- PySpark - Governance
⚡ Prevent downstream data quality issues by integrating the Soda Library into your CI/CD pipeline.
Pipeline ETL para coleta, transformação e armazenamento da cotação do dólar, utilizando a API pública do Banco Central e PostgreSQL, com detecção automática de variações anormais.
Minimal MLOps regression skeleton (California Housing) with training pipeline, Evidently drift/performance report, FastAPI prediction service, Dockerized training/serving environments, ready for CI/CD extension
Dataset Auto-Diagnosis Python Library — detect and fix data quality issues (leakage, skewness, outliers, imbalance) before model training.
Snowflake connectors for Data Culpa - monitor data quality automatically with Data Culpa Validator
Azure Data Lake Gen2 storage connectors for Data Culpa - monitor data quality automatically with Data Culpa Validator
A Python, SQL, Pandas, and SQLite ETL project for data quality checks, data validation, and business reporting.
MongoDB connector for Data Culpa - monitor data quality automatically with Data Culpa Validator
Run greatexpectations.io on ANY SQL Engine using REST API. Supported by FastAPI, Pydantic and SQLAlchemy as best data quality tool
To associate your repository with the dataquality topic, visit your repo's landing page and select "manage topics."