Workshop
digicode: PYTH04
Python Data Wrangling & Analytics Engineering
Kurs-Facts
Als PDF herunterladen- Optimieren von Daten für KI-Anwendungen
- Zusammenführen von Daten aus Dateien, Datenbanken und APIs auf optimale Weise
- Kennenlernen von Parquet und Apache Arrow als moderne, spaltenorientierte Datenformate
- Absichern der Datenqualität mit Schemas, Regeln und Data Contracts
- Prüfen von Transformationen mit automatisierten Tests
- Anwenden von Best Practices bei KI-gestützten Anwendungen
Tag 1: Daten verstehen und zuverlässig einlesen
- Rolle von Data Wrangling und Analytics Engineering
- Aufbau einer einfachen Raw–Clean–Curated-Struktur
- Pandas-3.x-Refresh
- Daten aus CSV, Excel, JSON, SQL und REST APIs einlesen
- Parquet und Apache Arrow
- Datentypen, Schemas und Metadaten
- Datenprofiling und Datenwörterbücher
- Fehlende Werte, Dubletten, ungültige Kategorien und Ausreisser
- Zeitstempel, Zeitzonen und Kalenderdaten
- KI-gestützte Interpretation von Datenprofilen und Formulierung von Qualitätsfragen
Tag 2: Transformieren, validieren und skalieren
- Filtern, Gruppieren, Aggregieren und Reshaping
- Tabellen verknüpfen und Joins systematisch prüfen
- Vectorization statt langsamer Python-Schleifen
- Transformationen mit DuckDB und SQL
- Datenvalidierung mit Pandera
- Schema-, Bereichs-, Eindeutigkeits- und Beziehungsprüfungen
- Data Contracts und Guardrails
- Automatisierte Tests für Transformationen
- Vergleichslab: Pandas, Polars und DuckDB
- KI zur Generierung von Transformationsentwürfen, Randfällen und Testfällen
- Sämtliche KI-Ergebnisse deterministisch validieren
Tag 3: Reproduzierbare Analytics-Pipeline
- Notebook-Code in Funktionen und Module überführen
- Konfiguration und Parameter
- Logging und nachvollziehbare Fehlerbehandlung
- Idempotente und wiederholbare Verarbeitung
- Datenherkunft und Transformationsprotokoll
- Raw-, Clean- und Curated-Daten trennen
- Ergebnisse in Parquet speichern
- Validierte Daten mit DuckDB abfragen
- Synthetische Beispieldaten mit KI erzeugen und auf Datenschutz sowie statistische Qualität prüfen
Open Data, Provenance & Reproducibility mit Abschlussprojekt:
KI wird besonders mächtig wenn diverse Daten verknüpft werden und Open Data bietet Dir die Möglichkeit an unterschiedlichste Daten zu kommen und diese zu nutzen. Ein sinnvoller best practice-Ansatz, diese Datenschätze für eigene Unternehmenszwecke zu nutzen. In diesem Modul lernst Du:
- Dokumentieren der Herkunft und Lizenz eines Datensatzes. Open Data ist nicht automatisch frei von:
- personenbezogenen Daten
- Nutzungsbeschränkungen
- Qualitätsproblemen
- Bias
- Datenquelle, Abrufzeitpunkt und Transformationen protokollieren
- offene Formate wie Parquet und Arrow nutzen
- Versionen der verwendeten Libraries festhalten
- reproduzierbare Umgebungen und Daten-Pipelines erstellen
- KI-generierte synthetische Daten nicht automatisch als anonym oder unproblematisch betrachten
- Workshop mit Übungen und praktischen Anwendungen
- Teilnehmende vollziehen die Inhalte am eigenen Laptop nach
- Vor Kursbeginn erhalten die Teilnehmenden ausführliche Informationen zur Vorbereitung und Installation relevanter Open-Source-Python-Software
Dieser Kurs richtet sich an Datenanalyst/innen, Business Analyst/innen, Data Engineers, BI-Spezialist/innen sowie Datenbank-Spezialist/innen.
Der Kurs ist kein allgemeiner Python-Grundlagenkurs, Unternehmensdaten im LLM und Dashboardentwicklung sind nicht Teil des Kurses .
Grundlegende Kenntnisse der Datenanalyse sowie erweiterte Python-Kenntnisse gemäss des folgenden Kurses werden vorausgesetzt:
Du verfügst über einen Account auf ChatGPT, Claude, Copilot, Gemini oder Perplexity. Die kostenfreien Versionen sind ausreichend.
Solltest du vor Ort teilnehmen, empfehlen wir dir bei Möglichkeit einen eigenen Laptop mitzubringen. So kannst du die nötigen Tools aus dem Unterricht selbst installieren und deine erarbeiteten Daten nach Hause nehmen.