EMZETT.
Login

Pandas

Kurz: Die Standard-Python-Bibliothek für tabellarische Daten — lädt, filtert, gruppiert und transformiert Daten ähnlich wie eine Excel-Tabelle, nur programmierbar.

Genauer: Pandas’ zentrale Datenstruktur ist der DataFrame (eine Tabelle mit benannten Spalten), gebaut auf NumPy. Damit lassen sich CSV-/Excel-/Datenbank-Daten einlesen, bereinigen, aggregieren und wieder exportieren — der de-facto Standard für Datenanalyse in Python.

Im Detail

Grundstruktur: DataFrame und Series

import pandas as pd
 
df = pd.read_csv("verkaeufe.csv")
umsatz_pro_kategorie = df.groupby("kategorie")["umsatz"].sum()
 
# Filtern
teure_verkaeufe = df[df["umsatz"] > 1000]
 
# Neue Spalte berechnen
df["umsatz_mit_steuer"] = df["umsatz"] * 1.19
 
# Fehlende Werte behandeln
df = df.dropna(subset=["kunde_id"])

Ein DataFrame besteht aus benannten Spalten (jede Spalte selbst ein Series-Objekt, technisch ein NumPy-Array eines einheitlichen Typs) und einem Index für die Zeilen — konzeptionell einer Tabellenkalkulation ähnlich, aber vollständig programmatisch steuerbar und ohne die Zeilenlimits einer Excel-Datei (Pandas verarbeitet problemlos Millionen von Zeilen, solange der Arbeitsspeicher ausreicht). Eine einzelne Spalte für sich (df["umsatz"]) ist eine Series — eindimensional, mit demselben Index wie der DataFrame, aus dem sie stammt.

Typische Operationen

  • Filtern: boolesche Indizierung wie df[df["umsatz"] > 1000] — liest sich fast wie eine SQL-WHERE-Klausel.
  • Gruppieren und Aggregieren: groupby entspricht SQL GROUP BY, gefolgt von einer Aggregationsfunktion (sum, mean, count).
  • Zusammenführen: merge entspricht einem SQL-JOIN zwischen zwei DataFrames anhand gemeinsamer Spalten.
  • Umformen: Pivot-Tabellen (pivot_table) drehen Zeilen zu Spalten und umgekehrt, nützlich für Kreuztabellen-Auswertungen.
  • Zeitreihen: eingebaute Funktionen für Datums-/Zeitspalten (Resampling auf Tages-/Monatsebene, Zeitzonenumrechnung) — einer der Gründe, warum Pandas ursprünglich für Finanzdatenanalyse entwickelt wurde (der Name steht für “Panel Data”).

Rolle im Data-Science-Workflow

Pandas übernimmt in einem typischen Data-Science-Workflow meist die Bereinigungs- und Vorverarbeitungsphase (“Data Wrangling”): fehlende Werte behandeln (löschen oder auffüllen), Datentypen korrigieren (z. B. Text-Datumsangaben in echte Datumsobjekte umwandeln), Spalten umbenennen oder neu berechnen, Duplikate entfernen — bevor die aufbereiteten Daten an spezialisiertere Bibliotheken wie SciPy (statistische Tests) oder Machine-Learning-Werkzeuge (scikit-learn) weitergereicht werden. In der Praxis verbringen Data-Science-Teams oft den Großteil der Projektzeit genau in dieser Pandas-lastigen Bereinigungsphase, nicht im eigentlichen Modelltraining.

Siehe auch: NumPy, Data Science, SciPy