StartWissenDatenpipelines & Big Data

Ratgeber · Daten

Datenpipelines & Big Data — von Rohdaten zur Erkenntnis.

Daten sind erst nützlich, wenn sie verlässlich fließen und verarbeitet werden. Zwei Achsen prägen jede Pipeline: ETL vs. ELT und Batch vs. Streaming.

ETL vs. ELT

Beide beschreiben, wann transformiert wird: ETL (Extract, Transform, Load) transformiert die Daten vor dem Laden ins Zielsystem. ELT lädt erst die Rohdaten und transformiert sie im Zielsystem (Data Warehouse) — flexibel, wenn das Zielsystem leistungsfähig ist.

Batch vs. Streaming

Batch verarbeitet große Mengen in Intervallen (stündlich, täglich) — ideal für Reporting und Historie. Streaming verarbeitet Daten, sobald sie eintreffen — für sofortige Erkenntnisse und Reaktionen (z. B. Predictive Maintenance).

Lambda-Architektur

Wo beides gebraucht wird, kombiniert die Lambda-Architektur beide Wege: ein Batch-Layer für vollständige, genaue Historie, ein Speed-Layer für niedrige Latenz, und ein Serving-Layer, der beide Ergebnisse zusammenführt.

Vom Gerät bis zur Auswertung

Weil wir die Datenquelle (Sensor, Elektronik, Embedded) selbst verstehen, beginnt eine saubere Pipeline schon bei der Erfassung — oft am Edge — und reicht bis zur Auswertung. Die Wege dazwischen zeigt die IoT-Architektur.

Häufige Fragen

Brauche ich Streaming oder reicht Batch?
Batch reicht für Reporting und historische Analyse. Streaming lohnt, wenn schnelle Reaktion zählt (Überwachung, Anomalieerkennung). Häufig ergänzt Streaming bestehende Batch-Pipelines, statt sie zu ersetzen.
Was ist mit Datenschutz und Datenmengen?
Vorverarbeitung und Filterung am Edge reduzieren Datenmengen und halten sensible Rohdaten lokal. Was wirklich in die Cloud muss, wird bewusst entschieden — Architektur und Datenschutz gehören zusammen.