AWS Glue AWS Glue
Object Storage & Data Lake

Jede Quelle in AWS Glue, in offenen Dateiformaten.

Dataddo ist die schlüsselfertige Datenschicht für AWS Glue. Laden Sie Daten aus über 400 Geschäftsquellen in Iceberg-Tabellen, die im Glue Data Catalog registriert sind - gesteuert und analysebereit - sodass Athena, Redshift und EMR sie sofort abfragen. Keine Pipelines, die Sie bauen müssen.

ARCHITEKTUR

Wo AWS Glue in Ihre Datenarchitektur passt

Sources

Business / DB / File / Streaming Connectors

450+ available, any direction

Orchestration

Monitoring

Governance & Lineage

IAM & SSO

Dataddo Platform

Speed Security Governance
Control Plane
Data Plane

Destinations

DWH / Data Lake / Lakehouse

Consumption

AI & Agents / Analytics

ETLELTReverse ETLCDCData Streaming
Any direction, any workload
OFFENE FORMATE & PARTITIONIERUNG

Landen Sie AWS Glue-Daten in offenen Formaten, partitioniert für Abfragen

Jeder Flow-Lauf schreibt gesteuerte Daten als offene Datei in AWS Glue - spaltenorientiertes Parquet für Analysen oder zeilenbasiertes CSV, JSON und JSONL für den Austausch - angelegt in datumsbasierten Partitionen, sodass Engines wie Athena, Trino, BigQuery und Spark sie als sauberes Dataset lesen und nur das scannen, was sie brauchen.

Parquet, CSV, JSON und JSONL

Schreiben Sie in AWS Glue in dem Format, das Ihre Engine erwartet - kompaktes, spaltenorientiertes Parquet für schnelle Analysen auf Athena, Trino, Spark und BigQuery sowie zeilenbasiertes CSV, JSON und JSONL für den Austausch, das jedes Tool einlesen kann.

Über 400 verwaltete Konnektoren

Marketing-, Vertriebs-, Finanz-, Produkt- und Werbeplattformen - plus Datenbanken und Flat Files - alles von uns gewartet und bereit, sofort in AWS Glue zu landen.

Datumspartitionierte Datasets

Jeder Lauf landet als eigene datierte Datei, sodass AWS Glue als partitioniertes Dataset organisiert ist und Abfrage-Engines auf genau die Dateien reduzieren, die sie brauchen.

Snapshot oder aktueller Stand

Bewahren Sie jeden Lauf als datierten Snapshot oder behalten Sie nur die neueste Datei - die Dateibenennungsstrategie ist Ihr Zustandsmanagement, gewählt pro Flow.

Vollständige Historie laden

Befüllen Sie AWS Glue bei Bedarf mit historischen Datumsbereichen - legen Sie einen neuen Lake mit allem an, was Sie haben, oder laden Sie einen Bereich erneut, um eine Lücke zu schließen.

Saubere, gesteuerte Daten

Kombinieren und reshapen Sie Quellen, und lassen Sie die Data Quality Firewall fehlerhafte Datensätze stoppen und die PII-Erkennung sensible Felder maskieren, bevor etwas in AWS Glue landet.

OFFENES TABELLENFORMAT

AWS Glue: der Writer, der Katalog und das Iceberg-Format

Dataddo liefert Ihre Daten als standardmäßige Apache-Iceberg-Tabellen. Hier sehen Sie, was der verwaltete Writer leistet, wie er mit Katalogen zusammenarbeitet und was das Iceberg-Format jeder nachgelagerten Engine bietet.

Der Dataddo-Writer

Ein verwalteter, inkrementeller Writer, der echte Iceberg-Tabellen pflegt, keine reinen Dateien.

  • Schreibt im Format namespace.table und erstellt die Tabelle beim ersten Schreibvorgang
  • Schreibmodi: insert (anhängen) und truncate_insert (vollständiges Ersetzen)
  • Verwaltet sowohl die Iceberg-Metadaten als auch die Datendateien
  • Inkrementelle, geplante Ladevorgänge aus über 400 Dataddo-Quellen
  • Namespace-Namen dürfen keine Leerzeichen enthalten

AWS Glue Data Catalog

Dataddo registriert Iceberg-Tabellen direkt in Ihrem Glue Data Catalog, gestützt auf S3.

  • Tabellen im Glue-Datenbank als database.table registriert
  • Beim ersten Schreibvorgang registriert; Daten im dahinterliegenden S3-Speicherort
  • Authentifizierung: AWS-Schlüssel, Secret und Region (IAM: Glue verwalten, S3 lesen/schreiben)
  • Sofort über Amazon Athena abfragbar
  • Auch von Redshift Spectrum und EMR/Spark lesbar

Was das Iceberg-Format bietet

Da die Ausgabe standardmäßiges Apache Iceberg ist, erhält jede nachgelagerte Engine Tabellensemantik auf Warehouse-Niveau über offenem Speicher.

  • ACID-Snapshot-Isolation für konsistente Lesevorgänge während des Schreibens
  • Schema-Evolution: Spalten hinzufügen, umbenennen, umordnen oder umtypisieren ohne Rewrite
  • Hidden Partitioning und Partition-Evolution, ohne manuelle Partitionsfilter
  • Time Travel und Snapshot-Rollback per ID oder Zeitstempel
  • Engine-unabhängig: Spark, Flink, Trino, Snowflake, Athena, BigQuery, Dremio
MIT VS. OHNE

Wer trägt die Last, wenn sich vorgelagert etwas ändert

Behalten Sie dieselben Quellen bei, die in AWS Glue fließen - und sehen Sie, wer die Verantwortung trägt, wenn sich eine API, ein Schema oder ein Endpunkt ändert:

Ohne Dataddo Mit Dataddo Ergebnis für Sie
Änderung an API oder Authentifizierung Sie entdecken den Ausfall und müssen ihn in Eile beheben. Wir aktualisieren den Konnektor und stellen die Pipeline wieder her - oft bevor Sie es überhaupt bemerken. Dateien landen weiterhin in AWS Glue
Schema-Drift Spalten ändern sich, und Pipelines brechen ab oder verfälschen Daten unbemerkt. Wird automatisch erkannt und nach konfigurierbaren Regeln behandelt. In AWS Glue landen nur saubere Daten
Endpunkt eingestellt Sie müssen die Integration neu entwickeln. Wir übernehmen das Update - der Data Contract bleibt bestehen. Ihre AWS Glue-Ladevorgänge funktionieren weiter
Fehlender Konnektor Sie entwickeln und pflegen eine individuelle Integration. Wir entwickeln und pflegen ihn - mit einer SLA von rund 4 Wochen. Jede Quelle kann AWS Glue erreichen
Unbemerkte Verschlechterung Sie merken es erst, wenn ein Report oder ein Modelllauf fehlschlägt. Proaktives Monitoring erkennt Anomalien und Verzögerungen frühzeitig. Probleme werden erkannt, bevor Ihr Lake fehlerhafte Dateien liest
Debugging Sie durchforsten Logs in verschiedenen, nicht verbundenen Tools. Run-Historien, Payload-Inspektion und durchgängige Lineage an einem Ort. Schnellere Ursachenanalyse, weniger Ausfallzeit
ANWENDUNGSFÄLLE

Was Datenteams auf AWS Glue bauen

Ein Data Lake zahlt sich aus, wenn er echte Arbeit speist. Hier sind gängige Wege, wie Teams AWS Glue nutzen, und die Dataddo-Konnektoren, die jeden davon versorgen - alles in offenen Formaten geladen, nach Ihrem Zeitplan.

Marketing- und Werbedaten vereinheitlichen

Landen Sie Kampagnen-, Ausgaben- und Web-Analytics-Daten aus jedem Kanal in AWS Glue für Attribution, Reporting und Marketing-Mix-Modeling über Tools hinweg.

Google Ads Facebook Ads Google Analytics 4 YouTube Analytics + 400 weitere

Datenbanken für Analytics entlasten

Replizieren Sie operative Datenbanken nach AWS Glue, damit schwere analytische und historische Abfragen im Lake statt in Ihren Produktionssystemen laufen.

PostgreSQL MySQL SQL Server Oracle MongoDB + 400 weitere

Data Science, ML und KI versorgen

Landen Sie große Rohdatensätze als Parquet für Feature Engineering, Modelltraining und Notebook-Exploration mit Spark, pandas oder Ihrem ML-Stack.

PostgreSQL MongoDB Kafka Salesforce + 400 weitere

Rohdaten kostengünstig archivieren

Behalten Sie eine günstige, langfristige Historie von SaaS-, CRM- und Finanzdaten in offenen Formaten für Compliance und Audit - ohne die Speicherkosten eines Warehouse.

Salesforce HubSpot NetSuite Stripe + 400 weitere
FAQ

AWS Glue + Dataddo, beantwortet

In welche Dateiformate kann Dataddo in AWS Glue schreiben?

Parquet, CSV, JSON und JSONL. Jeder Flow-Lauf schreibt eine Datei im von Ihnen gewählten Format, mit Steuerung auf Formatebene - CSV-Trennzeichen, Kopfzeile und Datumsformat oder die Zeitstempel-Einheit für Parquet, JSON und JSONL.

Wie funktioniert die Partitionierung?

Jeder Flow-Lauf landet als eigene datierte Datei, sodass AWS Glue als datumspartitioniertes Dataset organisiert ist. Abfrage-Engines lesen dann nur die Partitionen, die sie brauchen, statt alles zu scannen, was Abfragen schnell und Kosten planbar hält.

Wie authentifiziert sich Dataddo beim AWS Glue Data Catalog?

Mit einer AWS-Zugriffsschlüssel-ID, einem geheimen Zugriffsschlüssel und einer Region (jeweils ohne Leerzeichen). Der IAM-Benutzer oder -Schlüssel benötigt die Berechtigung, Glue-Datenbanken und -Tabellen zu erstellen und zu aktualisieren und den dahinterliegenden S3-Speicherort zu lesen und zu beschreiben.

Wie registriert Dataddo Tabellen in AWS Glue?

Als Apache-Iceberg-Tabellen in der von Ihnen angegebenen Glue-Datenbank, mit der Benennung database.table (der Datenbankname darf keine Leerzeichen enthalten). Tabellen werden beim ersten Schreibvorgang registriert, falls sie nicht existieren, und die Daten landen im dahinterliegenden S3-Speicherort - abfragbar über Amazon Athena.

Welche Schreibmodi unterstützt Dataddo für AWS-Glue-Iceberg-Tabellen?

insert (Zeilen anhängen, Standard) und truncate_insert (Tabelle leeren, dann aktuelle Daten schreiben). Nur Iceberg-Tabellen - es gibt keine CSV-, JSON- oder Parquet-Dateioptionen - und Dataddo verwaltet sowohl die Iceberg-Metadaten als auch die Datendateien.

Welche Iceberg-Fähigkeiten haben die von Dataddo geschriebenen Glue-Tabellen?

Da es sich um standardmäßige Apache-Iceberg-Tabellen handelt, erhalten Sie ACID-Snapshot-Isolation, sichere Schema-Evolution (Spalten hinzufügen, umbenennen, umordnen oder umtypisieren ohne Rewrite), Hidden Partitioning, das Dateien automatisch filtert, und Time Travel zum Abfragen oder Zurücksetzen auf einen früheren Snapshot.

Welche Engines können die Glue-Iceberg-Tabellen außer Athena lesen?

Die Registrierung im Glue Data Catalog macht sie im gesamten AWS-Analytics-Stack lesbar (Athena, Redshift Spectrum, EMR/Spark) sowie durch andere Iceberg-Engines wie Trino, Snowflake, Flink und Dremio - dieselbe offene Tabelle, ohne Kopien und ohne Anbieterbindung.

Kann Dataddo Dateien anhängen oder ersetzen?

Ja. Insert schreibt weiterhin neue Dateien, und Create-New-or-Replace überschreibt die Datei mit demselben Namen. Für Lakehouse-Tabellenformate wie Apache Iceberg wendet Dataddo Warehouse-artige Schreibmodi auf die Tabelle selbst an.

Wie werden meine Daten geschützt?

Dataddo ist SOC 2 Type II- und ISO 27001-zertifiziert. Daten werden bei der Übertragung und im Ruhezustand verschlüsselt, PII kann maskiert oder gehasht werden, und eine Datenresidenz in der EU oder den USA ist verfügbar. Sie verbinden AWS Glue mit Ihren eigenen Schlüsseln oder einer angenommenen Rolle.

Treibt das meine Speicherkosten in die Höhe?

Inkrementelle Ladevorgänge schreiben nur neue oder geänderte Daten, und spaltenorientiertes Parquet komprimiert gut - so speichern und scannen Sie weniger. Sie steuern den Zeitplan und das Partitionslayout, was Speicher- und Abfragekosten planbar hält.

Bin ich an einen Anbieter gebunden?

Nein. Die Daten landen in offenen Dateiformaten in einem Bucket, der Ihnen gehört, und die Pipelines sind speicherunabhängig - Sie können Object Stores hinzufügen oder wechseln oder dieselben Quellen auf ein Warehouse richten, ohne etwas neu aufzubauen.