Todas as fontes no AWS Glue, em formatos de arquivo abertos.
A Dataddo é a camada de dados pronta para usar do AWS Glue. Carregue dados de mais de 400 fontes de negócio em tabelas Iceberg registradas no Glue Data Catalog - governados e prontos para análise - para que o Athena, o Redshift e o EMR as consultem imediatamente. Sem pipelines para construir.
Onde o AWS Glue se encaixa na sua arquitetura de dados
Sources
Business / DB / File / Streaming Connectors
450+ available, any direction
HubSpot
Google Ads
Google Sheets
Salesforce
SAP S/4HANA
Oracle
Microsoft Dynamics 365
AWS S3
Azure SQL
Google Cloud SQL
MySQL
PostgreSQL
IBM Db2
+ any other
Your existing stack
Orchestration
Monitoring
Governance & Lineage
IAM & SSO
Dataddo Platform
Speed
Security
Governance
Control Plane
UI
Visual workspace for teams to build, run and monitor pipelines
API
Programmatic interface to embed Dataddo in your own stack and workflows
MCP
Dedicated interface for AI & agents to access governed data in context
Data Plane
Isolated deployment
Hyperscalers
AWSAzureGoogle Cloud
Isolated deployment
EU Cloud Providers
HetznerOVHcloudSTACKIT
Isolated deployment
On-Prem
KubernetesOpenShift
Data + Metadata
Destinations
DWH / Data Lake / Lakehouse
Snowflake
Databricks
Microsoft Fabric
Google BigQuery
Amazon Redshift
Azure Synapse
Oracle
IBM Db2
Universal PostgreSQL
Universal MySQL
+ any other
Data + Metadata
Consumption
AI & Agents / Analytics
Claude
Gemini
OpenAI
Mistral
BottleCap AI
Power BI
Tableau
Looker Studio
Databox
+ any other
Sources
Business / DB / File / Streaming Connectors
450+ available, any direction
Orchestration
Monitoring
Governance & Lineage
IAM & SSO
Dataddo Platform
Speed
Security
Governance
Control Plane
Data Plane
Destinations
DWH / Data Lake / Lakehouse
Consumption
AI & Agents / Analytics
ETLELTReverse ETLCDCData Streaming
Any direction, any workload
FORMATOS ABERTOS E PARTICIONAMENTO
Carregue dados do AWS Glue em formatos abertos, particionados para consulta
Cada execução do fluxo grava dados governados no AWS Glue como um arquivo aberto - Parquet colunar para análise, ou CSV, JSON e JSONL baseados em linhas para intercâmbio - dispostos em partições por data, para que motores como Athena, Trino, BigQuery e Spark os leiam como um dataset limpo e varram apenas o que precisam.
Parquet, CSV, JSON e JSONL
Grave no AWS Glue no formato que o seu motor espera - Parquet colunar e compacto para análise rápida no Athena, Trino, Spark e BigQuery, além de CSV, JSON e JSONL baseados em linhas para intercâmbio que qualquer ferramenta consegue ler.
Mais de 400 conectores gerenciados
Plataformas de marketing, vendas, finanças, produto e publicidade - além de bancos de dados e arquivos - tudo mantido para você e pronto para chegar ao AWS Glue imediatamente.
Datasets particionados por data
Cada execução chega como o seu próprio arquivo datado, para que o AWS Glue seja organizado como um dataset particionado e os motores de consulta reduzam a leitura apenas aos arquivos de que precisam.
Snapshot ou estado mais recente
Mantenha cada execução como um snapshot datado, ou mantenha apenas o arquivo mais recente - a estratégia de nomenclatura de arquivos é o seu gerenciamento de estado, escolhido por fluxo.
Carregue o histórico completo
Faça backfill de intervalos de datas históricos no AWS Glue sob demanda - popule um novo lake com tudo o que você tem, ou recarregue um intervalo para preencher uma lacuna.
Dados limpos e governados
Combine e reformate fontes e deixe o Data Quality Firewall barrar registros incorretos e a detecção de PII mascarar campos sensíveis antes que qualquer coisa chegue ao AWS Glue.
FORMATO DE TABELA ABERTO
AWS Glue: o writer, o catálogo e o formato Iceberg
O Dataddo entrega seus dados como tabelas padrão do Apache Iceberg. Veja o que o writer gerenciado faz, como ele trabalha com catálogos e o que o formato Iceberg oferece a cada mecanismo posterior.
O writer do Dataddo
Um writer gerenciado e incremental que mantém tabelas Iceberg reais, não arquivos soltos.
Grava no formato namespace.table e cria a tabela na primeira gravação
Modos de gravação: insert (anexar) e truncate_insert (substituição total)
Gerencia tanto os metadados do Iceberg quanto os arquivos de dados
Cargas incrementais e agendadas de mais de 400 fontes do Dataddo
Os nomes de namespace não podem conter espaços
AWS Glue Data Catalog
O Dataddo registra tabelas Iceberg diretamente no seu Glue Data Catalog, respaldadas pelo S3.
Tabelas registradas no banco de dados do Glue como database.table
Registradas na primeira gravação; dados no local do S3 de respaldo
Autenticação: chave, segredo e região da AWS (IAM: gerenciar Glue, ler/gravar S3)
Consultáveis imediatamente pelo Amazon Athena
Também legíveis pelo Redshift Spectrum e EMR/Spark
O que o formato Iceberg oferece
Como a saída é Apache Iceberg padrão, cada mecanismo posterior obtém semântica de tabelas de nível warehouse sobre armazenamento aberto.
Isolamento de snapshots ACID para leituras consistentes durante as gravações
Evolução de schema: adicionar, renomear, reordenar ou mudar o tipo de colunas sem reescrever
Particionamento oculto e evolução de partição, sem filtros de partição manuais
Time travel e reversão de snapshots por ID ou timestamp
Agnóstico ao mecanismo: Spark, Flink, Trino, Snowflake, Athena, BigQuery, Dremio
COM VS. SEM
Quem assume o trabalho quando algo muda na origem
Mantenha as mesmas fontes fluindo para o AWS Glue - e veja quem assume quando uma API, um esquema ou um endpoint muda:
Sem a Dataddo
Com a Dataddo
Resultado para você
Mudança de API ou autenticação
Você descobre a falha e corre para corrigi-la.
Atualizamos o conector e restauramos o pipeline - muitas vezes antes de você perceber.
Os arquivos continuam chegando ao AWS Glue
Schema drift
As colunas mudam e os pipelines quebram ou corrompem dados silenciosamente.
Detectado automaticamente e tratado por regras configuráveis.
Apenas dados limpos chegam ao AWS Glue
Endpoint descontinuado
Você reconstrói a integração.
Nós cuidamos da atualização - o contrato de dados se mantém.
As suas cargas no AWS Glue continuam funcionando
Conector inexistente
Você cria e mantém uma integração personalizada.
Nós a criamos e mantemos, com um SLA de ~4 semanas.
Qualquer fonte pode chegar ao AWS Glue
Degradação silenciosa
Você descobre quando um relatório ou a execução de um modelo falha.
O monitoramento proativo detecta anomalias e atrasos primeiro.
Problemas detectados antes que o seu lake leia arquivos incorretos
Depuração
Você vasculha logs espalhados por ferramentas desconectadas.
Históricos de execução, inspeção de payloads e linhagem de ponta a ponta em um só lugar.
Diagnóstico mais rápido, menos tempo de inatividade
CASOS DE USO
O que as equipes de dados constroem no AWS Glue
Um data lake mostra o seu valor quando alimenta trabalho real. Estas são formas comuns de as equipes aproveitarem o AWS Glue, e os conectores da Dataddo que mantêm cada uma abastecida - tudo entregue em formatos abertos, no seu agendamento.
Unifique os dados de marketing e publicidade
Entregue dados de campanhas, investimento e web analytics de cada canal no AWS Glue para atribuição, relatórios e modelagem de mix de marketing entre ferramentas.
Google Ads
Facebook Ads
Google Analytics 4
YouTube Analytics
+ 400 mais
Descarregue os bancos de dados para analytics
Replique bancos de dados operacionais no AWS Glue para que consultas analíticas e históricas pesadas rodem no lake em vez dos seus sistemas de produção.
PostgreSQL
MySQL
SQL Server
Oracle
MongoDB
+ 400 mais
Alimente data science, ML e IA
Entregue grandes datasets brutos como Parquet para engenharia de atributos, treinamento de modelos e exploração em notebooks com Spark, pandas ou o seu stack de ML.
Mantenha um histórico de longo prazo e econômico de dados de SaaS, CRM e finanças em formatos abertos para conformidade e auditoria, sem as contas de armazenamento de um warehouse.
Em quais formatos de arquivo a Dataddo pode gravar no AWS Glue?
Parquet, CSV, JSON e JSONL. Cada execução do fluxo grava um arquivo no formato que você escolher, com controles no nível do formato - delimitador, cabeçalho e formato de data do CSV, ou a unidade de timestamp de Parquet, JSON e JSONL.
Como funciona o particionamento?
Cada execução do fluxo chega como o seu próprio arquivo datado, para que o AWS Glue seja organizado como um dataset particionado por data. Os motores de consulta então leem apenas as partições de que precisam, em vez de varrer tudo, o que mantém as consultas rápidas e os custos previsíveis.
Como o Dataddo se autentica no AWS Glue Data Catalog?
Com um ID de chave de acesso da AWS, uma chave secreta e uma região (sem espaços em nenhum). O usuário ou a chave de IAM precisa de permissão para criar e atualizar bancos de dados e tabelas do Glue e para ler e gravar no local do S3 que os respalda.
Como o Dataddo registra as tabelas no AWS Glue?
Como tabelas Apache Iceberg no banco de dados do Glue que você indicar, com nomenclatura database.table (o nome do banco de dados não pode conter espaços). As tabelas são registradas na primeira gravação se não existirem, e os dados chegam ao local do S3 de respaldo, consultáveis pelo Amazon Athena.
Quais modos de gravação o Dataddo suporta para tabelas Iceberg do AWS Glue?
insert (anexa linhas, o padrão) e truncate_insert (esvazia a tabela e grava os dados atuais). Apenas tabelas Iceberg - não há opções de arquivo CSV, JSON ou Parquet - e o Dataddo gerencia tanto os metadados quanto os arquivos de dados do Iceberg.
Quais capacidades Iceberg têm as tabelas do Glue que o Dataddo grava?
Como são tabelas Apache Iceberg padrão, você tem isolamento de snapshots ACID, evolução de schema segura (adicionar, renomear, reordenar ou mudar o tipo de colunas sem reescrever), particionamento oculto que descarta arquivos automaticamente e time travel para consultar ou reverter para um snapshot anterior.
Quais mecanismos podem ler as tabelas Iceberg do Glue além do Athena?
O registro no Glue Data Catalog as torna legíveis em toda a pilha de analytics da AWS (Athena, Redshift Spectrum, EMR/Spark) e por outros mecanismos Iceberg como Trino, Snowflake, Flink e Dremio: a mesma tabela aberta, sem cópias e sem dependência de fornecedor.
A Dataddo pode adicionar ou substituir arquivos?
Sim. O modo insert continua gravando novos arquivos, e o create-new-or-replace sobrescreve o arquivo com o mesmo nome. Para formatos de tabela de lakehouse como o Apache Iceberg, a Dataddo aplica modos de escrita no estilo warehouse à própria tabela.
Como meus dados são protegidos?
A Dataddo tem as certificações SOC 2 Type II e ISO 27001. Os dados são criptografados em trânsito e em repouso, a PII pode ser mascarada ou convertida em hash, e há residência de dados disponível na UE ou nos EUA. Você conecta o AWS Glue com as suas próprias chaves ou uma role assumida.
Isso vai aumentar a minha fatura de armazenamento?
As cargas incrementais gravam apenas dados novos ou alterados, e o Parquet colunar comprime bem - assim você armazena e varre menos. Você controla o agendamento e o layout de particionamento, o que mantém previsíveis os custos de armazenamento e de consulta.
Fico preso a um fornecedor?
Não. Os dados chegam em formatos de arquivo abertos em um bucket que é seu, e os pipelines são independentes de armazenamento - você pode adicionar ou trocar de object store, ou apontar as mesmas fontes para um warehouse, sem reconstruir nada.