AWS Glue AWS Glue
Object Storage & Data Lake

Todas as fontes no AWS Glue, em formatos de arquivo abertos.

A Dataddo é a camada de dados pronta para usar do AWS Glue. Carregue dados de mais de 400 fontes de negócio em tabelas Iceberg registradas no Glue Data Catalog - governados e prontos para análise - para que o Athena, o Redshift e o EMR as consultem imediatamente. Sem pipelines para construir.

ARQUITETURA

Onde o AWS Glue se encaixa na sua arquitetura de dados

Sources

Business / DB / File / Streaming Connectors

450+ available, any direction

Orchestration

Monitoring

Governance & Lineage

IAM & SSO

Dataddo Platform

Speed Security Governance
Control Plane
Data Plane

Destinations

DWH / Data Lake / Lakehouse

Consumption

AI & Agents / Analytics

ETLELTReverse ETLCDCData Streaming
Any direction, any workload
FORMATOS ABERTOS E PARTICIONAMENTO

Carregue dados do AWS Glue em formatos abertos, particionados para consulta

Cada execução do fluxo grava dados governados no AWS Glue como um arquivo aberto - Parquet colunar para análise, ou CSV, JSON e JSONL baseados em linhas para intercâmbio - dispostos em partições por data, para que motores como Athena, Trino, BigQuery e Spark os leiam como um dataset limpo e varram apenas o que precisam.

Parquet, CSV, JSON e JSONL

Grave no AWS Glue no formato que o seu motor espera - Parquet colunar e compacto para análise rápida no Athena, Trino, Spark e BigQuery, além de CSV, JSON e JSONL baseados em linhas para intercâmbio que qualquer ferramenta consegue ler.

Mais de 400 conectores gerenciados

Plataformas de marketing, vendas, finanças, produto e publicidade - além de bancos de dados e arquivos - tudo mantido para você e pronto para chegar ao AWS Glue imediatamente.

Datasets particionados por data

Cada execução chega como o seu próprio arquivo datado, para que o AWS Glue seja organizado como um dataset particionado e os motores de consulta reduzam a leitura apenas aos arquivos de que precisam.

Snapshot ou estado mais recente

Mantenha cada execução como um snapshot datado, ou mantenha apenas o arquivo mais recente - a estratégia de nomenclatura de arquivos é o seu gerenciamento de estado, escolhido por fluxo.

Carregue o histórico completo

Faça backfill de intervalos de datas históricos no AWS Glue sob demanda - popule um novo lake com tudo o que você tem, ou recarregue um intervalo para preencher uma lacuna.

Dados limpos e governados

Combine e reformate fontes e deixe o Data Quality Firewall barrar registros incorretos e a detecção de PII mascarar campos sensíveis antes que qualquer coisa chegue ao AWS Glue.

FORMATO DE TABELA ABERTO

AWS Glue: o writer, o catálogo e o formato Iceberg

O Dataddo entrega seus dados como tabelas padrão do Apache Iceberg. Veja o que o writer gerenciado faz, como ele trabalha com catálogos e o que o formato Iceberg oferece a cada mecanismo posterior.

O writer do Dataddo

Um writer gerenciado e incremental que mantém tabelas Iceberg reais, não arquivos soltos.

  • Grava no formato namespace.table e cria a tabela na primeira gravação
  • Modos de gravação: insert (anexar) e truncate_insert (substituição total)
  • Gerencia tanto os metadados do Iceberg quanto os arquivos de dados
  • Cargas incrementais e agendadas de mais de 400 fontes do Dataddo
  • Os nomes de namespace não podem conter espaços

AWS Glue Data Catalog

O Dataddo registra tabelas Iceberg diretamente no seu Glue Data Catalog, respaldadas pelo S3.

  • Tabelas registradas no banco de dados do Glue como database.table
  • Registradas na primeira gravação; dados no local do S3 de respaldo
  • Autenticação: chave, segredo e região da AWS (IAM: gerenciar Glue, ler/gravar S3)
  • Consultáveis imediatamente pelo Amazon Athena
  • Também legíveis pelo Redshift Spectrum e EMR/Spark

O que o formato Iceberg oferece

Como a saída é Apache Iceberg padrão, cada mecanismo posterior obtém semântica de tabelas de nível warehouse sobre armazenamento aberto.

  • Isolamento de snapshots ACID para leituras consistentes durante as gravações
  • Evolução de schema: adicionar, renomear, reordenar ou mudar o tipo de colunas sem reescrever
  • Particionamento oculto e evolução de partição, sem filtros de partição manuais
  • Time travel e reversão de snapshots por ID ou timestamp
  • Agnóstico ao mecanismo: Spark, Flink, Trino, Snowflake, Athena, BigQuery, Dremio
COM VS. SEM

Quem assume o trabalho quando algo muda na origem

Mantenha as mesmas fontes fluindo para o AWS Glue - e veja quem assume quando uma API, um esquema ou um endpoint muda:

Sem a Dataddo Com a Dataddo Resultado para você
Mudança de API ou autenticação Você descobre a falha e corre para corrigi-la. Atualizamos o conector e restauramos o pipeline - muitas vezes antes de você perceber. Os arquivos continuam chegando ao AWS Glue
Schema drift As colunas mudam e os pipelines quebram ou corrompem dados silenciosamente. Detectado automaticamente e tratado por regras configuráveis. Apenas dados limpos chegam ao AWS Glue
Endpoint descontinuado Você reconstrói a integração. Nós cuidamos da atualização - o contrato de dados se mantém. As suas cargas no AWS Glue continuam funcionando
Conector inexistente Você cria e mantém uma integração personalizada. Nós a criamos e mantemos, com um SLA de ~4 semanas. Qualquer fonte pode chegar ao AWS Glue
Degradação silenciosa Você descobre quando um relatório ou a execução de um modelo falha. O monitoramento proativo detecta anomalias e atrasos primeiro. Problemas detectados antes que o seu lake leia arquivos incorretos
Depuração Você vasculha logs espalhados por ferramentas desconectadas. Históricos de execução, inspeção de payloads e linhagem de ponta a ponta em um só lugar. Diagnóstico mais rápido, menos tempo de inatividade
CASOS DE USO

O que as equipes de dados constroem no AWS Glue

Um data lake mostra o seu valor quando alimenta trabalho real. Estas são formas comuns de as equipes aproveitarem o AWS Glue, e os conectores da Dataddo que mantêm cada uma abastecida - tudo entregue em formatos abertos, no seu agendamento.

Unifique os dados de marketing e publicidade

Entregue dados de campanhas, investimento e web analytics de cada canal no AWS Glue para atribuição, relatórios e modelagem de mix de marketing entre ferramentas.

Google Ads Facebook Ads Google Analytics 4 YouTube Analytics + 400 mais

Descarregue os bancos de dados para analytics

Replique bancos de dados operacionais no AWS Glue para que consultas analíticas e históricas pesadas rodem no lake em vez dos seus sistemas de produção.

PostgreSQL MySQL SQL Server Oracle MongoDB + 400 mais

Alimente data science, ML e IA

Entregue grandes datasets brutos como Parquet para engenharia de atributos, treinamento de modelos e exploração em notebooks com Spark, pandas ou o seu stack de ML.

PostgreSQL MongoDB Kafka Salesforce + 400 mais

Arquive dados brutos a baixo custo

Mantenha um histórico de longo prazo e econômico de dados de SaaS, CRM e finanças em formatos abertos para conformidade e auditoria, sem as contas de armazenamento de um warehouse.

Salesforce HubSpot NetSuite Stripe + 400 mais
PERGUNTAS FREQUENTES

AWS Glue + Dataddo, respondido

Em quais formatos de arquivo a Dataddo pode gravar no AWS Glue?

Parquet, CSV, JSON e JSONL. Cada execução do fluxo grava um arquivo no formato que você escolher, com controles no nível do formato - delimitador, cabeçalho e formato de data do CSV, ou a unidade de timestamp de Parquet, JSON e JSONL.

Como funciona o particionamento?

Cada execução do fluxo chega como o seu próprio arquivo datado, para que o AWS Glue seja organizado como um dataset particionado por data. Os motores de consulta então leem apenas as partições de que precisam, em vez de varrer tudo, o que mantém as consultas rápidas e os custos previsíveis.

Como o Dataddo se autentica no AWS Glue Data Catalog?

Com um ID de chave de acesso da AWS, uma chave secreta e uma região (sem espaços em nenhum). O usuário ou a chave de IAM precisa de permissão para criar e atualizar bancos de dados e tabelas do Glue e para ler e gravar no local do S3 que os respalda.

Como o Dataddo registra as tabelas no AWS Glue?

Como tabelas Apache Iceberg no banco de dados do Glue que você indicar, com nomenclatura database.table (o nome do banco de dados não pode conter espaços). As tabelas são registradas na primeira gravação se não existirem, e os dados chegam ao local do S3 de respaldo, consultáveis pelo Amazon Athena.

Quais modos de gravação o Dataddo suporta para tabelas Iceberg do AWS Glue?

insert (anexa linhas, o padrão) e truncate_insert (esvazia a tabela e grava os dados atuais). Apenas tabelas Iceberg - não há opções de arquivo CSV, JSON ou Parquet - e o Dataddo gerencia tanto os metadados quanto os arquivos de dados do Iceberg.

Quais capacidades Iceberg têm as tabelas do Glue que o Dataddo grava?

Como são tabelas Apache Iceberg padrão, você tem isolamento de snapshots ACID, evolução de schema segura (adicionar, renomear, reordenar ou mudar o tipo de colunas sem reescrever), particionamento oculto que descarta arquivos automaticamente e time travel para consultar ou reverter para um snapshot anterior.

Quais mecanismos podem ler as tabelas Iceberg do Glue além do Athena?

O registro no Glue Data Catalog as torna legíveis em toda a pilha de analytics da AWS (Athena, Redshift Spectrum, EMR/Spark) e por outros mecanismos Iceberg como Trino, Snowflake, Flink e Dremio: a mesma tabela aberta, sem cópias e sem dependência de fornecedor.

A Dataddo pode adicionar ou substituir arquivos?

Sim. O modo insert continua gravando novos arquivos, e o create-new-or-replace sobrescreve o arquivo com o mesmo nome. Para formatos de tabela de lakehouse como o Apache Iceberg, a Dataddo aplica modos de escrita no estilo warehouse à própria tabela.

Como meus dados são protegidos?

A Dataddo tem as certificações SOC 2 Type II e ISO 27001. Os dados são criptografados em trânsito e em repouso, a PII pode ser mascarada ou convertida em hash, e há residência de dados disponível na UE ou nos EUA. Você conecta o AWS Glue com as suas próprias chaves ou uma role assumida.

Isso vai aumentar a minha fatura de armazenamento?

As cargas incrementais gravam apenas dados novos ou alterados, e o Parquet colunar comprime bem - assim você armazena e varre menos. Você controla o agendamento e o layout de particionamento, o que mantém previsíveis os custos de armazenamento e de consulta.

Fico preso a um fornecedor?

Não. Os dados chegam em formatos de arquivo abertos em um bucket que é seu, e os pipelines são independentes de armazenamento - você pode adicionar ou trocar de object store, ou apontar as mesmas fontes para um warehouse, sem reconstruir nada.