Todas tus fuentes en Iceberg REST Catalog, en formatos de archivo abiertos.
Dataddo es la capa de datos llave en mano para Apache Iceberg. Carga datos de más de 400 fuentes de negocio en tablas Iceberg a través de tu catálogo REST - gobernados y listos para analizar - con modos de escritura estilo warehouse sobre almacenamiento lakehouse abierto. Sin pipelines que construir.
Dónde encaja Iceberg REST Catalog en tu arquitectura de datos
Sources
Business / DB / File / Streaming Connectors
450+ available, any direction
HubSpot
Google Ads
Google Sheets
Salesforce
SAP S/4HANA
Oracle
Microsoft Dynamics 365
AWS S3
Azure SQL
Google Cloud SQL
MySQL
PostgreSQL
IBM Db2
+ any other
Your existing stack
Orchestration
Monitoring
Governance & Lineage
IAM & SSO
Dataddo Platform
Speed
Security
Governance
Control Plane
UI
Visual workspace for teams to build, run and monitor pipelines
API
Programmatic interface to embed Dataddo in your own stack and workflows
MCP
Dedicated interface for AI & agents to access governed data in context
Data Plane
Isolated deployment
Hyperscalers
AWSAzureGoogle Cloud
Isolated deployment
EU Cloud Providers
HetznerOVHcloudSTACKIT
Isolated deployment
On-Prem
KubernetesOpenShift
Data + Metadata
Destinations
DWH / Data Lake / Lakehouse
Snowflake
Databricks
Microsoft Fabric
Google BigQuery
Amazon Redshift
Azure Synapse
Oracle
IBM Db2
Universal PostgreSQL
Universal MySQL
+ any other
Data + Metadata
Consumption
AI & Agents / Analytics
Claude
Gemini
OpenAI
Mistral
BottleCap AI
Power BI
Tableau
Looker Studio
Databox
+ any other
Sources
Business / DB / File / Streaming Connectors
450+ available, any direction
Orchestration
Monitoring
Governance & Lineage
IAM & SSO
Dataddo Platform
Speed
Security
Governance
Control Plane
Data Plane
Destinations
DWH / Data Lake / Lakehouse
Consumption
AI & Agents / Analytics
ETLELTReverse ETLCDCData Streaming
Any direction, any workload
FORMATOS ABIERTOS Y PARTICIONADO
Aterriza los datos de Iceberg REST Catalog en formatos abiertos, particionados para consulta
Cada ejecución del flujo escribe datos gobernados en Iceberg REST Catalog como un archivo abierto - Parquet columnar para analítica, o CSV, JSON y JSONL basados en filas para intercambio - dispuestos en particiones por fecha, así motores como Athena, Trino, BigQuery y Spark los leen como un dataset limpio y escanean solo lo que necesitan.
Parquet, CSV, JSON y JSONL
Escribe en Iceberg REST Catalog en el formato que espera tu motor - Parquet columnar y compacto para analítica rápida en Athena, Trino, Spark y BigQuery, además de CSV, JSON y JSONL basados en filas para intercambio que cualquier herramienta puede leer.
Más de 400 conectores gestionados
Plataformas de marketing, ventas, finanzas, producto y publicidad - además de bases de datos y archivos planos - todo mantenido por nosotros y listo para aterrizar en Iceberg REST Catalog desde el primer momento.
Datasets particionados por fecha
Cada ejecución aterriza como su propio archivo con fecha, así Iceberg REST Catalog se organiza como un dataset particionado y los motores de consulta descartan todo salvo los archivos que necesitan.
Snapshot o último estado
Conserva cada ejecución como un snapshot con fecha, o conserva solo el último archivo - la estrategia de nomenclatura de archivos es tu gestión de estado, elegida por flujo.
Carga el historial completo
Rellena rangos de fechas históricos en Iceberg REST Catalog bajo petición - siembra un nuevo lake con todo lo que tienes, o recarga un rango para cubrir un hueco.
Datos limpios y gobernados
Combina y transforma fuentes, y deja que el Data Quality Firewall detenga los registros erróneos y la detección de PII enmascare los campos sensibles antes de que nada aterrice en Iceberg REST Catalog.
FORMATO DE TABLA ABIERTO
Iceberg REST Catalog: el writer, el catálogo y el formato Iceberg
Dataddo entrega tus datos como tablas estándar de Apache Iceberg. Esto es lo que hace el writer gestionado, cómo funciona con los catálogos y lo que el formato Iceberg ofrece a cada motor posterior.
El writer de Dataddo
Un writer gestionado e incremental que mantiene tablas Iceberg reales, no archivos sueltos.
Escribe en formato namespace.table y crea la tabla en la primera escritura
Modos de escritura: insert (añadir) y truncate_insert (reemplazo total)
Gestiona tanto los metadatos de Iceberg como los archivos de datos
Cargas incrementales y programadas desde más de 400 fuentes de Dataddo
Los nombres de namespace no pueden contener espacios
Cualquier catálogo REST de Iceberg
Conecta a través de la especificación de catálogo REST de Iceberg; las credenciales de almacenamiento las entrega el catálogo o se dan a Dataddo.
Funciona con cualquier implementación de catálogo REST
AWS S3 Tables, Google BigLake, Microsoft OneLake, AWS Glue
Autenticación opcional: endpoint de token OAuth o usuario y contraseña
Almacenamiento: credenciales de corta duración del catálogo, o tu clave, secreto y región de S3
Lo que te da el formato Iceberg
Como la salida es Apache Iceberg estándar, cada motor posterior obtiene semántica de tablas de nivel warehouse sobre almacenamiento abierto.
Aislamiento de instantáneas ACID para lecturas consistentes durante las escrituras
Evolución de esquema: añadir, renombrar, reordenar o cambiar el tipo de columnas sin reescribir
Partición oculta y evolución de partición, sin filtros de partición manuales
Time travel y reversión de instantáneas por ID o marca de tiempo
Agnóstico al motor: Spark, Flink, Trino, Snowflake, Athena, BigQuery, Dremio
CON VS. SIN
Quién carga con el trabajo cuando algo cambia aguas arriba
Mantén las mismas fuentes fluyendo hacia Iceberg REST Catalog - y mira quién se hace cargo cuando cambia una API, un esquema o un endpoint:
Sin Dataddo
Con Dataddo
Resultado para ti
Cambio de API o de autenticación
Descubres la avería y corres a solucionarla.
Actualizamos el conector y restauramos el pipeline - a menudo antes de que lo notes.
Los archivos siguen aterrizando en Iceberg REST Catalog
Schema drift
Las columnas cambian y los pipelines se rompen o corrompen datos en silencio.
Se detecta automáticamente y se gestiona mediante reglas configurables.
En Iceberg REST Catalog solo aterrizan datos limpios
Endpoint obsoleto
Reconstruyes la integración.
Nosotros nos encargamos de la actualización - el contrato de datos se mantiene.
Tus cargas en Iceberg REST Catalog siguen funcionando
Conector inexistente
Creas y mantienes una integración personalizada.
Nosotros la creamos y la mantenemos, con un SLA de ~4 semanas.
Cualquier fuente puede llegar a Iceberg REST Catalog
Degradación silenciosa
Te enteras cuando falla un informe o la ejecución de un modelo.
La monitorización proactiva detecta primero las anomalías y los retrasos.
Los problemas se detectan antes de que tu lake lea archivos erróneos
Depuración
Rebuscas en registros repartidos entre herramientas desconectadas.
Historial de ejecuciones, inspección de payloads y linaje de extremo a extremo en un solo lugar.
Diagnóstico más rápido, menos tiempo de inactividad
CASOS DE USO
Lo que los equipos de datos construyen en Iceberg REST Catalog
Un data lake demuestra su valor cuando alimenta trabajo real. Estas son formas habituales en que los equipos aprovechan Iceberg REST Catalog, y los conectores de Dataddo que mantienen cada una abastecida - todo aterrizado en formatos abiertos, según tu programación.
Unifica los datos de marketing y publicidad
Aterriza datos de campañas, inversión y analítica web de cada canal en Iceberg REST Catalog para atribución, reporting y modelado de mix de marketing entre herramientas.
Google Ads
Facebook Ads
Google Analytics 4
YouTube Analytics
+ 400 más
Descarga las bases de datos para analítica
Replica bases de datos operativas en Iceberg REST Catalog para que las consultas analíticas e históricas pesadas se ejecuten en el lake y no en tus sistemas de producción.
PostgreSQL
MySQL
SQL Server
Oracle
MongoDB
+ 400 más
Alimenta data science, ML e IA
Aterriza grandes datasets en bruto como Parquet para ingeniería de características, entrenamiento de modelos y exploración en notebooks con Spark, pandas o tu stack de ML.
Mantén un historial a largo plazo y económico de datos de SaaS, CRM y finanzas en formatos abiertos para cumplimiento y auditoría, sin las facturas de almacenamiento de un warehouse.
¿En qué formatos de archivo puede escribir Dataddo en Iceberg REST Catalog?
Parquet, CSV, JSON y JSONL. Cada ejecución del flujo escribe un archivo en el formato que elijas, con controles a nivel de formato - delimitador, cabecera y formato de fecha de CSV, o la unidad de timestamp para Parquet, JSON y JSONL.
¿Cómo funciona el particionado?
Cada ejecución del flujo aterriza como su propio archivo con fecha, así Iceberg REST Catalog se organiza como un dataset particionado por fecha. Los motores de consulta leen entonces solo las particiones que necesitan en lugar de escanearlo todo, lo que mantiene las consultas rápidas y los costes predecibles.
¿Cómo se conecta Dataddo a un catálogo REST de Apache Iceberg?
Con la URL del catálogo (el endpoint REST). La autenticación es opcional - un endpoint de token OAuth o usuario y contraseña, vacío para catálogos abiertos - y la ubicación del warehouse (p. ej. s3://my-bucket/warehouse) la defines tú o el catálogo del lado servidor.
¿Cómo gestiona Dataddo el almacenamiento subyacente de Iceberg?
El catálogo entrega credenciales de almacenamiento de corta duración de forma automática, o le das a Dataddo una clave de acceso, secreto y región de S3 directamente. Los datos se escriben en formato namespace.table (el namespace no puede contener espacios) y las tablas se crean en la primera escritura.
¿Qué modos de escritura admite Dataddo para tablas Iceberg?
insert (añade filas) y truncate_insert (vacía la tabla y escribe los datos actuales; el predeterminado). Los modos upsert y de clave compuesta no están disponibles aquí, y la lista exacta puede depender del catálogo y del estado actual de la tabla. Dataddo funciona con cualquier implementación de catálogo REST: Polaris, Unity Catalog, Nessie, Lakekeeper, S3 Tables, BigLake, OneLake y Glue.
¿Qué funciones de tabla Iceberg obtengo con los datos que escribe Dataddo?
Como Dataddo escribe tablas estándar de Apache Iceberg, obtienes aislamiento de instantáneas ACID para lecturas consistentes durante las escrituras, evolución de esquema segura (añadir, renombrar, reordenar o cambiar el tipo de columnas sin reescribir la tabla) y time travel: consultar una instantánea anterior por ID o marca de tiempo, o revertir una tabla a un estado bueno conocido.
¿Qué motores pueden consultar las tablas Iceberg que mantiene Dataddo?
La misma tabla es legible por Spark, Flink, Trino, Presto, Hive, Snowflake, Amazon Athena, Google BigQuery, Dremio y más, sin copias y sin dependencia de proveedor. La partición oculta descarta archivos automáticamente, así que las consultas siguen siendo rápidas sin filtros de partición manuales.
¿Puede Dataddo añadir o reemplazar archivos?
Sí. Insert sigue escribiendo archivos nuevos, y create-new-or-replace sobrescribe el archivo con el mismo nombre. Para formatos de tabla lakehouse como Apache Iceberg, Dataddo aplica modos de escritura estilo warehouse sobre la propia tabla.
¿Cómo se protegen mis datos?
Dataddo cuenta con las certificaciones SOC 2 Type II e ISO 27001. Los datos se cifran en tránsito y en reposo, la PII se puede enmascarar o aplicar hash, y hay residencia de datos disponible en la UE o EE. UU. Conectas Iceberg REST Catalog con tus propias claves o un rol asumido.
¿Esto disparará mi factura de almacenamiento?
Las cargas incrementales escriben solo los datos nuevos o modificados, y el Parquet columnar comprime bien - así almacenas y escaneas menos. Tú controlas la programación y la disposición de las particiones, lo que mantiene predecibles los costes de almacenamiento y consulta.
¿Quedo atado a un proveedor?
No. Los datos aterrizan en formatos de archivo abiertos en un bucket que es tuyo, y los pipelines son independientes del almacenamiento - puedes añadir o cambiar de object store, o apuntar las mismas fuentes a un warehouse, sin reconstruir nada.