Trychroma Trychroma
Base de datos vectorial

Cada fuente en Chroma, lista para recuperación.

Dataddo es la capa de datos llave en mano para Chroma. Conecta más de 400 fuentes de negocio y mantén tu base vectorial alimentada continuamente con registros limpios, sin PII y actualizados - sin pipelines que construir ni mantener - para que tus pipelines RAG, la búsqueda semántica y los agentes siempre recuperen datos actuales. Totalmente gestionado y flexible en el despliegue - sin dependencia de proveedor.

ARQUITECTURA

Dónde encaja Chroma en tu arquitectura de datos

Sources

Business / DB / File / Streaming Connectors

450+ available, any direction

Orchestration

Monitoring

Governance & Lineage

IAM & SSO

Dataddo Platform

Speed Security Governance
Control Plane
Data Plane

Destinations

DWH / Data Lake / Lakehouse

Consumption

AI & Agents / Analytics

ETLELTReverse ETLCDCData Streaming
Any direction, any workload
LA BASE DE TUS DATOS

Cada fuente en Chroma, limpia y actualizada

Conecta más de 400 fuentes y mantén Chroma alimentado continuamente con registros y metadatos limpios y gobernados, sin pipelines que construir y sin que datos erróneos o rotos lleguen a tu capa de recuperación.

Más de 400 conectores gestionados

Plataformas de marketing, ventas, finanzas, producto y publicidad, además de bases de datos y archivos planos, todos mantenidos por nosotros y listos para fundamentar tu IA.

Carga por lotes flexible

Carga Chroma por lotes programados con ETL o ELT desde cualquiera de las más de 400 fuentes, combinada, transformada y entregada al ritmo que necesita tu capa de recuperación.

Cargas programadas que lo mantienen actualizado

Carga Chroma en la programación que elijas para que refleje tus datos de origen más recientes, y actualízalo a medida que cambian las fuentes, sin reconstrucciones manuales.

Sin PII antes de quedar fijado

La detección automática de PII enmascara o cifra los campos sensibles, y el Data Quality Firewall detiene los registros erróneos, para que nada irreversible se escriba en Chroma.

Metadatos ricos para recuperación filtrada

Carga metadatos estructurados junto a tus registros para filtrar y acotar la búsqueda semántica y las consultas híbridas en Chroma.

Monitorización proactiva

Las comprobaciones de calidad de datos y las alertas de entrega detectan fallos antes de que lleguen a Chroma o a los agentes y apps que fundamenta.

CON VS. SIN

Quién asume la carga cuando algo cambia aguas arriba

Mantén las mismas fuentes fluyendo hacia Chroma y observa quién se responsabiliza cuando cambia una API, un esquema o un endpoint:

Sin Dataddo Con Dataddo Resultado para ti
Cambio de API o de autenticación Descubres la avería y corres a solucionarla. Actualizamos el conector y restauramos el pipeline - a menudo antes de que lo notes. Los pipelines a Chroma siguen fluyendo
Schema drift Las columnas cambian y los pipelines se rompen o corrompen datos en silencio. Se detecta automáticamente y se gestiona mediante reglas configurables. Solo llegan datos limpios a Chroma
Endpoint obsoleto Reconstruyes la integración. Nosotros nos encargamos de la actualización - el contrato de datos se mantiene. Tus cargas en Chroma siguen funcionando
Conector inexistente Creas y mantienes una integración personalizada. Nosotros la creamos y la mantenemos, con un SLA de ~4 semanas. Cualquier fuente puede llegar a Chroma
Degradación silenciosa Te enteras cuando falla un informe o la ejecución de un modelo. La monitorización proactiva detecta primero las anomalías y los retrasos. Los problemas se detectan antes de que baje la calidad de recuperación
Depuración Rebuscas en registros repartidos entre herramientas desconectadas. Historial de ejecuciones, inspección de payloads y linaje de extremo a extremo en un solo lugar. Diagnóstico más rápido, menos tiempo de inactividad
Residencia de datos por diseño

Elige dónde se ejecuta Chroma: nube, soberana u on-premise

Las bases vectoriales suelen convivir con conocimiento sensible y propietario. Con Dataddo decides dónde se ejecuta el plano de datos según cada carga de trabajo: totalmente en la nube, en una nube regional o soberana, o en tus instalaciones dentro de tu propio perímetro, tanto si Chroma es un servicio gestionado como si es autoalojado. El plano de control orquesta todas las opciones igual, solo mediante metadatos.

Ubicación del Data Plane Sensibilidad típica de los datos Por qué esta configuración

Nube pública

AWS Microsoft Azure Google Cloud
De baja a moderada: datos generales de negocio, marketing y producto; orígenes que ya son nativos de la nube. La forma más rápida de empezar y escala de forma elástica. Ideal cuando los datos no tienen restricciones de residencia y a menudo ya residen en la misma nube pública.

Nubes regionales y soberanas de la UE

Nubes soberanas de la UE Proveedores regionales Nube privada
Regulados / sujetos a residencia: datos personales, financieros y de salud regidos por el RGPD o la legislación local. Mantiene el procesamiento dentro de una jurisdicción concreta para cumplir los requisitos de residencia y soberanía de los datos, sin dejar de funcionar como infraestructura gestionada.

On-premises

Kubernetes Red Hat OpenShift VMware Tanzu
Muy sensibles / restringidos: datos que, por contrato o por ley, no pueden salir del perímetro corporativo. Los datos nunca salen de su red. Necesario para entornos aislados (air-gapped), clasificados o restringidos; el Control Plane los sigue gestionando únicamente mediante metadatos.
TIPOS DE DATOS

Cada tipo de dato, transformado y listo para incrustar en Chroma

Dataddo combina, depura y estructura los datos de más de 400 fuentes antes de que lleguen a Chroma, para que los registros y el texto que leen tus trabajos de embedding lleguen coherentes y listos para analizar.

Tipo de dato Ejemplos Caso de uso en la base vectorial
Estructurados Tablas de bases de datos, CSV, registros de SaaS y CRM Incrusta catálogos, tickets y registros de CRM para búsqueda semántica y recomendaciones
Semiestructurados JSON, respuestas de API, documentos NoSQL y de MongoDB Aplana e incrusta datos de almacenes de documentos y eventos para fundamentar el RAG
Texto no estructurado Campos de texto libre: reseñas, descripciones, notas, mensajes de soporte Entrega el texto que tu trabajo de embedding convierte en vectores para la recuperación

Dataddo entrega registros, metadatos y campos de texto listos para incrustar. No procesa archivos sin procesar como PDF, imágenes o audio, y no genera embeddings: eso lo hace tu trabajo de embedding.

PREGUNTAS FRECUENTES

Chroma + Dataddo, respondido

¿Qué puedo cargar en Chroma?

Cualquiera de las más de 400 fuentes de Dataddo: plataformas de marketing y publicidad, CRM, herramientas de finanzas, bases de datos y archivos planos, además de fuentes personalizadas bajo petición. Los datos se combinan, depuran y enmascaran (PII) antes de llegar a Chroma.

¿Cómo carga Dataddo los datos en Chroma?

Dataddo escribe registros y metadatos en Chroma mediante carga por lotes programada en la cadencia que elijas, entregando los datos limpios y actuales de los que dependen tus trabajos de embedding y recuperación. Dataddo no ejecuta el modelo de embeddings.

¿Qué escribe Dataddo en Chroma?

Dataddo mantiene actualizados los registros de tus colecciones de Chroma: el id, el texto del documento y los metadatos de cada registro desde tus fuentes gobernadas. Chroma puede generar los embeddings de los documentos con su función de embedding configurada; Dataddo entrega los documentos y los metadatos, no los embeddings.

¿Puede Dataddo alimentar Chroma desde el prototipo hasta la producción?

Sí. Dataddo no genera embeddings ni aloja modelos: mantiene los datos de origen gobernados detrás de tus colecciones de Chroma frescos, validados y sin PII a medida que escalas de un prototipo local a producción.

¿Cómo mantiene Dataddo Chroma fresco y gobernado?

Con actualizaciones incrementales programadas desde más de 400 fuentes, además de comprobaciones de calidad y controles de PII, para que los documentos y metadatos detrás de tus colecciones se mantengan al día sin pipelines manuales.

¿Tengo que mantener los pipelines?

No. Dataddo está totalmente gestionado: mantenemos los conectores, nos adaptamos a los cambios de esquema de las fuentes y te avisamos si algo requiere atención. Ejecútalo totalmente en la nube sin nada que operar, o autoaloja el plano de datos como un ligero agente: en cualquier caso, no hay código de pipeline que mantener.

¿Cómo se gestionan los datos sensibles?

Dataddo cuenta con las certificaciones SOC 2 Type II e ISO 27001. Como no puedes retirar un valor una vez incrustado, la PII puede enmascararse o cifrarse antes de llegar a Chroma, y con un plano de datos on-premise los datos nunca salen de tu red. Hay residencia de datos disponible en la UE o EE. UU.

¿Cómo mantengo Chroma actualizado?

Las cargas programadas actualizan Chroma con tus datos de origen más recientes en la cadencia que elijas, para que tus resultados de RAG y búsqueda reflejen datos actuales, sin reconstrucciones manuales.

¿Quedo atado a un proveedor?

No. Los datos llegan a tu propia instancia de Chroma, y los pipelines son independientes del destino: puedes añadir o cambiar bases vectoriales y otros destinos sin reconstruir tus fuentes.