Trychroma Trychroma
Banco de dados vetorial

Cada fonte no Chroma, pronto para recuperação.

A Dataddo é a camada de dados pronta para usar do Chroma. Conecte mais de 400 fontes de negócio e mantenha o seu banco vetorial continuamente alimentado com registros limpos, sem PII e atualizados - sem pipelines para construir ou manter - para que os seus pipelines RAG, a busca semântica e os agentes sempre recuperem dados atuais. Totalmente gerenciado e flexível na implantação - sem dependência de fornecedor.

ARQUITETURA

Onde o Chroma se encaixa na sua arquitetura de dados

Sources

Business / DB / File / Streaming Connectors

450+ available, any direction

Orchestration

Monitoring

Governance & Lineage

IAM & SSO

Dataddo Platform

Speed Security Governance
Control Plane
Data Plane

Destinations

DWH / Data Lake / Lakehouse

Consumption

AI & Agents / Analytics

ETLELTReverse ETLCDCData Streaming
Any direction, any workload
A BASE DOS SEUS DADOS

Cada fonte no Chroma, limpa e atualizada

Conecte mais de 400 fontes e mantenha o Chroma continuamente alimentado com registros e metadados limpos e governados - sem pipelines para construir e sem dados ruins ou quebrados chegando à sua camada de recuperação.

Mais de 400 conectores gerenciados

Plataformas de marketing, vendas, finanças, produto e publicidade - além de bancos de dados e arquivos - todos mantidos por nós e prontos para fundamentar a sua IA.

Carga em lote flexível

Carregue o Chroma em lote programado com ETL ou ELT a partir de qualquer uma das mais de 400 fontes - combinada, transformada e entregue no ritmo que a sua camada de recuperação precisa.

Cargas programadas que o mantêm atualizado

Carregue o Chroma no agendamento que você escolher para refletir os seus dados de origem mais recentes, e atualize-o conforme as fontes mudam - sem reconstruções manuais.

Sem PII antes de ficar fixado

A detecção automática de PII mascara ou cifra campos sensíveis, e o Data Quality Firewall barra registros ruins - para que nada irreversível seja gravado no Chroma.

Metadados ricos para recuperação filtrada

Grave metadados estruturados junto aos seus registros para filtrar e delimitar a busca semântica e as consultas híbridas no Chroma.

Monitoramento proativo

Verificações de qualidade de dados e alertas de entrega detectam falhas antes que cheguem ao Chroma ou aos agentes e apps que ele fundamenta.

COM VS. SEM

Quem assume a carga quando algo muda na origem

Mantenha as mesmas fontes fluindo para o Chroma - e veja quem se responsabiliza quando uma API, um esquema ou um endpoint muda:

Sem a Dataddo Com a Dataddo Resultado para você
Mudança de API ou autenticação Você descobre a falha e corre para corrigi-la. Atualizamos o conector e restauramos o pipeline - muitas vezes antes de você perceber. Os pipelines para o Chroma continuam fluindo
Schema drift As colunas mudam e os pipelines quebram ou corrompem dados silenciosamente. Detectado automaticamente e tratado por regras configuráveis. Só dados limpos chegam ao Chroma
Endpoint descontinuado Você reconstrói a integração. Nós cuidamos da atualização - o contrato de dados se mantém. As suas cargas no Chroma continuam funcionando
Conector inexistente Você cria e mantém uma integração personalizada. Nós a criamos e mantemos, com um SLA de ~4 semanas. Qualquer fonte pode chegar ao Chroma
Degradação silenciosa Você descobre quando um relatório ou a execução de um modelo falha. O monitoramento proativo detecta anomalias e atrasos primeiro. Problemas detectados antes que a qualidade da recuperação caia
Depuração Você vasculha logs espalhados por ferramentas desconectadas. Históricos de execução, inspeção de payloads e linhagem de ponta a ponta em um só lugar. Diagnóstico mais rápido, menos tempo de inatividade
Residência de dados por design

Escolha onde o Chroma roda: nuvem, soberana ou on-premises

Bancos vetoriais costumam ficar ao lado de conhecimento sensível e proprietário. Com a Dataddo, você decide onde o plano de dados roda em cada carga de trabalho: totalmente na nuvem, em uma nuvem regional ou soberana, ou no seu ambiente local dentro do seu próprio perímetro, seja o Chroma um serviço gerenciado ou auto-hospedado. O plano de controle orquestra todas as opções da mesma forma, apenas por metadados.

Local do Data Plane Sensibilidade típica dos dados Por que essa configuração

Nuvem pública

AWS Microsoft Azure Google Cloud
De baixa a moderada: dados gerais de negócio, marketing e produto; fontes que já são nativas da nuvem. A maneira mais rápida de começar e escala de forma elástica. Ideal quando os dados não têm restrição de residência e muitas vezes já estão na mesma nuvem pública.

Nuvens regionais e soberanas da UE

Nuvens soberanas da UE Provedores regionais Nuvem privada
Regulados / sujeitos a residência: dados pessoais, financeiros e de saúde regidos pelo GDPR ou pela legislação local. Mantém o processamento dentro de uma jurisdição específica para atender aos requisitos de residência e soberania de dados, sem deixar de funcionar como infraestrutura gerenciada.

On-premises

Kubernetes Red Hat OpenShift VMware Tanzu
Altamente sensíveis / restritos: dados que, por contrato ou por lei, não podem sair do perímetro corporativo. Os dados nunca saem da sua rede. Necessário para ambientes isolados (air-gapped), classificados ou restritos; o Control Plane continua a gerenciá-los apenas por metadados.
TIPOS DE DADOS

Cada tipo de dado, transformado e pronto para incorporar no Chroma

A Dataddo combina, limpa e estrutura os dados de mais de 400 fontes antes que cheguem ao Chroma, para que os registros e o texto que os seus jobs de embedding leem cheguem consistentes e prontos para análise.

Tipo de dado Exemplos Caso de uso no banco vetorial
Estruturados Tabelas de bancos de dados, CSV, registros de SaaS e CRM Incorpore catálogos, tickets e registros de CRM para busca semântica e recomendações
Semiestruturados JSON, respostas de API, documentos NoSQL e do MongoDB Achate e incorpore dados de document stores e eventos para fundamentar o RAG
Texto não estruturado Campos de texto livre: avaliações, descrições, notas, mensagens de suporte Entregue o texto que o seu job de embedding transforma em vetores para recuperação

A Dataddo entrega registros, metadados e campos de texto prontos para incorporação. Ela não processa arquivos brutos como PDFs, imagens ou áudio, e não gera embeddings - isso é feito pelo seu job de embedding.

PERGUNTAS FREQUENTES

Chroma + Dataddo, respondido

O que posso carregar no Chroma?

Qualquer uma das mais de 400 fontes da Dataddo - plataformas de marketing e publicidade, CRMs, ferramentas de finanças, bancos de dados e arquivos - além de fontes personalizadas sob demanda. Os dados são combinados, limpos e mascarados (PII) antes de chegar ao Chroma.

Como a Dataddo carrega os dados no Chroma?

A Dataddo grava registros e metadados no Chroma por carga em lote programada na cadência que você escolher, entregando os dados limpos e atuais dos quais os seus jobs de embedding e recuperação dependem. A Dataddo não executa o modelo de embeddings.

O que o Dataddo grava no Chroma?

O Dataddo mantém atualizados os registros das suas coleções do Chroma: o id, o texto do documento e os metadados de cada registro das suas fontes governadas. O Chroma pode gerar os embeddings dos documentos com a sua função de embedding configurada; o Dataddo entrega os documentos e os metadados, não os embeddings.

O Dataddo pode alimentar o Chroma do protótipo à produção?

Sim. O Dataddo não gera embeddings nem hospeda modelos: mantém os dados de origem governados por trás das suas coleções do Chroma atualizados, validados e sem PII à medida que você escala de um protótipo local para a produção.

Como o Dataddo mantém o Chroma atualizado e governado?

Com atualizações incrementais agendadas de mais de 400 fontes, além de verificações de qualidade e controles de PII, para que os documentos e metadados por trás das suas coleções fiquem em dia sem pipelines manuais.

Preciso manter os pipelines?

Não. A Dataddo é totalmente gerenciada: mantemos os conectores, nos adaptamos às mudanças de esquema das fontes e avisamos se algo precisar de atenção. Rode tudo na nuvem sem nada para operar, ou hospede você mesmo o plano de dados como um agente leve: em ambos os casos, não há código de pipeline para você manter.

Como os dados sensíveis são tratados?

A Dataddo tem certificações SOC 2 Type II e ISO 27001. Como não é possível retirar um valor depois de incorporado, a PII pode ser mascarada ou cifrada antes de chegar ao Chroma, e com um plano de dados on-premises os dados nunca saem da sua rede. Há residência de dados disponível na UE ou nos EUA.

Como mantenho o Chroma atualizado?

As cargas programadas atualizam o Chroma com os seus dados de origem mais recentes na cadência que você escolher, para que os seus resultados de RAG e busca reflitam dados atuais - sem reconstruções manuais.

Fico preso a um fornecedor?

Não. Os dados chegam à sua própria instância do Chroma, e os pipelines são independentes do destino - você pode adicionar ou trocar bancos vetoriais e outros destinos sem reconstruir as suas fontes.