Compartilhe este artigo
A Vert Analytics utiliza o Data Lakehouse como componente central de sua atuação em analytics para enfrentar um problema estrutural comum a organizações de grande porte: a fragmentação de dados entre sistemas incompatíveis. Quando dados fiscais, informações de atendimento e históricos de processos judiciais permanecem isolados em diferentes plataformas, nenhuma inteligência artificial consegue cruzar essas informações de forma adequada sem uma infraestrutura capaz de integrá-las.
O problema de dados dispersos em sistemas incompatíveis
Organizações de grande porte, sejam governos estaduais ou empresas privadas, acumulam dados em múltiplos sistemas ao longo de anos de operação. Cada plataforma pode possuir formato, estrutura e regras de acesso próprios, tornando análises que dependem de várias fontes um exercício manual e custoso de reconciliação de dados incompatíveis.
Essa fragmentação limita o tipo de pergunta que uma análise consegue responder. Na ausência de infraestrutura adequada, cruzar informações de sistemas diferentes exige exportação manual, conversão de formatos e reconciliação de inconsistências antes que qualquer análise combinada possa ser realizada.
O que Data Lakehouse geralmente significa no mercado de dados
Conceitualmente, Data Lakehouse combina a flexibilidade para armazenar dados brutos e não estruturados, característica típica de um data lake, com a organização e a governança associadas ao data warehouse tradicional. Trata-se de uma arquitetura híbrida capaz de sustentar dados estruturados e não estruturados dentro de um ambiente consolidado.
Essa combinação busca resolver uma tensão presente em arquiteturas anteriores. Um data lake puro tende a acumular grandes volumes de dados sem a organização necessária para análises confiáveis, enquanto um data warehouse tradicional pode ser rígido demais para incorporar rapidamente novos tipos de informação que não estavam previstos em sua estrutura original.
Data Lakehouse como base para os produtos com nome próprio
Na Vert Analytics, o Data Lakehouse funciona como fundação técnica para CyndIA, MAIN e ONDA. Cada uma dessas soluções depende de acesso rápido e confiável a volumes relevantes de dados estruturados e não estruturados para executar suas respectivas funções com precisão.
Essa fundação permite que a jurimetria da CyndIA, a decisão automatizada do MAIN e a verificação de identidade da ONDA compartilhem a mesma infraestrutura de dados subjacente. Em vez de cada solução manter uma arquitetura de armazenamento completamente isolada, as três podem operar sobre uma base comum e integrada.
Baixo custo como parte do valor proposto
Um dos atrativos técnicos de uma arquitetura Data Lakehouse é o custo de armazenamento tipicamente inferior ao de bancos de dados tradicionais otimizados exclusivamente para consultas rápidas. Isso ocorre porque parte relevante dos dados armazenados não precisa permanecer constantemente indexada com a mesma intensidade exigida por um sistema transacional tradicional.
Essa eficiência de custo ganha importância à medida que o volume de dados cresce continuamente ao longo dos anos. O cenário é especialmente relevante em governos estaduais que acumulam históricos de décadas de operação em diferentes áreas e precisam preservar informações produzidas por múltiplos serviços simultaneamente.
Dado não estruturado como fronteira que a arquitetura tradicional ignorava
Documentos, imagens, áudios de atendimento e textos de petições jurídicas representam dados não estruturados que sistemas tradicionais de bancos de dados relacionais dificilmente incorporam com a mesma naturalidade de registros estruturados organizados em campos previamente definidos.
A capacidade do Data Lakehouse de armazenar esse tipo de informação ao lado dos dados estruturados é uma condição técnica necessária para soluções como a CyndIA. Dessa forma, a plataforma pode processar o texto integral de uma petição judicial dentro da mesma infraestrutura que também sustenta indicadores numéricos de gestão.
Governança de dados como camada aplicada sobre a mesma base
Consolidar dados em uma única infraestrutura não elimina a necessidade de definir quem pode acessar cada tipo de informação. Essa exigência se torna ainda mais relevante quando diferentes soluções compartilham a mesma base de armazenamento e processam informações com diferentes níveis de sensibilidade.
Uma infraestrutura única, portanto, não significa eliminar a segmentação de acesso apropriada entre os diferentes tipos de informação processados pelas soluções. A Vert Analytics sustenta esse princípio por meio da aplicação de controles de acesso granulares sobre o Data Lakehouse compartilhado, preservando a separação necessária mesmo dentro de uma arquitetura integrada.
