Glossário · BI & Analytics

Data Lake

Repositório que aceita dados em qualquer formato, estruturados ou não, adiando a modelação para o momento de consulta.

Um data lake é um repositório que aceita dados em qualquer formato — estruturados (tabelas relacionais), semi-estruturados (JSON, XML), ou não-estruturados (imagens, vídeos, texto livre, logs) — sem exigir modelação prévia. A filosofia é 'guardar tudo agora, estruturar quando for preciso' (schema-on-read), em oposição ao data warehouse tradicional onde os dados têm de ser estruturados antes de entrar (schema-on-write).

O data lake brilha quando os requisitos analíticos futuros são desconhecidos ou quando há dados valiosos em formatos que o data warehouse tradicional não suporta bem — imagens de controlo de qualidade, texto livre de chat com clientes, logs de sistemas. Um data lake mal gerido torna-se 'data swamp' — repositório de dados que ninguém sabe usar.

Em ambientes INFOS, data lakes fazem sentido em implementações de IA aplicada que precisam de dados multi-formato — por exemplo, controlo de qualidade por visão computacional combinando imagens com metadata. Para a maioria dos clientes, um data warehouse relacional bem desenhado (via MyBusiness-ITV sobre Qlik) resolve 90% das necessidades; o data lake entra em cenários específicos.

Aplicar isto na sua operação?

Falamos com a sua equipa para perceber o encaixe — sem compromisso.

Falar com a INFOS