O que é a Linhagem ao Nível da Coluna?
O Column-Level Lineage (Linhagem ao Nível da Coluna) é a capacidade de rastrear o percurso de um campo ou coluna individual através de todo o ecossistema de dados, desde a sua origem até ao consumo final. Enquanto a linhagem ao nível da tabela mostra relações entre conjuntos de dados completos ("a tabela A alimenta a tabela B"), a linhagem ao nível da coluna mostra como cada campo é transformado, combinado ou propagado.
Por exemplo, o campo "revenue_total" num dashboard de finanças pode provir da coluna "amount" da tabela de transações, multiplicada pela coluna "exchange_rate" da tabela de divisas, filtrada pela coluna "status" = "completed". A linhagem ao nível da coluna documenta exatamente esta cadeia de transformações, campo a campo.
Este nível de granularidade é essencial para responder a perguntas como: "De onde vem exatamente este número?", "Que campos são afetados se alterar o tipo de dados desta coluna?" ou "Que dashboards apresentam dados derivados deste campo de PII?". Sem linhagem ao nível da coluna, estas perguntas só podem ser respondidas manualmente, revendo código e queries uma a uma.
Porque é importante?
Segundo investigações do setor, 70% dos incidentes de dados têm origem em alterações ao nível da coluna: renomear um campo, alterar o seu tipo de dados, modificar uma lógica de cálculo ou eliminar uma coluna de que outros processos dependem. A linhagem ao nível da tabela não captura estas alterações com a precisão necessária para prevenir problemas.
Para o cumprimento regulatório, a linhagem ao nível da coluna é particularmente valiosa. O RGPD exige saber exatamente onde fluem os dados pessoais, campo a campo. Se o campo "email" da tabela de clientes for copiado para 15 tabelas a jusante, é necessário sabê-lo para garantir que todos os pontos de armazenamento cumprem as políticas de retenção e acesso.
Como funciona na prática?
A linhagem ao nível da coluna constrói-se analisando as transformações SQL, definições de vistas, configurações de pipelines ETL/ELT e metadados de ferramentas de BI. Ferramentas como parsers SQL extraem as relações entre colunas de origem e colunas de destino, incluindo operações como JOIN, UNION, funções de agregação e cálculos.
O resultado é um grafo dirigido ao nível do campo onde cada nó é uma coluna específica de uma tabela específica, e cada aresta representa uma transformação ou propagação. Este grafo permite navegar tanto a montante (de onde vem este campo?) como a jusante (para onde vai este campo?) com precisão absoluta.
Linhagem ao Nível da Coluna no Linedat
A Linedat oferece linhagem ao nível da coluna integrada no catálogo de dados, visualizando as relações entre campos individuais em todo o ecossistema. Combinada com a deteção automática de PII, permite rastrear exatamente para onde fluem os dados pessoais, e a funcionalidade de Impact Analysis mostra o efeito de alterações propostas ao nível do campo antes de as executar.
Termos relacionados
Data Lineage é a rastreabilidade dos dados desde a sua origem até ao destino, mostrando todas as transformações e dependências ao longo do caminho.
O que é a Análise de Impacto em Dados?A análise de impacto avalia o que deixará de funcionar antes de efetuar alterações em dados, tabelas ou colunas. Previne incidentes a jusante.
O que são Dados PII (Informação Pessoal Identificável)?PII são dados que identificam uma pessoa: nome, e-mail, NIF, IP. Aprenda a detetá-los e a geri-los para cumprir o RGPD e a DORA.
O que é um Data Catalog?Um Data Catalog é um inventário centralizado de todos os ativos de dados de uma organização, com metadados, descrições e linhagem.
