这篇札记整理自 Notion 中的综述研读。与知识图谱质量管理的讨论相接,它把视野放回开放网络:数据不仅要表达正确,还必须能被访问、理解和使用。
指标背后有使用条件
在异构数据源之间,同一个字段可能有不同含义,同一个实体可能使用不同标识。一次检查通过,并不保证下一次访问仍然得到相同内容。
所以,质量维度的分类很有价值,但分类表并不能自动产生有效的评价。计算指标之前,还需要说明数据快照、目标任务、检查规则和无法观测的部分。
从框架回到一个具体问题
假设我需要把几个公开来源中的实体关联起来。标识是否可解析、链接是否失效、属性语义是否相容,都会影响任务能否继续。此时,只统计某个属性的非空比例,解释力显然不够。
这也说明,数据质量和系统可用性会发生交叉,却不能互相替代:端点可以稳定返回一批错误数据,一批正确数据也可能暂时无法访问。
与知识图谱综述放在一起读
前一篇札记把质量管理拆成评估、检测和改进。这里补上了另一层约束:每一步都发生在有来源、有时间、也有访问条件的环境中。
一个可继续尝试的整理方式,是为每项指标同时保存四样东西:它检查什么、依赖什么、在什么范围内有效、失败后应该怎样解释。这样,指标才更接近研究证据,而不是一串脱离情境的分数。