这篇札记根据已有的 Notion 研读笔记整理。它关心的不是给一个知识图谱打出总分,而是弄清:我们说它“质量好”时,究竟作出了怎样的承诺。
先确定我们在评价什么
知识图谱里的问题并不总是错误事实。某个实体可能缺少关系,也可能重复出现;一条关系曾经正确,如今却已经过时。准确性、一致性、完整性、时效性与冗余,指向不同的缺陷,也需要不同的检查方式。
更难的是开放世界假设:没有记录一条事实,并不能直接推出这条事实为假。 因而,“缺了多少”首先依赖我们期待它覆盖什么。若没有任务、时间范围或目标实体集,完整性很容易变成没有分母的指标。
同样,一个适合实体检索的图谱,未必足以支撑严格的逻辑推理。质量需要带着使用语境一起描述。
评估、检测与改进不能混为一谈
综述中的质量管理思路,可以沿着三个问题理解:
| 环节 | 要回答的问题 | 可能得到的东西 |
|---|---|---|
| 评估 | 目前在哪些维度上存在问题? | 指标、抽样估计、覆盖情况 |
| 检测 | 哪些具体事实或结构值得复核? | 可疑三元组、冲突规则、重复实体 |
| 改进 | 应该如何修正,又会引入什么影响? | 修复建议、补全候选、版本变更 |
一个异常分数可以提示风险,却未必足以授权删除事实。补全出一条“很可能成立”的边,也不等于已经获得了可信的新知识。不同环节之间需要保留证据和不确定性。
方法之间的取舍
人工抽样接近具体语义,但成本和一致性需要控制。统计或表示学习方法适合发现大规模异常,却可能把少见但真实的事实当成噪声。逻辑与本体约束便于解释,但结论依赖约束本身是否正确、是否适用于当前数据。
因此,值得关注的不是哪一种方法能包办所有检查,而是它们如何配合:规则先缩小范围,统计排序帮助安排复核,人工判断反过来修正规则与样本。
留给后续研究的问题
我想继续追问的是:如果下游任务已经明确,能否把质量检查从笼统的全图评价,收敛为一组可解释的任务约束?
例如,查询必须使用最新的机构隶属关系,那么时效性与来源时间就比无关属性的覆盖率更紧迫。这提示我,评估对象也许应该是“图谱在一次任务中的可用部分”,而不只是整个图谱。
这是阅读之后形成的问题,还不是本文已经证明的结论。下一步可以与 Linked Data 质量框架对照,检查两者对评估范围、可访问性和动态更新的处理。