📑 查看全课大纲(第 17 / 26 节)

什么是知识融合

约 32 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

小象实战讲义 · 知识图谱

在构建知识图谱的过程中,我们常常会从多个来源抽取知识,例如从结构化数据库、半结构化的百科信息框、非结构化的文本中。这些来源各异、描述方式不同的知识,如果不加以整合,就会形成一个个“信息孤岛”。知识融合的核心任务,就是将这些分散、异构的知识整合成一个统一、连贯、高质量的知识图谱。本节课,我们将系统性地了解知识融合到底要解决什么问题、它发生在哪些层面,以及它面临哪些主要挑战。

💡 核心导读

  • 目标与层次:知识融合旨在发现并合并不同知识源中描述同一现实世界对象的知识。它发生在数据层(实体对齐)和概念层(本体对齐)两个层面。
  • 核心任务:数据层融合的核心是发现等价实体(owl:sameAs关系),概念层融合则关注等价或具有包含关系的类与属性。
  • 相关术语:认识知识融合、本体对齐、记录链接、实体解析、实体对齐等一组近邻术语的来源与分工。
  • 技术挑战:主要面临数据质量(命名模糊、格式不一)和数据规模(海量实体对匹配)两大挑战。
  • 评测与竞赛:了解推动该领域发展的国际竞赛 OAEI 及其赛道设置。

什么是知识融合?

知识融合,顾名思义,就是将来自不同来源、不同结构的知识整合成一个统一、连贯的知识体系。回顾我们之前课程的内容:我们从半结构化数据(如百科信息框、网页表格)中抽取知识,也从关系数据库通过直接映射或 R2RML 转换成本体或知识图谱,还从非结构化文本中识别实体、抽取关系和事件。

这些从不同源头、用不同技术抽取出来的知识,最终我们不希望它们是孤立或碎片化的。将它们融合在一起的任务,就称为知识融合

知识融合发生在知识图谱的两个层面:

  1. 数据层(实例层):主要任务是发现等价实例,即判断两个知识图谱中的两个实体是否指向现实世界中的同一个对象。例如,判断 YAGO 与 DBpedia 中关于“猫王”(Elvis Presley)的两个实体实际上是同一个人,并用 owl:sameAs 关系将它们链接起来。
  2. 概念层(模式层/Schema层):主要任务是发现等价类/子类等价属性/子属性。例如,判断一个知识图谱中的 Singer 类与另一个知识图谱中的 RockSinger 类,后者是前者的子类;或者判断 born 属性与 birthDate 属性是等价或子属性关系。

对于自底向上构建的知识图谱而言,数据层积累了海量的实体和关系,因此实体对齐(发现等价实例) 是最基础、最核心的融合任务。通过实体对齐,我们可以将不同知识源中关于同一实体的描述信息关联起来,极大地丰富知识的维度。

知识融合的普遍性与价值

知识融合在我们的数字生活中无处不在。以“自由女神像”为例,在 YouTube 上有相关的视频,在 Flickr 上有照片,在《纽约时报》上有新闻报道,在维基百科上有词条文章,在 YAGO 和 Freebase 等知识库中也有结构化描述。这些描述可能使用不同的名称(全称、别名、缩写)、不同的 URI,甚至不同的媒介形式(文本、图片、视频)。知识融合,特别是实体层面的融合,就是要将这些分散的描述关联起来。

通过实体对齐,我们可以实现知识的“连接”与“增值”。例如,通过链接 DBpedia 中的 Rome 实体与 Geonames 中的对应实体,我们不仅知道“罗马”是一个城市,还能获取其精确的经纬度坐标。这种跨知识库的链接,使得搜索、问答等智能应用能够提供更全面、更精准的结果。

知识融合的相关术语

在学术界和工业界,知识融合及相关任务有多个相近的术语,它们来自数据库、语义网等不同领域,但核心问题相似:

  • 知识融合 (Knowledge Fusion):最上位的概念。
  • 本体对齐 (Ontology Alignment) / 本体匹配 (Ontology Matching):更侧重于概念层的融合,但也常包含实例匹配。
  • 记录链接 (Record Linkage) / 实体解析 (Entity Resolution):传统数据库领域的叫法,主要指从不同数据集中找出指向同一现实对象的记录。
  • 实体对齐 (Entity Alignment):知识图谱领域常用,特指在(图)数据层面发现等价实体。

核心澄清:知识融合不等于简单地将两个知识图谱物理合并成一个新文件。它的核心是发现不同知识图谱之间存在的等价实例、类、属性等关系,并建立这些语义链接。至于是否基于这些链接构建一个物理上统一存储的图谱,是后续的存储与应用决策。

知识融合的主要技术挑战

实现高质量、高效率的知识融合面临两大核心挑战:

  1. 数据质量的挑战:原始数据往往存在各种“噪声”。

    • 命名模糊:同一实体可能有多个名称(如“唐三藏”、“玄奘”、“金蝉子”)、缩写或昵称。
    • 数据错误:输入错误、格式不一致(日期格式:2023-01-01 vs 01/01/2023)、信息缺失等。
    • 这些质量问题会直接影响后续相似度计算和匹配算法的准确性。
  2. 数据规模的挑战:知识图谱通常非常庞大。

    • 计算复杂度:最朴素的实体对齐需要对两个知识图谱中的所有实体进行两两比较,时间复杂度为 O(|M| * |N|),对于百万级实体的图谱,这是不可行的。
    • 算法多样性:为了应对不同的数据特征(文本相似度、图结构相似度等),需要设计多种匹配算法,并考虑如何有效组合它们,这加剧了系统的复杂性。
    • 实时性要求:在一些在线应用(如搜索结果的即时知识卡片融合)中,还需要考虑算法的响应速度。

知识融合竞赛:OAEI

为了推动知识融合技术的发展与评估,学术界每年会举办 OAEI (Ontology Alignment Evaluation Initiative) 本体对齐竞赛。OAEI 提供了标准的数据集和评估流程,供全球研究团队提交算法进行公平比较。

  • 目标:评估、比较、交流并促进本体对齐技术的发展。
  • 赛程:通常包括数据集确定、注册、算法提交、评估和结果发布等阶段。提交格式有统一要求,常通过 SEALS 或 HOBBIT 等平台进行自动化评测。
  • 赛道 (Tracks):OAEI 包含多个针对不同场景的赛道,例如:
    • Anatomy:解剖学本体匹配。
    • Conference:会议本体匹配。
    • Multifarm:跨语言本体匹配。
    • Instance Matching:实例(实体)匹配。
    • Large Biomedical Ontologies:大规模生物医学本体匹配。
    • Interactive matching:评估人机交互是否能改善匹配结果。
  • 意义:参与或关注 OAEI 可以帮助学习者了解领域前沿、验证算法效果,是学习知识融合技术很好的实践途径。

知识融合在数据层的标准技术流程(数据预处理、记录链接、分块、结果评估)与相似度度量、聚类、表示学习等具体方法,将在下一节《知识融合的基本技术流程》中系统展开。

📝 动手练一练

  1. 概念辨析:请简要说明“实体对齐 (Entity Alignment)”和“词义消歧 (Word Sense Disambiguation, WSD)”这两个任务的主要区别。
👉 点击查看参考答案
  • 实体对齐:给定两个或多个知识图谱,目标是发现不同图谱中指向现实世界同一对象的实体,并建立链接(如 owl:sameAs)。它处理的是结构化/半结构化数据中的实体标识符匹配问题。
  • 词义消歧:给定一个自然语言文本中的词语,目标是确定该词语在特定上下文中所对应的具体含义(概念)。它处理的是非结构化文本中词语的语义歧义问题。例如,在句子“Apple released a new product.”中,WSD 需要判断“Apple”指的是公司还是水果。

本章小结

本节我们开启了知识图谱构建的关键环节——知识融合的学习。我们明确了知识融合的目标是将多源异构的知识整合成统一图谱,其核心工作发生在数据层(实体对齐)和概念层(本体对齐)。我们通过猫王、自由女神像、罗马城、中文百科等例子,直观感受了实体对齐的价值。同时,我们也辨析了知识融合、本体对齐、记录链接、实体解析、实体对齐这一组近邻术语,并认识到这项任务面临数据质量与数据规模的双重挑战,以及推动该领域发展的国际竞赛(OAEI)。

📋 行动清单

学完本节,你可以立即开始:

  • 回顾与关联:思考之前学过的知识抽取(从结构化、半结构化、非结构化数据中)如何作为知识融合的“上游”输入。
  • 观察生活:留意日常生活中哪些场景本质上是“知识融合”问题,例如,手机通讯录去重、不同电商平台比价时商品匹配等。
  • 预习工具:浏览一下课件中提到的 Falcon-AO、LIMES 等工具的官方网站或 GitHub 页面,对其有一个初步印象。

—— 小象教研组

配套学习资源与课件
  • 第6章课件:知识融合
    下载
  • 知识图谱课程思维导图(KG_Centralized.xmind 全课程结构图)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加顾问免费领取;想学什么,直接告诉顾问
微信二维码:扫码添加课程顾问微信扫码添加顾问