EMNLP2025重磅!大模型+知识图谱构建全解析(干货满满),看完这篇就够了!

1. 动机
当前从海量非结构化文本中自动构建高质量知识图谱(KG)依然是一个长期且尚未完全解决的难题,现有的KG构建流程并未真正实现自动化,不仅需要大量人工设计提示词,还依赖人工清洗噪声文本,整个流程分散、难以形成统一的端到端框架。同时,非结构化文本,尤其是科研领域如生物医学文献,其句子往往极长、结构复杂,包含多从句、多谓语以及频繁出现的指代现象,使得大语言模型(LLM)在解析时容易出现理解偏差,导致三元组抽取不完整或出现错误关系。此外,许多现有研究忽视了“句子复杂度”对模型抽取能力的关键影响,而句子结构类型(如简单句、复合句、复杂句或并列复合句)在很大程度上决定了 LLM 的推理与关系识别难度。与此同时,科研文本中普遍存在的共指指代现象,例如“它”、“这种机制”、“该药物”等常常指向前文实体,如果不进行准确的共指消解,模型会在实体识别与关系抽取阶段发生偏差,从而显著降低构建 KG 的整体质量。因此,论文提出针对这些挑战构建真正的端到端、自动化的知识图谱构建框架。我们认为,建模并将这些复杂句子类型转换为更简单的形式,能够使LLM更有效地进行解释,特别是对于结构化信息提取。
2. 贡献
本文的主要贡献有:
(1)引入了CoDe-KG统一自动化知识图谱构建框架,用于关系抽取(RE)和知识图谱构建,该框架借鉴了语言学理论和语义分析。
(2)提出了Hybrid CoT + FICL的混合提示策略,将链式思维(CoT)与小样例提示(FICL)结合,在句子简化任务中实现了很高的准确率。
(3)创新性地提出了“句子复杂度语义建模”方法,将学术文本的句子划分为简单句、复合句、并列句、并列复合句以及不完整句,并依据不同句法结构自动匹配最优的提示模式与模型组合。
3. 方法
在本研究中,我们提出了一种自动化的知识图谱创建流程CoDe-KG,用于从摘要中创建知识图谱。如图1所示,我们的方法包括四个关键阶段:执行共指消解、句子分类、句子转换和关系抽取(RE)。

图1 总体框架图
(1)执行共指消解:通过专家标注与多组提示词—模型组合的系统比较,筛选出最优配置,用于处理医学文献中大量存在的指代现象,以避免实体错配、三元组缺失以及错误关系的级联传播。
(2)句子分类:系统对每个句子进行句子复杂度分类,将其划分为五类句法类型,并为后续选择最合适的简化策略提供依据。
(3)句子转换:对于复合句、并列句及并列复合句,系统会根据句法类型自动匹配最优的Prompt–Model组合实现句子简化
关系抽取(RE):系统对所有原始简单句以及简化后的句子执行关系抽取,生成三元组,并在REBEL、WebNLG、Wiki-NRE与CaRB 等基准上进行验证,最终累计构建出超过150,000条结构化三元组,用于生成高质量的知识图谱。
4. 实验
实验1:共指消解结果
我们在我们的基准上评估了几个大型语言模型。大多数模型的结果都很差。表1列出了执行共指消解的模型的F1得分,并以ChatGPT o4-mini-high和ChatGPT-4.5的响应作为基线进行基准测试。ChatGPT o4- mini-high总体表现最佳,使用FICL提示时的F1约为63%。我们用粗体标出了最佳开源模型,它与此任务的闭源模型相当。
表1:各模型F1分数比较

实验2:句法句子分类
我们在训练集上微调了六个基于Transformer的模型和两个较小的LLM,并在测试集上评估了它们,表2报告了每个模型的测试准确率和宏平均 F1,我们使用 GPT-4o 模型评估了整个测试集。
表2:句子类型分类结果(训练集:2,00句;测试集:5,269句)

实验3:评估提示策略和语义转换
我们从复杂句、并列句和并列复杂句类别中分别随机抽取300个句子,并将它们翻译成简单句。这些300个的样本量在其各自的总体中实现了95%的置信度,误差范围分别为±5.62%、±5.57%和±5.26%。我们测试了表现最佳的模型,并评估了它们在不同提示策略上的性能。
表3:模型在复合句到简单句转换上的性能

表4:模型在将复杂句转换为简单句时的性能

表5:模型在复合-复杂句到简单句转换上的性能

由于简单句的总数超过177,000,我们使用了精心设计的COT + FICL提示,因为数据显示它表现最佳。注释者AB和CD研究了从每个被测试模型生成的100个句子,并达成一致意见,即Mixtral-8x7B-Instruct-v0.1模型表现良好,在解简单句中的关系方面准确率达到99%,其中还包括捕捉文本中的多种关系。
5. 总结
论文的研究结果表明,将句子复杂度建模与大语言模型结合,可以显著增强知识图谱构建中的三元组抽取能力,尤其在结构复杂的学术与生物医学文本中,结构化输入能有效提升模型的理解与推理表现。通过CoDe-KG框架,作者实现了一个真正意义上的端到端自动化知识图谱构建流程,涵盖共指消解、句子结构分类、句子简化、三元组抽取与图谱构建等关键步骤,并已完整开源供研究与应用使用。研究同时验证了Hybrid CoT + FICL是句子简化任务的最优提示策略,可获得很高的的精确匹配率。此外,作者也指出未来的改进方向,包括进一步提高共指消解能力、探索弱监督条件下的模型微调策略,以及提升框架在更多领域中的迁移适配性,以推动自动化知识图谱构建的广泛应用。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐

所有评论(0)