国内刊号:11-5602/TP
国际刊号:1673-9418
发布日期:
作者:郑傲泽, 张坤丽, 李云龙, 王影, 袁颂瑞, 吴鹏程, 贾玉祥, 昝红英
单位:郑州大学 计算机与人工智能学院,郑州 472000
关键词:知识图谱构建,命名实体识别,关系三元组抽取,大语言模型(LLM),产业链
基金:国家自然科学基金联合基金重点项目(U23A20316)。
随着产业链分析的深入和信息化需求的增长,如何从海量文本中高效抽取企业及产业间的供需关系并构建产业链知识图谱,成为当前研究的主要问题。基于此,提出了一种基于大语言模型验证增强的产业链知识图谱构建方法。在概念层,设计了以“产业-企业”双视角的图谱构建层级体系,实现企业与产业的映射关系。在数据层,对结构化数据利用大语言模型进行知识抽取,构建产业链标注语料库(CERIC)。对于非结构化数据,设计了一个验证增强的大模型数据抽取框架VRTE-LLM。该框架使用CERIC语料库对大语言模型微调训练,以提升其在特定领域的知识理解与信息抽取能力,并根据任务需求和文本上下文,修正关系三元组中的完整性错误与偏差错误,通过使用预定义的规则库对三元组进行验证。实验结果显示,该框架在实体识别与关系抽取任务中分别达到80.9%与83.9%的准确率。所构建的产业链知识图谱包含39 627个三元组,涵盖四大产业领域、70余家企业的知识图谱,覆盖产业链上下游各关键环节,为产业链进行量化分析、趋势预测提供技术支持。
来源:2025年第12期
《计算机科学与探索》期刊编辑部