Large Language Models Assisting Ontology Evaluation
发布时间:2026/10/4 14:22:22 作者:尧图编辑部 阅读量:1,286

文章主要内容总结研究背景:本体评估中的能力问题(CQ)验证是重要的功能需求验证方式,但传统方法耗时、费力且易出错。近年来大语言模型(LLMs)在本体工程中展现潜力,但在通过CQ验证进行功能评估(尤其是人机协同场景)的研究仍属空白。核心贡献:提出OE-Assist框架,通过自动和半自动方式辅助CQ验证,实现本体功能评估。构建OntoEval数据集,包含1393个CQ及其对应的本体和本体故事,由两位本体工程师交叉验证标注。评估LLM在自动CQ验证中的效果,发现o1-preview和o3-mini的表现接近人类平均水平。通过19位来自8个国际机构的知识工程师参与的用户研究,表明LLM建议能提高验证准确性(尤其建议正确时)、降低任务难度,但错误建议会降低人类表现,揭示了效率与准确性的权衡。关键发现:自动评估中,o1-preview在OntoEval数据集上的macro-F1达0.66,优于其他模型。半自动评估中,正确LLM建议使用户准确率提升13%,错误建议使准确率下降28%;整体上LLM辅助未显著改变准确率,但降低了任务难度感知。任务难度与准确率呈中等负相关,且用户存在学习效应,无辅助时学习效果更明显。创新点