【目的】 总结国内外知识图谱补全技术的研究现状,为促进知识图谱补全技术深入研究提供理论基础。【文献范围】 以“Knowledge Graph Completion”“Link Prediction”和“知识图谱补全”“链接预测”等为关键词,分别在Web of Science、Google Scholar和中国知网等权威数据库中检索,筛选出代表性文献133篇。【方法】 基于文献调研与归纳总结方法,分别从推荐模型、结果评价、未来展望三方面对相关研究进行综述与评价。【结果】 基于关系语义的知识图谱补全模型可以划分为面向复杂关系语义建模、面向连接关系语义建模和面向隐含、异质、稀疏关系语义建模的知识图谱补全模型。针对MRR指标,面向稀疏关系语义建模的SimKGC模型在WN18RR数据集上提高4.9个百分点,面向连接关系语义建模的DaBR模型在FB15k-237数据集上提高3.4个百分点。【局限】 部分新兴技术缺乏大规模基准实验,由于研究领域广泛,文献众多,未能涵盖所有相关研究。【结论】 相比传统方法,前沿技术具有更好的图谱补全性能,但是模型可解释性、可扩展性不足,多模态和时序数据融合困难,大语言模型存在幻觉风险,这也是未来研究要解决的问题。
【目的】 综述检索增强生成(Retrieval-Augmented Generation, RAG)技术中检索粒度对系统性能的影响,探讨不同粒度在上下文完整性与信息精确度之间存在的内在权衡及其优化策略。【文献范围】 使用“Retrieval-Augmented Generation”“Retrieval Granularity”“检索增强生成”“检索粒度”等中英文关键词,分别在谷歌学术、ACM Digital Library、中国知网等数据库中检索2020年至2025年间公开的相关论文,筛选出106篇代表性文献进行分析。【方法】 以检索粒度为主线,从技术路径、核心机制、创新与不足等维度,对比分析现有RAG方法。【结果】 构建“粗粒度-细粒度-混合粒度”的研究框架,粗粒度能保留上下文完整性但易引入噪声;细粒度能确保信息精确度却易导致语义碎片化;混合粒度虽旨在融合优势,但其融合与调度机制是当前的挑战。【局限】 侧重于文本型RAG研究方法综述,未全面覆盖涉及图像、音视频等多模态的RAG研究方法。【结论】 RAG技术的发展依赖于粒度选择的智能化和信息融合的精细化。未来可深入探索命题级检索粒度、动态粒度选择、自适应机制以及结构化与非结构化知识协同。
【目的】 提出一种客观、可解释性更强的阈值设置方法,提高文献数据挖掘的质量和效率。【方法】 通过引入节点度分布、同配性和巨分支规模占比等三种网络结构特性,揭示阈值设置和科学知识图谱性能间的关系。在此基础上提出阈值设置方法并进行实验验证。【结果】 在实验数据集中,本文方法生成图谱的重要节点、聚类和时序特征提取的平均准确率相比经验方法提升10个百分点,平均完整度提升7个百分点。【局限】 未在更多领域验证方法有效性。【结论】 在文献网络中,阈值设置与节点度分布、同配性和巨分支规模占比之间存在普适性关系。依据网络结构特性设置阈值能够提升科学知识图谱数据挖掘的质量。
【目的】 提出一种学科研究热点识别方法,增强对科学论文的语义理解,提升研究热点识别的客观性与准确性。【方法】 基于论文摘要构建复杂依存句法网络,并使用基于灰色关联分析的复杂网络节点重要性综合评价方法来评估节点重要性,从而识别热点研究主题。选取PubMed数据库中出版时间为2015~2024年间的近30万篇传染病学领域的文献摘要数据进行了验证与分析。【结果】 研究发现该领域的知识增长呈现出明显的分层特征,在保持核心研究主题稳定的同时,不断衍生出新的研究分支;每年平均识别出约8个热点主题,相比于LDA,本文方法不仅使研究主题的区分更加明确,还能通过保留修饰词等语义细节,更精准地追踪研究热点的具体变化过程。【局限】 对于极短文本中句法结构不完整的摘要处理能力有限,且对语法解析质量依赖较高,可能影响网络构建精度。【结论】 相较于传统方法,本文方法更能捕捉研究主题间的语义关联,有助于更全面、深入地理解学科研究动态。
【目的】 现有的认知诊断模型过于依赖知识概念之间的先决关系与相似关系,导致认知诊断模型在教育领域中面临自动化建模困难、关系稀疏及评估标准缺失等挑战。为解决这些问题,本研究提出了一种基于知识概念共现关系的多层图对比认知诊断模型。【方法】 首先,基于概念共现关系和相关共现关系构建知识概念双图谱;其次,采用多层图对比学习方法实现跨图概念节点嵌入的迭代增强;最后,将增强概念嵌入与学生-习题交互特征融合输入诊断函数中生成诊断结果。【结果】 在ASSISTments09、MAT2016和EdNet-1三个真实教育数据集上的实验表明,所提模型提升了诊断性能。以ASSISTments09和EdNet-1为例,模型的最优AUC分别达80.14%和73.74%,相比同数据集的最佳基线模型,分别提升了1.64%和1.32%,且各模型的可解释性也优于基线模型。【局限】 当前模型在处理习题结构相对简单、仅涉及单一知识点的场景时,可能无法充分发挥共现关系建模的优势。【结论】 基于概念共现关系的多层图对比认知诊断模型通过知识概念关系图构建与自适应的对比增强机制,有效捕获知识点间复杂的关联特性,实验结果证明了模型显著提升了知识状态预测的准确性。
【目的】 以专利-论文引用关系为视角,探究科学论文的颠覆性与其技术影响之间的关系,丰富科学知识流向技术领域的影响因素研究。【方法】 基于人工智能领域发表的68万余篇科学论文,结合专利引用数据,构建大型的数据集,应用Probit等回归模型,从可能性、重要性、广泛性、时滞性和持续性5个维度开展分析。【结果】 研究发现,科学论文的颠覆性程度与其被专利引用的可能性存在正向关联,说明颠覆性更高的科学知识更容易产生技术影响。同时,颠覆性更高的科学成果能够产生更重要、更广泛和更持续的技术影响,以及具有更短的技术影响时滞。【局限】 未考虑引用的动机与类型,未对引用论文的专利特征进行分析。【结论】 证实科学论文的颠覆性与技术影响之间的正相关关系,为促进科学知识的技术转化的政策制定提供了一定的理论依据。
【目的】 解决现有链路预测方法依赖局部图特征同时忽略专利技术网络中异质信息的问题,提高链路预测的准确性,以识别和预测中药技术机会。【方法】 本研究提出一种中药专利链路预测方法:使用MC-BERT进行主题建模,挖掘中药专利技术的核心主题;设计专利显隐双性关联评估机制,从显性和隐性角度捕捉中药专利技术主题的时间动态、技术特性及引用关系等异质信息,以构建中药专利技术多元关联网络;利用图Transformer捕捉专利技术间长距离依赖关系,提高预测的准确性;结合图对比学习以增强模型的鲁棒性,进一步优化链路预测效果。【结果】 在中药专利数据集上的实验结果表明,该方法单跳链路预测任务的AUC-ROC值和AUC-PR值分别提升至少2.52%和2.53%,多跳链路预测任务的AUC-ROC值和AUC-PR值分别提升至少0.56%和0.40%。【局限】 该方法对中药领域知识结构信息的显式表征相对有限。【结论】 该方法提高了链路预测的准确性,能有效捕捉中药专利技术主题之间的潜在复杂关联,为专利推荐、技术机会预测和创新决策提供可靠的支持。
【目的】 针对中医领域基于检索增强生成(RAG)的问答系统中检索过程缺乏控制、检索结果易包含干扰信息的问题,本文提出CycloFilter-RAG模型,以提升生成结果的准确性。【方法】 构建一种结合了适用于中医知识特征的过滤检索模块与循环知识检索策略的检索增强生成模型CycloFilter-RAG,通过动态调整检索过程优化生成结果质量。【结果】 对比实验结果表明,在基于中医知识的评估任务中,CycloFilter-RAG模型在ROUGE、正确率和专家评估三项指标上分别达到0.307(ROUGE-1)/0.116(ROUGE-2)/0.180(ROUGE-L)、0.75和8.59,表现均优于基线模型。消融实验进一步证实了过滤检索模块及循环知识检索策略的有效性。【局限】 所构建知识库中未包含所有中医经典文献,后续会引入更多中医文献,增强模型的泛化能力。【结论】 CycloFilter-RAG模型在降低构建成本的前提下,有效提升了中医知识交互的质量。
【目的】 针对现有方法在替代指标选取、特征体系构建、模型结构设计方面对专利商业化潜力与专利策略关联利用不足的问题,本文提出一种新的专利商业化潜力预测方法。【方法】 将专利实际维持时间是否超过设定阈值作为判断商业化潜力的标准,提出由特征处理模块与多任务并行预测模块构成的LSTM+MTNN模型。特征处理模块拼接数值特征与BERT+SimCSE及LSTM模型生成的文本连续特征,形成多任务并行预测模块的输入。多任务并行预测模块基于专利商业化潜力与法律事件的关联构建,包括人工神经网络实现的共性特征捕捉层、法律事件预测层与商业化潜力预测层,输出作为辅助任务法律事件预测与主任务商业化潜力预测的结果。【结果】 专利策略视角下专利数值特征体系具备合理性;LSTM+MTNN模型在专利商业化潜力预测上较对比模型表现更佳,尤其在较小数据集上优势明显。【局限】 专利文本信息利用方式有待深入研究;复杂技术环境中的专利商业化潜力的表示与预测方法有待探索。【结论】 预测模型输入上,权利要求文本特征有效充实了专利数值特征;预测模型结构上,法律事件预测模块的加入促进了任务间信息共享;二者对专利商业化潜力预测起“减熵”作用,能够帮助模型更好地作出判断。
【目的】 有效整合带有并列排名的期刊评级结果,反映学术界对出版物质量的总体评价。【方法】 提出一种基于线性伪布尔优化模型(LPBO)的期刊评级聚合方法,将不同的原始评级结果转换为期刊间的成对比较,利用广义Kendall-τ距离构建线性伪布尔优化模型,在保证期刊评级唯一性和传递性的约束下,实现评级结果的聚合。【结果】 对信息科学与图书馆学领域期刊的实证研究发现,LPBO聚合后的期刊排名不仅与原始评级具有更高的一致性,同时保留了并列排名信息。在处理不同尺度、不完整的数据以及期刊和评级数量不同时均表现出良好的稳健性。【局限】 在处理大型数据集时可能会面临效率低下的问题。【结论】 基于LPBO的期刊评级聚合方法避免了严格排序带来的人为误差,为期刊质量与影响力评价提供了一种公平且稳健的解决方案,具有重要的理论与实践价值。
【目的】 改进多语言预训练模型的多语言知识共享和对齐能力,提升其在多语言短文本情感分类任务上的性能。【方法】 提出一种基于上下文学习的多语言短文本情感分类方法ICL-S2MSO。首先,利用基于最大-最小语种相似度的样本选择模块从训练集中筛选最具代表性的上下文学习示例;然后,通过输入模板构建与填充模块引导模型输出预测结果;最后,构建多语言自洽性输出模块,集成多个不同语言的模板并利用高效微调策略提升模型输出的稳定性。【结果】 在包含12种非洲语言的多语言短文本情感分类数据集AfriSenti-SemEval上的实验表明,采用本文方法后,LLAMA3和InternLM2模型的加权平均F1值分别较原始基线提升2.15个百分点和2.71个百分点。【局限】 仅在短文本情感分类任务上进行了实证研究,且所用数据集主要集中在非洲语言,本文方法在其他文本类型和语系中的泛化性和鲁棒性有待进一步验证。【结论】 本文方法能有效提升多语言预训练模型在多语言短文本情感分类任务上的性能,为低资源语言情感分析提供了可行解决方案。
【目的】 解决传统Transformer模型在藏文新闻生成任务中面临的局部特征提取不足和解码冗余等问题,提升藏文新闻文本的生成质量、细节表达能力和语义连贯性。【方法】 利用标题和提示词作为关键输入,增强对文本主题的理解;在编码器中,Transformer捕捉标题全局特征,CNN提取提示词局部特征,通过加权融合形成精细的文本表示;解码器采用混合策略和自回归机制,逐步生成与输入紧密相关的新闻内容,减少冗余并提升文本的自然度和连贯性。【结果】 在自建的藏文新闻生成数据集上,本文模型的BLEU、ROUGE和Distinct指标分别达到38.9%、35.8%和47.2%,相较对比模型有显著提升。【局限】 主要针对藏文新闻生成任务,尚未验证本文模型在其他藏文文本生成场景(如文学创作、技术文档)中的适用性。此外,模型的计算效率和资源消耗仍需进一步优化。【结论】 本文结合全局与局部特征提取以及混合解码策略,显著提升了藏文新闻生成质量和细节表达能力,为藏文自然语言处理领域提供了一种创新性的解决方案。
【目的】 实现中文司法领域裁判文书高质量实体关系联合抽取任务,提升三元组抽取准确性。【方法】 提出基于CasRel实体特征敏感注意力机制的联合抽取模型S-CasRel-MF。模型引入LERT中文编码器增强对中文裁判文书复杂的语义建模能力,结合自注意力机制与BiLSTM提升实体在上下文交互特征的捕获能力,通过联合领域特征词典和多头注意力机制解决主客体抽取误差传播问题,利用Focal Loss损失函数缓解解码中样本不平衡问题。【结果】 实验结果表明,S-CasRel-MF模型在涉毒类和盗窃类两类数据集中的F1值分别达到83.51%和83.40%,相较于CasRel模型分别提高了9.77和8.73个百分点;相较于其他类型的抽取模型分别平均提高14.15和13.04个百分点。【局限】 S-CasRel-MF模型的时间复杂度较高,且外部法律实体特征词典在跨领域迁移时面临词典覆盖不足,影响模型效果。【结论】 S-CasRel-MF模型能更好地捕捉裁判文书中实体间的复杂关系,在实体关系的联合抽取任务中有显著性能优势。