【目的】 系统梳理数据蒸馏研究进展,明确核心挑战与未来方向。【文献范围】 以“数据蒸馏”、“Dataset Distillation”等为关键词,检索中国知网、Web of Science、谷歌学术等数据库,筛选2021年-2025年相关文献87篇展开综述。【方法】 系统剖析基于元学习与数据匹配的基础算法及其代表性工作,结合多领域应用场景分析数据蒸馏的技术特性与实施挑战。【结果】 数据蒸馏在计算机视觉、智慧医疗、推荐系统、自然语言处理和图学习领域表现优异,但存在基础理论不完善、合成数据质量待提升、隐私保护需加强等问题。【局限】 侧重已有研究梳理与应用分析,对算法原理深层推导及复杂场景适配验证不足。【结论】 数据蒸馏是一项具有广泛应用前景的技术,未来需从理论建模、合成数据质量、技术融合等方面推动其实用化。
【目的】 对关键核心技术识别相关成果进行系统综述,厘清其研究重点与发展脉络,以期为后续研究提供参考。【文献范围】 基于关键核心技术的系统分析制定检索式,在Web of Science和CNKI数据库中进行文献检索,获取661篇论文进行定量分析,经人工筛选得到61篇代表性文献进行综述。【方法】 首先,归纳关键核心技术的概念特点及检索策略以明晰综述范围;其次,分析关键核心技术的特征体系及识别标准以厘清研究思路;然后,整理关键核心技术的识别方法及分类体系以明确研究框架;最后,探讨现有研究的局限问题及不足之处以展望研究趋势。【结果】 关键核心技术具有重要性、创新性、价值度、保护度和辐射性五大特征,其识别标准有采用单特征、双特征和三特征及以上三类,其识别标准的计量方法可分为基于专家智慧与基于数据驱动两大类,后者又可分为依托计量统计、依托文本挖掘以及依托深度学习三种类型。【局限】 以人工筛选得到的代表性文献为基础进行综述,可能未全覆盖相关研究。【结论】 需要综合利用不同方法的优势,探索新的数据源,解析关键核心技术动态演化规律以全面精准地识别关键核心技术。
【目的】 围绕AI场景下科学数据的共享与利用问题,针对现有FAIR原则不足以指导科学数据满足AI就绪的现状,构建面向AI就绪的科学数据共享与利用原则框架。【方法】 通过系统梳理传统机器学习、大模型预训练、大模型微调、检索增强生成及智能体等5类典型AI任务的数据需求,在传统FAIR“四可”维度的基础上,提出面向AI就绪(即For AI Ready)的科学数据共享与利用原则框架FAIR×FAIR,进而提出与框架相适应的层次化技术栈。【结果】 FAIR×FAIR框架明确了13项科学数据满足AI就绪的技术要求,为弥合AI任务与科学数据之间的语义鸿沟提供了系统化方案。【局限】 本研究提出的原则框架其实施效果仍需通过后续领域应用案例进一步验证。【结论】 FAIR×FAIR框架为AI时代的科学数据共享与高效利用提供了理论依据和实践路径,对推动数据驱动型科研范式的演进具有重要意义。
【目的】 探讨在具有较高专业性和领域特色的中文医学文本实体关系抽取任务中,大模型提示工程方法能否替代经典深度学习模型。【方法】 使用GLM-4、ERNIE-4-Turbo、DeepSeek-R1三种大模型和CBLUE、CasRel、GPLinker三种经典深度学习模型,通过改变需要抽取的关系类型数量、大模型Prompt中的示例数量以及经典深度学习模型的训练数据规模,系统比较基于提示工程的大模型与经典深度学习模型的性能差异。使用BERT-Base和RoBERTa作为经典深度学习模型的编码器。【结果】 在CMeIE-V2数据集上的实验结果表明:(1)RoBERTa-CBLUE和RoBERTa-GPLinker的抽取效果最好,在抽取一种关系类型时F1值达到0.582 6和0.585 3,抽取10种关系类型时F1值为0.511 2和0.493 4;(2)大模型不擅长同时抽取多种关系。GLM-4、ERNIE-4-Turbo和DeepSeek-R1抽取两种关系类型的F1值比抽取一种关系类型时分别下降0.118 2、0.088 5、0.131 0;(3)在Prompt中添加示例可以提高大模型的抽取效果,但示例数量并不是越多越好。【局限】 仅在单一数据集上进行实验,未拓展至更多领域的数据集。【结论】 大模型提示工程方法目前难以替代经典深度学习模型,仅能够在标注样本较少时作为备选项。
【目的】 探寻可解释性和解释精度与信息采纳行为的作用关系,优化多场景适用的可解释设计。【方法】 通过两个不同情境的平行实验,分析人工智能可解释性、解释内容关联度对用户信息采纳的影响,探讨不同任务信息需求情境下人工智能“解释奇点”的变化规律。【结果】 人工智能的可解释性对用户信息采纳具有显著影响,其具体的影响关系受制于内容关联度的制约;“解释奇点”是可解释设计作用于信息采纳行为的转折点,不同任务情境下“解释奇点”存在一定变化。【局限】 未考虑虚假信息的存在,对可解释人工智能与用户信息采纳“效果”的揭示较为有限。【结论】 本研究在多情境视角下揭示人工智能生成内容(AIGC)解释信息采纳机制差异,挖掘了“解释奇点”的变化规律。该发现不仅揭示了解释关系与内容关联度在驱动用户信息采纳中的关键作用,更强调其对用户信息采纳行为的边际影响。
【目的】 在将论文及其属性数据建模为知识图谱的基础上,细粒度聚合论文属性数据的时序演化信息,提升新发表论文引用数量预测的性能。【方法】 提出一种基于时序演化与细粒度信息聚合的引用数量预测模型,该模型由图邻域特征聚合模块、时序演化表示模块、细粒度信息聚合模块和预测模块组成。图邻域特征聚合模块获取知识图谱中学术实体的特征表示;时序演化表示模块获取论文属性数据的时序演化特征;细粒度信息聚合模块通过多头注意力机制聚合不同属性数据对论文的影响;预测模块输出引用数量预测结果。【结果】 本文模型在DBLP数据集上的MALE、RMSLE和R2指标分别为0.514 1、0.709 8和0.347 0,显著优于对比模型。【局限】 仅使用DBLP数据集验证模型效果,未来将在更多数据集上验证模型的泛化能力。【结论】 本文研究揭示了利用论文属性信息的时序演化特征以及细粒度信息聚合可以提高对新发表论文的引用数量预测性能。
【目的】 分析跨学科领域的术语词在不同学科间存在的语义差异现象并挖掘其原因。【方法】 使用预训练深度学习模型实现自动化识别和量化术语的语义差异,设计构建语义差异程度指标定量衡量语义差异程度,并对术语所涉及学科进行共现分析。【结果】 基于预训练模型的语义差异现象识别准确率达到0.819 3,所构建度量指标能够对语义差异进行有效量化。【局限】 研究局限于中文术语的语义差异,选取术语学科跨度范围有限。【结论】 挖掘出跨学科术语存在语义差异现象的主要原因有:学科专业化和知识分化、语言及语境的差异、概念的层次化和抽象化、认知侧重层面的差异以及跨学科交叉与融合影响等,为探究术语差异背后的原因及其与学科之间的关联提供了新的视角和方法论。
【目的】 解决古籍文本因语言复杂性、多样性及标注数据缺乏而带来的命名实体识别难题。【方法】 构建一种融合古籍知识库和AI-Search的检索增强生成框架,结合LATS框架的生成、搜索、反思与修正机制,优化大语言模型在古籍领域的零样本命名实体识别性能。【结果】 在CHisIEC公共数据集上的实验表明,与古籍领域微调模型Xunzi-Qwen1.5-7B-Chat相比,本文方法的Micro F1值提升14.44个百分点,与Qwen1.5-7B-Chat相比提升16.99个百分点。【局限】 Prompt构造方法有进一步优化空间;LATS框架计算复杂度较高,可能影响大规模数据场景的效率。【结论】 检索增强生成有效增强了大语言模型的领域知识,LATS框架优化了大语言模型输出的准确性与条理性,显著提升了大语言模型在古籍领域零样本命名实体识别任务上的性能。
【目的】 在多领域科技实体抽取任务中,科技短文本通常存在因语义稀疏导致上下文信息不足、知识实体领域跨度大、实体边界模糊等问题。由此,本研究提出一种基于知识提示学习的Scientific Prompt知识实体抽取策略。【方法】 首先提出以科技问题为基本切分单元的实体边界识别方法,以明确短文本中的知识实体边界;其次,利用知识蒸馏技术构建自动标注体系,获取小规模高质量多领域实体数据集。在此基础上,设计了包含BERTopic动态采样与自我一致性校验的两阶段Scientific Prompt策略,借助BERTopic将领域知识动态引入提示词中,以扩展稀疏短文本语义上下文。【结果】 在Scientific Prompt策略作用下,Qwen2.5-7B、Qwen 2.5-7B(微调)与GPT-4o的F1值分别为0.652 6、0.740 7、0.787 8;而Zero-Shot下对应模型的F1值分别为0.553 4、0.616 5、0.682 2。在短文本-多领域实体抽取任务中,Scientific Prompt策略作用下的开源模型略优于对其微调的效果(0.652 6 vs 0.616 5);该策略作用下的微调Qwen 2.5-7B模型表现略优于仅使用GPT-4o的效果(0.740 7 vs 0.682 2)。【局限】 仅测试了Scientific Prompt策略在中文科技短文本上的表现。【结论】 与微调方式相比,Scientific Prompt策略无需更新模型参数即可显著提升大语言模型在短文本-多领域知识实体抽取任务中的性能。在大规模无监督科技短文本中,Scientific Prompt策略可以有效提升大语言模型在多领域知识实体识别中的语义理解和感知能力,增强抽取的精确性和泛化能力,为通用型中文科技短文本知识实体抽取任务提供了重要的技术路径参考。
【目的】 提出一种基于静态与动态异构图嵌入的全局引文推荐模型,以提高引文推荐的准确度。【方法】 首先分别构建静态加权异构网络与时序异构网络。在静态异构网络中,利用混合随机游走和Skip-Gram模型生成能捕捉网络局部与全局信息的节点嵌入;基于所构建的时序异构网络,先利用基于元路径的随机游走获得元路径实例,再建模异构图中的时态演化特征,以获得图中节点的嵌入式表示。然后利用联合训练与独立训练两类方法整合获得图中论文节点的最终嵌入表示。最后通过计算相似度为输入论文生成候选引文推荐列表。【结果】 所提模型的实验性能均优于只考虑动态或静态的方法,其中独立训练方法在几乎所有召回率指标(除Recall@40之外)上表现最佳,自适应任务不确定性加权方法在MRR与MAP指标上表现最佳,分别达到0.308与0.297。【局限】 未在多个数据集中验证所提模型的性能;算法的运行效率尚需优化提升。【结论】 综合考虑网络静态和动态性能有效提升全局引文推荐的性能。
【目的】 构建可解释集成学习模型,为预测电影IP衍生品的开发效果提供新的决策方式。【方法】 基于价值链理论解析电影IP衍生品开发过程,构建预测指标体系;基于K-Medoids-LLM-LightGBM-BorderlineSMOTE模型对影响因素进行提取筛选,构建预测标签;提出基于AWStacking的开发效果预测模型。【结果】 以XGBoost、CatBoost、RF为基学习器,LR为元学习器的AWStacking算法预测效果最好,宏平均精确率为0.869 9,宏平均召回率为0.788 9,宏平均F1值为0.821 6。【局限】 受目前数据可得性的限制,关于电影IP衍生品开发效果衡量指标可以进一步细化,提升指标测量的细粒度。【结论】 所构建的模型为电影IP衍生品开发效果的预测提供了依据,有助于推动电影IP衍生品市场的健康发展。
【目的】 针对现有高校慕课学习行为检测中数据特征多以并列或浅层方式建模,难以实现语义层面的有效融合,且模型决策过程不透明的问题,提出一种大语言模型驱动的学习行为检测模型。【方法】 研究集成大语言模型、检索增强生成与可解释人工智能技术,对学习者行为与文本数据进行联合建模,形成融合学习行为特征与情感特征的文本-时间序列表征。采用BERT模型提取文本数据并转换为时间序列数据,采用LightGBM模型进行训练,并结合SHAP方法量化各特征对模型预测的边际贡献,实现预测过程的可解释性。【结果】 所提模型在学习行为检测任务中表现优异,准确率达到99.90%,召回率为99.78%,F1值为97.69%,均优于所有基线模型。与性能最低的逻辑回归模型相比,三项指标分别提高了17.23、19.53和17.57个百分点,验证了模型在复杂特征识别中的优势。【局限】 数据来源于单一在线学习平台,样本粒度较粗,在跨平台与不同教学情境下的外部泛化能力仍需进一步检验。【结论】 通过引入可解释性人工智能技术并融合时间序列与文本等多源特征,有效提升了模型的准确率与可解释性,为高校在线教育平台提供决策支持。