中科大突破大模型终身学习,KORE框架解困知识注入
type
status
date
slug
summary
tags
category
icon
password
网址

随着人工智能技术的飞速发展,大型语言模型(LLM)和大型多模态模型(LMM)已成为推动各领域创新的核心驱动力。它们通过海量数据预训练,积累了丰富的静态知识,在理解和生成方面表现出色。然而,现实世界瞬息万变,新知识层出不穷。模型的“上线即过时”问题,以及在注入新知识时出现的“灾难性遗忘”现象,严重阻碍了它们在动态环境中持续学习和保持最新状态的能力,即“终身学习”的实现。
近期,中国科学技术大学(中科大)的研究团队在这一关键领域取得了突破性进展,连发两篇顶会论文,并发布了首个动态多模态知识注入基准MMEVOKE和全新的双阶段框架KORE,为大模型终身学习开辟了全新路径。
深度解析大模型知识注入的双重困境
当前,主流的大型多模态模型(LMMs)在处理静态、海量数据上表现卓越,但面对现实世界中不断涌现的动态演变知识(Evolving Knowledge),如新出现的品牌、事件或科学发现,它们往往力不从心。这主要源于多模态持续学习领域存在的两大核心缺陷:
- 静态知识注入的局限性:现有研究多集中于文本领域的知识编辑,对于动态、多模态演变知识的注入研究相对匮乏,无法有效捕捉和整合实时变化的信息。
- “知识注入”的双重困境:当尝试通过参数微调等方式向模型注入新知识时,普遍陷入“新知学不准,旧能保不住”的“双重困境”。一方面,模型难以准确理解和泛化新出现的动态知识;另一方面,注入新知识的过程极易触发灾难性遗忘,导致模型原有通用能力(如指令跟随、多轮对话等)断崖式下跌。这种能力退化并非孤立发生,而是呈现出一种“级联遗忘链”,一旦基础指令跟随能力崩溃,将引发多米诺骨牌效应,瘫痪模型的其他核心能力。
MMEVOKE:首个动态多模态知识注入基准
为了科学量化和深入解构模型在面对动态演变知识时的退化行为,中科大团队构建了首个动态多模态知识注入基准——MMEVOKE。该基准包含9,422个样本,横跨新闻与实体两大领域,覆盖159个细分行业子类。
MMEVOKE的构建过程采用了自动化的数据构建流水线,能够高频、高质量地捕获现实世界中动态演变的信息。通过在MMEVOKE上对现有知识注入方法进行大考,研究团队发现,即使提供充足的外部上下文,模型在利用和推理动态演变知识方面仍表现出极大的不足。更令人担忧的是,实验结果揭示了参数微调方法在注入新知识时,其通用能力的严重退化,且不同微调手段(如Full-FT、LoRA)在能力退化 Ranking 和级联效应上表现出高度一致性。
KORE:突破困境的双阶段优化框架
为了打破“知识注入”的双重困境,中科大团队提出了KORE(Knowledge-Oriented Controls)框架。KORE是一个以知识导向控制为核心的双阶段优化微调框架,旨在实现“知识适应”与“能力保留”的闭环协同。
KORE-AUGMENTATION:构建结构化“知识树”,深化新知内化
KORE框架首先通过KORE-AUGMENTATION自动化数据增强流水线,对外“做加法”。该机制将孤立的知识点(如一条关于新闻事件的图文信息)扩展为结构化、多层次的对话和指令数据,形成一棵“知识树”。这个过程利用GPT-4o等先进模型,将单一知识点“发酵”成高质量、多形式的训练数据集(例如KORE-74K),让模型不再是死记硬背,而是真正理解、推理并灵活运用新知识,实现深度内化。
KORE-CONSTRAINT:利用“零空间”约束,锁定旧能力
对外做加法的同时,KORE框架对内“做减法”,通过KORE-CONSTRAINT知识约束机制,在微调时找到一个几乎不干扰旧知识的“安全”更新方向。该机制基于一个核心假设:LMM的预训练知识可以被视为其内部激活值在特定输入下的分布模式,这些模式由协方差矩阵捕捉。KORE-CONSTRAINT通过将微调更新方向与代表旧知识的模式“正交”(即位于协方差矩阵的零空间中),最大程度地避免对旧知识的干扰。具体实现上,利用奇异值分解(SVD)找到协方差矩阵的零空间,并通过投影矩阵将更新引导至此“安全”区域,从而实现注入新知识的同时,对旧知识的强大保护。
性能亮点与未来展望
在LLaVA-v1.5和Qwen2.5-VL等主流LMM上的广泛实验表明,KORE框架在各项知识注入任务上均展现出全面领先于Full-FT、LoRA、EWC、Replay等现有方法的性能。它不仅能有效注入新知识,更能显著保留模型原有的通用能力,且在不同模型尺寸和结构上表现出良好的泛化性。
KORE框架的成功验证了“增强”与“约束”协同作用的重要性。通过构建动态多模态知识注入基准MMEVOKE,并提出KORE这一集数据增强与参数约束于一体的创新框架,中科大团队为解决大模型在动态知识注入时面临的“学不准”与“忘得快”双重困境提供了完整的闭环解决方案。
未来,这一研究成果将为构建具备真正“终身学习”能力的新一代大模型奠定坚实的技术底座,使其能够持续适应并引领不断变化的智能时代。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)