"Token"的黄昏?AI新范式探秘AGI
type
status
date
slug
summary
tags
category
icon
password
网址

"Token"的黄昏?AI新范式探秘AGI
“我语言的局限,即意味着我世界的局限。”哲学家维特根斯坦的这句名言,在一百年后,以一种意想不到的方式精确描绘了大语言模型(LLM)所面临的结构性困境。如果AI的“语言”——也就是其核心处理单元——被限制在离散的token序列中,那么它的“世界”是否也因此被永久地困在了token所能表达的范围内?这不禁让我们重新审视那个古老而又迫切的问题:当前的大语言模型范式,能否真正带领我们走向通用人工智能(AGI)?
在AI领域,两位深度学习的殿堂级人物——OpenAI前首席科学家Ilya Sutskever和图灵奖得主Yann LeCun——在2024年至2026年间接连发声,似乎在为LLM的“黄金时代”敲响警钟。Sutskever预言“预训练即将终结”,而LeCun则更是直接宣判“大语言模型路线错了”,转而投身于他坚守多年的“世界模型”路线。
这并非否定当前大模型的强大能力和巨大的商业价值,它们的用户数量和渗透率仍在持续增长。然而,从技术演进的视角来看,两位大师的论断指向了一个结构性的天花板——一个恰好阻碍模型迈向AGI的瓶颈。
近期,来自MIT何恺明团队和字节跳动Seed实验室的论文,为这一讨论提供了工程实验的硬证据。它们表明,语言生成的核心建模过程不必局限于离散token空间,完全可以转移到连续的embedding或latent空间中完成,最后再映射回文本。这预示着,逐token预测或许只是通往AGI路上的一种“局部最优解”,而连续空间范式则可能打开一条通往更高天花板的道路。
01. 困在Token里的“世界”:理解天花板的本质
维特根斯坦的哲学洞见,可以用来理解AI当前面临的困境。人类的离散语言并非思维的原生格式。我们大脑中的认知活动是连续的、并行的、高维度的。当我们想到一个苹果时,激活的不是“苹果”这个离散的token,而是一系列复杂的连续神经活动模式,涵盖颜色、质感、重量、声音等。之所以将这种连续的体验压缩成“苹果”这个离散符号,很大程度上是人类大脑信息传递带宽的限制所致。
可以说,人类语言是进化设计的一种“有损压缩协议”,是跨脑传输的工程妥协。
而目前主流的商业化大模型,其底层架构多为自回归模型,它们在token序列这个“压缩协议的输出格式”上进行建模。这意味着它们极其擅长模拟人类的语言行为,但这种模拟与真正理解“世界如何运作”之间,存在着一道深刻的认识论鸿沟。
模型无法触及那些未被人类语言编码的“感觉”——比如身体感受的疼痛、空间直觉(知道如何接住球但无法精确描述过程)、或是具身因果干预的直观反馈(“如果我推倒这张椅子会怎样?”)。这些隐藏在人类大脑深处的“感觉”维度,从未被token序列所捕捉,因此无论模型参数多大、数据量多丰富,都无法真正触及。这就是token范式的根本性天花板。
02. “逃逸”Token:连续空间的新探索
正是在这样的背景下,第一批“逃逸”出token空间的实验正在发生。
MIT何恺明团队的ELF(Embedded Language Flows)项目,采用了一种反直觉的方法:将文字生成的全过程保留在连续向量空间中,仅在最后一步才将连续向量投影回人类可读的文本。它利用Flow Matching技术,从噪声出发,沿着学习到的速度场平滑演化至目标嵌入。令人瞩目的是,ELF仅用32个采样步就生成了超越离散模型1024步的结果,且训练数据量仅为主流方法的十分之一。
几乎同时发布的字节跳动Seed团队的Cola DLM(Continuous Language Model),则通过Text VAE将语言压缩至更深层的语义潜空间,然后在这个纯粹的语义空间中使用Flow Matching建模全局先验,最后再解码回文本。论文明确指出,其扩散过程是“潜在先验运输”,而非“token级别的观测恢复”。在与同等规模乃至参数量更大的模型对比中,Cola DLM展示了连续路线健康的Scaling曲线。
这两篇论文的核心信息一致:token并非语言建模的必要条件。在连续空间中进行建模,不仅可能更高效、更快速,也可能更节省资源。与自回归模型每一步都锁定离散选择不同,连续流模型在整个过程中保持了可逆性和可调性,仅在终点进行一次映射,这为AI理解和生成世界提供了更广阔的可能性。
03. 巨头布局:AI界的“去Token化”浪潮
学术界的突破信号,正迅速转化为科技巨头的战略投入。
Google 一直是“原生多模态统一”的坚定践行者。其Gemini系列模型,从设计之初就旨在打通文本、图像、音频、视频等多种模态,让它们在同一个模型中交错训练、共享注意力层。Gemini Embedding 2更是将这一理念推向了表征层面,一个模型原生接受多种模态输入,并将其映射到同一个统一的连续向量空间,彻底消除了模态间的边界。
OpenAI 的路径则更为曲折。GPT-4V的早期架构是拼接式的,而GPT-5系列虽强化了多模态能力,但架构细节仍未完全披露。尽管有报道称其在视频生成上遭遇算力挑战,但OpenAI正致力于将文本、视觉、视频能力更深地整合进核心模型。其对 Sora 的调整,可能意味着在等待更优架构方案成熟后再发力视频生成,但对多模态统一方向的认同是清晰的。
字节跳动Seed团队 在Cola DLM论文中明确指出,为离散文本与连续模态的统一建模指明了一条具体路径。结合其在视频生成模型Seedance系列上的实践,字节跳动凭借海量视频数据和前沿模型研究能力,正最有条件在工业规模上验证连续统一空间架构的潜力。
Anthropic 的选择则最为独特,它似乎在刻意回避多模态生成,将资源集中于文本推理和代码执行。这一策略在商业上取得了显著成功,Claude Code的年化收入已达25亿美元,推升了公司估值。然而,从长远范式演进来看,如果未来AI竞争的核心转向“在统一连续空间中理解与生成所有模态”,Anthropic的这一策略可能面临技术债。
在巨头之外,Ilya Sutskever创办的SSI和Yann LeCun创办的AMI Labs,分别代表了对AI下一代范式的独立押注。Sutskever对“预训练终结”的判断,指向了靠数据堆积的next token预测已到收益递减期,需要质变。LeCun的JEPA路线与ELF/Cola DLM的哲学相通,都旨在离开token空间,在连续表征空间建模。LeCun强调,自回归机制是在字符级别做统计复现,而非建模世界的因果规律,他认为“生成只是模拟,预测才是理解”。
04. 谁将失去未来?Token范式衰退的影响
如果“Tokenization”范式真的走向衰退,那么一批公司和产品叙事将面临重塑。
首先是依赖于视频tokenizer的公司,如VQ-VAE、MAGVIT、OmniTokenizer等,以及英伟达的Cosmos Tokenizer、微软的VidTok等。当语言生成的核心计算都开始迁移到连续空间,天然连续的视频数据更没有理由被强制压制成离散token序列。真正的问题将转变为:如何构建既能高效压缩又能保留足够物理、时序和语义结构的高效视觉表征。
其次,“多模态”这一产品叙事本身也将被颠覆。当所有模态都能在统一的连续空间中原生处理时,“多模态能力”将成为标配,而非差异化卖点。那些专注于模态桥接和对齐的中间层产品,也将因基础模型原生支持而失去生存空间。
更深层的影响将触及AI的商业定价体系。当前行业按token收费,是因为自回归模型的成本结构透明。但如果核心计算转移到连续空间,例如扩散模型可能用固定步数生成任意长度文本,输出长度与计算量脱钩,那么“消耗了多少token”将不再是成本的真实度量。AI商业价值的定价体系,正面临着被下一代范式重塑的可能。
05. Token范式能否抵达AGI?
回到最初的问题:大语言模型范式能走到AGI吗?
从token范式本身的结构来看,答案是“不能”。其训练信号存在信息论上的硬上限。人类语言作为一种有损压缩协议,在编码过程中已不可避免地丢失了世界的大量结构信息。在这些压缩产物上进行的任何建模,都难以完全还原被丢弃的维度。
然而,“杀死tokenization”也并非直接等同于抵达AGI。ELF和Cola DLM展示了连续空间的高效与优雅,但它们的训练数据仍源自人类输出的内容,即一个经过压缩的世界。Yann LeCun看到了这一点,因此他押注于“能预测物理后果的世界模型”。Ilya Sutskever的思考可能也触及了这一层面。
这或许只是第一步。当模型不再受困于人类语言的压缩格式时,它需要新的训练信号从何而来?答案可能不在于更多的数据,而在于某种形式的主动探索——在真实世界中行动,承受后果,并通过反馈进行学习。这正是当前备受关注的“递归自我改进”(Recursive Self-Improvement, RSI)所探讨的方向,也是AI发展中一个值得持续关注的议题。
---
访问 aigc.bar 获取最新的AI资讯、AI新闻、AI门户内容,了解AGI,LLM,大模型,提示词,openai,chatGPT,人工智能,claude,AI日报,Prompt,AI变现等前沿动态。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)