深度解读「书生·端砚」:大模型如何重塑AI科研范式与AGI未来
type
status
date
slug
summary
tags
category
icon
password
网址
一名顶尖实验室的材料研究员,最无力的瞬间,从来不是想不出创新思路,而是 AI 一天推演上百种新配方,人工实验一年测不完;
最可惜的损耗,不是实验本身的失败,而是随着项目结束、人员更迭导致数据、经验、参数未能有效存留,让下次的研究需要重复起步、反复试错。
这并非是科研人员的个人难题,某种程度上折射出当前 AI for Science(AI4S)赛道中一个值得关注的结构性矛盾。
当下,人工智能的迭代速度加快,模型参数不断扩容、智能体运行能力稳步提升,曾经按月交付的软件任务,如今以天、甚至小时为单位在快速落地。
行业普遍形成一种共识:沿着现有技术路径持续优化迭代,AI 的通用能力将保持稳步进阶。
但一组真实的行业对比数据,也提示我们对 AI 全能进化的认知要回归理性。
过去十八个月,AI Coding 领域暴热,任务成功率从不足 5% 飙升至 88%,代码生成、自测迭代的闭环已经跑通,赛道增量空间逐步收窄。
反观核心的原创科学研究领域,技术迭代节奏相对平缓。
主流大模型的科研任务完成率在 3% 左右,在 NatureBench 涵盖的 90 项顶级真实科研任务,最优智能体能超越原始论文成果的比例为 17.8%。
这一冷热不均的行业反差,清晰界定了当前 AI 的能边界:大模型更擅长处理答案固定、反馈即时的标准化任务,面对无标准答案、问题维度模糊、验证周期漫长的原创科研场景适配性相对有限。
AI 已熟练掌握高效编码、标准化解题的能力,但在未知领域的自主探索、原创科研创新上,仍存在明显短板。
上海AI实验室主任、首席科学家周伯文认为,这种能力差距的核心,是当前大模型普遍缺失科学元认知:
它能精准调用海量已知知识,却无法识别知识的边界;
能生成看似自洽的推演结论,却不会自主提出可证伪的科学假设;
能基于文本做概率拟合,却无法在真实世界的反馈中修正、重构自身认知。
标准化解题与原创科研探索的核心差异,正体现在这一点。
究其本质,当前 AI 科研的核心短板,并非知识储备不足,而是极度缺乏真实科研场景的失败样本与负反馈。
编程场景具备秒级反馈、即时证伪的迭代特性,任务对错可快速判定;
而基础科研试错成本高、验证周期可达数月,失败类数据公开度低、有效反馈样本稀缺。
模型训练大多依托公开的成功论文成果,难以学习海量真实试错背后的底层逻辑,最终形成擅长模仿复用、弱于原创突破的行业现状。
这一现状,进一步凸显了 AI 科研的两大核心瓶颈,制约着技术深度落地:
一方面,大模型可快速推演生成海量科研方案,但线下实验验证效率偏低、进度滞后,逐步形成方案堆积、验证滞后的行业痛点;
另一方面,科研试错经验、实验数据缺乏系统化留存渠道,导致科研工作容易陷入重复试错、低效迭代的状态。
两大瓶颈限制了 AI 科学研究的落地上限,让多年来的 AI4S 技术探索,更多停留在浅层效率提升阶段,难以实现科研范式的颠覆性突破。
WAIC 2026,上海 AI 实验室发布了「书生·端砚」科学发现平台,有望为长期存在的科研结构性矛盾提供一种新的思路与解决方案。
区别于行业内多数产品依托大模型适配科研场景、实现浅层提效的优化模式,「书生·端砚」以干湿实验闭环迭代、科研资产沉淀为核心能力,补齐 AI 科研缺失的真实场景反馈链路,推动 AI 科研应用从单点效率优化,迈向科研范式升级的全新阶段。
真正的科学智能,并非简单的文献阅读、数据计算,而是能够对接真实物理世界的反馈、沉淀可复用、可迭代的科研资产,这也是 AGI4S 领域需要长期探索的核心目标。
补齐 AI 科研反馈滞后短板打通数字推演与实体实验链路
当前 AI 科研普遍存在推演高效、落地困难的痛点,核心症结在于真实场景反馈机制的不完善。
大模型依托海量文本数据完成训练,擅长基于存量知识开展推演生成,短时间内即可产出大量蛋白质序列、新材料配方、量子排布等科研方案。
但传统科研验证体系与之适配性不足:湿实验依赖人工操作、设备体系分散、流程繁琐,整体通量低、周期长、成本高,一次完整的科研验证往往需要数天甚至数月。
缺少真实实验校验、失败数据修正和物理世界反馈纠错,AI 的各类推演结果,本质上是基于文本数据的概率拟合,尚未完全实现对真实科学规律的精准探索与验证。
行业头部玩家也在持续探索突破:
Anthropic 最新发布的 Claude Science,接入 60 个科学数据库,可依托自然语言驱动多步骤科研流程;
OpenAI 推出的 GeneBench-Pro,聚焦基因组学、定量生物学真实场景,专项评测 AI Agent 处理模糊数据、完成多阶段科研判断的综合能力。
但目前行业主流方案,大多仍局限于读(文献)、算(模型计算)的纯数字化场景,尚未完全打通数字推演到物理实验验证的完整闭环,很难支撑高价值的原创科学研究落地。
「书生·端砚」的核心突破在于构建了「读-算-做」一体化闭环,补齐 AI 科研最关键的真实场景反馈链路,打通了数字推演到落地实体实验的关键环节。
依托专属的具身自主实验体系,平台打破了仿真计算与实体实验的场景壁垒,搭建起干湿自主迭代的闭环:AI 自主生成科研假设 → 智能体完成多维度仿真筛选 → 自动化实验设备承接落地测试 → 实测数据实时回流迭代。
搭配多智能体协同核验系统,全流程无需人工跨平台搬运数据、手动适配格式,可实现自主运转、自动纠错。
这套运行机制,从根源改善了 AI 缺乏有效反馈迭代的短板,让每一次模型推演都能对接真实实验校验,每一次推演偏差均可得到及时修正,有效改善纯模型推演脱离实操场景的问题。
落地成果直观印证了这套闭环的应用价值:
在蛋白质工程赛道,平台将传统数天的迭代周期压缩至分钟级,验证通过率提升超 3 倍,彻底告别「AI 推演、人工苦熬」的低效模式;
在量子计算领域,依托极速闭环验证能力,创下 60 毫秒搭建 2024 原子无缺陷阵列的全球新纪录,让前沿理论快速落地为可复用的技术成果。
整体而言,「书生·端砚」的核心价值,并非单纯提升计算效率,而是针对性解决行业普遍存在的推演产出多、落地验证难、偏差修正慢、成果转化弱的核心痛点,为 AI 科研植入真实世界的迭代逻辑,推动模型从标准化工具,升级为可探索未知领域的科研协作载体。
反低效内卷沉淀科研复利资产
如果说验证滞后制约了科研即时落地效率,那么科研经验的零散流失,便是影响 AI 科研长期进化的核心因素,也是大模型科学探索能力增长缓慢的深层原因。
传统科研体系存在致命的机制短板:各类实验参数、失败案例、仿真代码、分子结构、测试数据,全部零散存储在个人电脑、孤立设备、单次项目中,缺乏统一的归档、沉淀、复用机制。
一旦遇到团队更迭、项目结题收尾,大量试错经验、核心失败数据便容易流失浪费。
文献数据、实验数据的抽取和沉淀
这也造就了科研领域低效内卷的现状:
AI 持续拟合公开的成功科研数据,却难以触达科研场景中占比超 90% 的试错数据;
前人验证过的无效方案、踩过的技术误区,后续研究仍会重复尝试;
已被证伪的科研路径,模型依旧会反复推演。
导致科研工作仅有单次试错成本消耗,无长期迭代收益,即便 AI 通用能力持续升级,原创科学研究成果依旧进展缓慢。
「书生·端砚」搭建的全流程科研资产结构化沉淀体系,可有效破解科研经验流失难题,重构科研长期迭代的底层逻辑。
平台将资产沉淀机制深度融入「假设-仿真-实验-回流」全科研链路。
所有公式图表、实验参数、运行代码、成败数据、推演日志,均会按照专业标准自动结构化归档、统一留存、全程留痕。
尤其是行业长期忽略的海量失败数据、无效试错参数,均可完整留存,补足了 AI 科研训练中稀缺的负样本数据。
更具价值的是,平台沉淀的科研资产并非静态存档数据,而是可复用、可迭代、可持续反哺模型的动态核心资源。
跨项目、跨团队可快速检索复现、二次调用,大幅减少重复试错的无效工作;
同时,涵盖成功与失败的全量真实实验数据,可持续反哺大模型迭代优化,稳步提升 AI 的科研判断力与推演精准度,让模型能够依托真实试错数据总结规律、探索未知。
这是一次科研底层逻辑的优化升级:
传统科研模式下,实验结束即流程收尾,失败数据大多作废闲置;
平台赋能下,实验完成即资产沉淀,数据积累持续驱动科研进阶。
每一次试错、每一组数据、每一轮推演,都不再是单一科研的成本消耗,而是支撑后续创新、驱动 AI 科研能力进化的核心资产,有效帮助科研工作实现复利式增长。
「书生·端砚」并非单纯升级的文献处理大模型,而是一套完整落地「假设推演—仿真计算—实体实验—数据回流」全链路的科学智能系统。
目前,平台已在蛋白质工程、量子计算、脑科学、新材料研发、半导体、地球气象六大前沿科研领域落地应用,适配多场景原创科研需求。
AI 赋能科研的终极价值,不是替代研究员思考,而是聚焦前沿核心创新,推动AI从标准化的算力工具,进阶为可探索未知、可持续迭代的科研协作伙伴。
正如周伯文所言,AI 的使命应从「加速科研自动化」迈向「以复杂科研任务牵引高阶智能」。
「书生·端砚」的技术探索与落地实践,走的正是这条路——它不是替代科学家做判断,而是帮助科学家更快地验证判断、更系统地沉淀判断,让每一次实验的反馈,都能成为下一次假设的起点。
参考资料:
迈入AGI科学元认知时刻,『书生·端砚』解锁全栈科研新能力 | WAIC 2026
周伯文:AGI的下一程,迎接科学元认知时刻 | WAIC 2026
文章来自于微信公众号 “新智元”,作者 “新智元”
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)