生物学AI Agent瓶颈揭秘:模型强大,数据基建待升级
type
status
date
slug
summary
tags
category
icon
password
网址
人工智能(AI)Agent的飞速发展,尤其在软件工程领域的亮眼表现,让科学界对其在生物学领域大展宏图充满期待。从药物设计到病毒监控,再到复杂的生物学建模,人们渴望AI智能体能够以前所未有的速度,帮助人类突破科学前沿。然而,现实却不尽如人意,生物学AI Agent的发展速度远落后于编程领域。
近日,AI研究机构Anthropic发表了一篇题为《为生物学智能体铺平道路》(Paving the way for agents in biology)的科学博客,深入剖析了这一现象。文章由生物学家兼机器学习研究员Laura Luebbert撰写,她提出了一个核心观点:阻碍生物学AI Agent爆发式发展的瓶颈,并非底层大模型的推理能力不足,而是人类现有的生物学数据基础设施极其落后,未能适应Agent的需求。
生物学数据基础设施:为“汽车”而建的老城?
作者巧妙地用一个类比来解释生物学数据基础设施的困境:让AI Agent操作生物数据,如同让现代汽车穿梭于一座为马车时代设计的古老城市。这座城市街道狭窄曲折,导航系统(数据格式、数据库、检索脚本)混乱且不统一,现代车辆(AI Agent)难以顺畅通行。尽管可以尝试添加交通标志或拓宽道路,但其根本布局是为旧式交通方式设计的,难以适应现代需求。
相比之下,软件工程领域的基础设施则像是为汽车量身定制的现代城市:铺设整齐的道路(版本控制、清晰的API、包管理器)、明确的车道和信号灯(标准化接口、文档)。这使得Coding Agent能够高效运行,而生物学Agent则面临巨大挑战。
计算生物学中用于数据检索和验证的基础设施,普遍存在脆弱、异构(heterogeneous)且高度依赖具体流程的问题。这就迫使操作这些基础设施的工具必须高度定制化,仅适用于特定领域或特定假设。
缺乏可验证的奖励信号与确定性执行层
软件开发的一大优势在于其结果易于测试和验证。例如,一个Agent提交的代码补丁,只要通过项目测试,其有效性就能迅速得到确认。但在生物学领域,这种简单、可验证且有意义的奖励信号却极为稀缺。
此外,生物学Agent缺乏一个广泛可用的、确定的执行层来支持对生物数据的查询。科学家可以清晰地表达意图,如“查找所有具有特定结构域的人类激酶并提取其结构”,但Agent往往缺乏一条可靠的路径来访问包含这些信息的数据库。
生物学研究的严谨性在于细节。即使是微小的错误,如使用错误的基因组版本、混淆数据库记录(RefSeq vs. GenBank)、误解元数据字段等,都可能导致后续生物学解释的失效,其后果可能是灾难性的。这种对细节的极致要求,使得Agent在处理生物数据时面临巨大风险。
Karpathy的“吐槽”与生物学Agent的共鸣
Anthropic博客作者指出,Agent与人类构建的工具之间的“摩擦”并非生物学领域独有。当Agent进入任何为人类点击操作而设计的复杂环境时,都会遇到类似问题。
例如,提到Andrej Karpathy在一次演讲中抱怨,使用“Vibe Coding”构建一个小型Web应用时,身份验证、支付、部署等环节耗费了他大量时间在浏览器中进行繁琐的点击操作。Karpathy感慨:“代码本身反而是最容易的部分!大部分工作都在浏览器里,靠点击完成。”他强调,必须为Agent重新构建这些流程。
这与生物学研究人员长期以来面临的痛点不谋而合:我们试图让智能系统在一个充满异构信息、隐含约定和大量人工操作流程的环境中工作,而这个环境是为人类的“点击”习惯设计的。
病毒学“点击税”:NCBI Virus的挑战
病毒学是生物学领域中一个尤为复杂的场景。从疫苗设计、诊断试剂开发到蛋白模型训练数据构建,很多研究工作的第一步都是从NCBI Virus检索序列。NCBI Virus整合了GenBank、RefSeq等数据,并通过网页界面提供访问。
然而,围绕NCBI Virus的数据整理流程,常常以一系列复杂的筛选条件形式在研究人员之间传递。用户必须在网页界面中手动复现这些条件,这正是Karpathy所抱怨的“浏览器点击式工作流”。
以2026年5月中旬刚果爆发的Bundibugyo埃博拉病毒疫情为例。一线研究人员测序出病毒基因组后,公共卫生官员需要立即回答:新病毒与哪些历史毒株相似?其传播链如何?是否出现关键突变?要回答这些问题,第一步就是将新基因组与NCBI Virus数据库中的历史数据进行比对。但构建这种对照数据集的过滤条件极其复杂,研究人员必须在复杂的Web界面中手动勾选数十个过滤器。这对人类来说枯燥乏味,对旨在提升效率的AI Agent而言,则是一场“灾难”。
VirBench基准测试:Agent的真实表现
为了量化Agent与生物数据库之间的鸿沟,Anthropic团队构建了一个名为VirBench的基准测试。该测试包含120个模拟真实场景的病毒序列查询任务,覆盖40种病原体,并附有专家验证的标准答案。
测试结果显示,即使是顶尖模型(如Claude Sonnet 4、Claude Opus 4.7、GPT-5.2-pro、GPT-5.5),在处理这类查询时的平均准确率也仅在16.9%到91.3%之间。这意味着,即使是最前沿的模型,也无法稳定达到构建可靠数据集所需的准确性和可复现性。
科学研究的标准几乎必须接近100%。一个微小的检索差异,可能导致诊断试剂无法覆盖当前病毒多样性,或影响疫情溯源的判断。更令人担忧的是,同一模型在相同问题上重复运行三次,结果可能差异巨大。例如,在埃博拉病毒查询任务中,标准答案是266条序列,但Claude Sonnet 4的三次运行分别返回106条、15条和5条,提示词完全一致,结果却高度不稳定。
这种不稳定性直接影响下游分析。基于不完整的数据集构建的系统发育树,可能导致最近共同祖先时间(TMRCA)的推断出现巨大偏差,甚至将几十年或上百年的时间尺度混淆。同样,在抗体疗法研究中,对靶向区域突变位点的识别也可能因检索结果的不同而产生截然不同的结论。
gget virus:为生物数据检索注入确定性
为了解决这一问题,Anthropic团队与NCBI研究人员合作开发了gget virus,旨在将病毒数据检索转化为Agent和人类都可以直接调用的稳定工具。
gget virus的开发远不止是简单地连接几个API。它需要协调REST、Datasets、E-utilities等多种API,处理来自不同国家维护的国际同步序列数据库的信息,并本地检查网页界面上未暴露的筛选逻辑。它还能处理大规模数据集的批量检索,确保数据的完整性。
最终,gget virus输出的是人类和机器都能读取的标准化结果,并附带详细的日志,说明结果的生成过程。这使得Agent的回答不再是“看起来合理”,而是可检查、可复现、可审计的。
加入gget virus后,所有Agent的准确率都提升到了90%以上,GPT-5.5甚至达到99.7%。多次运行之间的波动也基本消失,不同模型之间的性能差距明显缩小。这一点至关重要:可靠的数据集构建不应依赖最新、最贵的模型,也不应依赖研究人员的“模型选择技巧”。更便宜的模型加上合适的工具,同样能提供稳定可靠的能力。
科学Agent的未来:需要“无聊但可靠”的基座
Anthropic博客的结论是:模型在生成假设、设计实验、推理机制方面可以富有创造力,但支撑这些创造力的底层基础——如基因标识符、数据模式(schema)、检索逻辑、坐标系统、元数据约定、数据访问路径——必须足够稳定、确定、可复现。
gget virus只是一个起点。未来的方向是为生物数据构建一类“上下文引擎”:可靠、可被Agent安全访问的数据基础设施。尽管未来Agent可能变得足够强大,能够自行处理混乱的数据接口,但为Agent提供“无聊但可靠”的工具和基础设施,仍然是当前和可预见的未来中,推动科学发现的关键。
即使Agent最终能够独立应对复杂的生物信息学工作流,这种方式对于日常科研而言,也可能成本过高、效率低下、难以审计且令人担忧。更重要的是,这个教训提醒我们:在设计系统时,必须将Agent纳入用户考量,并面向规模化、可信赖的使用来设计。
如果您对AI在科学领域的最新进展感兴趣,并希望了解如何更高效地利用Claude等工具,不妨访问Claude官网,探索Claude官方提供的强大功能,了解Claude国内如何使用,以及Claude教程和Claude使用指南,助力您的科研和工作。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)