知识卡片:Biomni——整合百余工具的通用生物医学智能体
一句话结论
斯坦福团队在《Science》上发布的Biomni是首个整合105个生物信息学软件与59个数据库的通用AI智能体,可自主完成基因分析、药物研究、罕见病诊断等全流程科研任务,在443题评测中平均准确率57%,多项任务达到资深专家水平,并将罕见病诊断耗时从110分钟压缩至3分钟。
事件概述
斯坦福大学研究团队在《Science》期刊上推出通用生物医学智能体Biomni。该智能体集成了105个生信软件和59个数据库,旨在让AI贯穿生命科学研究的全过程,包括基因分析、药物研究、疾病诊断、蛋白优化与实验设计。Biomni能够自主调用工具完成复杂工作流,并可与PyLabRobot对接,将自然语言实验需求转化为机器人可执行代码,打通干湿实验壁垒。
方法/产品要点
- 工具整合:集成105个生物信息学软件与59个数据库,覆盖常见生信分析需求。
- 自主工作流:可端到端完成基因分析、药物研究、疾病诊断、蛋白优化与实验设计。
- 机器人对接:通过PyLabRobot接口,将自然语言实验指令转为机器人可执行的代码,实现干湿实验联动。
- 评测基准:在包含443道题目的评测集上评估性能。
主要结果或产业意义
- 评测成绩:Biomni平均准确率57%,显著高于Claude Sonnet 4.5(30%)和Claude Code(43%)。
- 罕见病诊断:准确率60%,耗时从传统方法的110分钟压缩至3分钟。
- 多项任务:达到资深专家水平,且大幅缩短耗时。
- 产业意义:表明AI智能体已能在生命科学研究中实现端到端自动化,有望大幅降低科研门槛并加速新药研发和疾病诊断。
为什么重要
Biomni代表AI在垂直科研领域从“辅助工具”向“自主执行者”的跨越。与SIMA 2等通用游戏智能体不同,Biomni专注于生物医学真实工具链,首次大规模整合了行业标准软件和数据库,并验证了在复杂科研任务上的有效性。其与机器人平台的对接更是打通了计算实验与物理实验的闭环,为“AI科学家”的落地提供了可操作的范本。
局限与不确定性
- 评测数据集为443题,尚不清楚在更广泛、更多样化的生物医学任务上的泛化表现。
- 准确率57%仍有较大提升空间,尤其在罕见病诊断等高风险场景,60%的准确率可能尚不足以直接用于临床。
- 工具整合依赖于现有软件和数据库的API稳定性,真实科研场景中工具版本更新、数据权限等问题未在材料中提及。
- 能否处理需要湿实验反馈的迭代优化流程(如主动学习、实验设计)尚待验证。
可用于图书/PPT/简报的角度
- “AI科学家”的里程碑:以Biomni为例说明AI智能体如何从单一问答进化到多工具协作,自主完成科研全流程。
- 生命科学自动化:展示AI在罕见病诊断中“时间压缩36倍”的具体案例,突出实用价值。
- 干湿实验结合:以PyLabRobot为例,探讨AI从数字世界到物理世界的延伸趋势。
原始材料
- 来源文章:腾讯研究院AI速递 20260715(搜狐转载)
- URL:https://m.sohu.com/a/1050336266_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
- 英文标题(建议保留):A Generalist AI Agent for Biomedical Research
- 英文关键词:Biomni, biomedical AI agent, bioinformatics, rare disease diagnosis, laboratory automation