Snorkel AI 启动开放基准资助计划:AI Agent 评测开始补齐真实任务与可复现短板
Snorkel AI 公布首批 Open Benchmarks Grants,支持 Frontier Bench、Agent’s Last Exam 与 OSWorld 2.0 等开放评测项目。行业关注点正从模型是否会答题,转向 Agent 能否在真实软件环境中稳定执行、可复现比较并经得起污染检查。
导读:2026年7月24日,Snorkel AI 公布 Open Benchmarks Grants 首批项目,支持研究团队建设面向前沿模型与 AI Agent 的开放评测。首批方向包括 Frontier Bench、Agent’s Last Exam 和 OSWorld 2.0。它们共同指向一个问题:当 Agent 开始操作浏览器、桌面软件和多步骤工作流,传统静态题库已经不足以判断系统是否真的可靠。
背景:排行榜越来越高,真实可用性却不一定同步
模型评测长期依赖固定问题集。它们便于比较,但也面临训练数据污染、题目被针对性优化、评分口径单一等问题。进入 Agent 阶段后,系统还需要理解界面、规划步骤、调用工具、处理失败并完成最终目标,任何一环出错都可能让任务失败。
开放基准的重要性在于:研究者能检查任务定义、运行环境、评分器和失败样本,企业也能把公开方法迁移到自己的业务流程,而不是只参考一个缺少上下文的总分。
首批项目分别在补什么缺口?
Frontier Bench:让前沿能力比较更透明
这一方向关注高难度、可持续更新的前沿能力测试。关键价值不是制造“最难题库”,而是通过开放方法减少不可审计评分,让研究社区能够复核模型差异和评测设计。
Agent’s Last Exam:检验复杂知识工作的完整链路
名称强调的是对 Agent 综合能力的压力测试。与单轮问答相比,多步骤任务更能暴露规划、工具选择、证据核验和结果交付中的短板。对企业用户而言,这类评测也更接近研究、分析和运营自动化的真实风险。
OSWorld 2.0:把桌面操作放到可重复环境中
计算机使用 Agent 需要跨应用点击、输入、读取状态并纠正错误。OSWorld 类环境通过标准化桌面任务与执行条件,让不同系统在更接近真实软件使用的场景下比较。升级版本若能改善任务覆盖、稳定性和评分质量,将直接影响通用电脑 Agent 的研发节奏。
对行业有什么影响?
- 产品采购:企业评估 Agent 时,会更重视任务完成率、恢复能力、成本和可审计日志,而不是只看模型榜单。
- 研发流程:团队需要建立可重复的执行环境,并保存轨迹、工具调用和失败原因,评测基础设施会成为产品工程的一部分。
- 开放生态:资金支持能帮助学术团队维护数据、环境和评分器,降低公共评测依赖少数公司的风险。
- 数据质量:随着基础模型差距缩小,高质量任务设计、标注与验证将成为新的竞争资源,这也与 Snorkel AI 的数据开发定位相呼应。
适合哪些人关注?
- 开发浏览器、桌面、代码或企业工作流 Agent 的团队;
- 负责模型选型、安全评估和 AI 采购的企业技术负责人;
- 研究数据污染、自动评分和人机交互评测的高校团队;
- 希望建立内部 Agent 测试集与上线门槛的产品经理和测试工程师。
来源参考
- Snorkel AI 官方网站及 Open Benchmarks Grants 公告入口(2026-07-24)
- Hugging Face:开放模型评测与 OpenBench 介绍
- OSWorld 官方项目:真实计算机环境中的多模态 Agent 基准
- OSWorld 研究论文:开放式计算机任务环境与评测方法
本文基于公开公告、项目资料和研究论文进行原创梳理,未复制或改写单篇文章;封面为本站原创信息图。资助项目名称、版本进度和开放范围以主办方及项目维护者后续发布为准。