📝AI行业

Snorkel AI 启动开放基准资助计划:AI Agent 评测开始补齐真实任务与可复现短板

作者:AI产品编辑部·2026-07-25·浏览 3

Snorkel AI 公布首批 Open Benchmarks Grants,支持 Frontier Bench、Agent’s Last Exam 与 OSWorld 2.0 等开放评测项目。行业关注点正从模型是否会答题,转向 Agent 能否在真实软件环境中稳定执行、可复现比较并经得起污染检查。

Snorkel AI 启动开放基准资助计划:AI Agent 评测开始补齐真实任务与可复现短板
阅读提示当前文章有1019字,阅读完大概需要3分钟。

导读:2026年7月24日,Snorkel AI 公布 Open Benchmarks Grants 首批项目,支持研究团队建设面向前沿模型与 AI Agent 的开放评测。首批方向包括 Frontier Bench、Agent’s Last Exam 和 OSWorld 2.0。它们共同指向一个问题:当 Agent 开始操作浏览器、桌面软件和多步骤工作流,传统静态题库已经不足以判断系统是否真的可靠。

背景:排行榜越来越高,真实可用性却不一定同步

模型评测长期依赖固定问题集。它们便于比较,但也面临训练数据污染、题目被针对性优化、评分口径单一等问题。进入 Agent 阶段后,系统还需要理解界面、规划步骤、调用工具、处理失败并完成最终目标,任何一环出错都可能让任务失败。

开放基准的重要性在于:研究者能检查任务定义、运行环境、评分器和失败样本,企业也能把公开方法迁移到自己的业务流程,而不是只参考一个缺少上下文的总分。

首批项目分别在补什么缺口?

Frontier Bench:让前沿能力比较更透明

这一方向关注高难度、可持续更新的前沿能力测试。关键价值不是制造“最难题库”,而是通过开放方法减少不可审计评分,让研究社区能够复核模型差异和评测设计。

Agent’s Last Exam:检验复杂知识工作的完整链路

名称强调的是对 Agent 综合能力的压力测试。与单轮问答相比,多步骤任务更能暴露规划、工具选择、证据核验和结果交付中的短板。对企业用户而言,这类评测也更接近研究、分析和运营自动化的真实风险。

OSWorld 2.0:把桌面操作放到可重复环境中

计算机使用 Agent 需要跨应用点击、输入、读取状态并纠正错误。OSWorld 类环境通过标准化桌面任务与执行条件,让不同系统在更接近真实软件使用的场景下比较。升级版本若能改善任务覆盖、稳定性和评分质量,将直接影响通用电脑 Agent 的研发节奏。

对行业有什么影响?

  • 产品采购:企业评估 Agent 时,会更重视任务完成率、恢复能力、成本和可审计日志,而不是只看模型榜单。
  • 研发流程:团队需要建立可重复的执行环境,并保存轨迹、工具调用和失败原因,评测基础设施会成为产品工程的一部分。
  • 开放生态:资金支持能帮助学术团队维护数据、环境和评分器,降低公共评测依赖少数公司的风险。
  • 数据质量:随着基础模型差距缩小,高质量任务设计、标注与验证将成为新的竞争资源,这也与 Snorkel AI 的数据开发定位相呼应。

适合哪些人关注?

  • 开发浏览器、桌面、代码或企业工作流 Agent 的团队;
  • 负责模型选型、安全评估和 AI 采购的企业技术负责人;
  • 研究数据污染、自动评分和人机交互评测的高校团队;
  • 希望建立内部 Agent 测试集与上线门槛的产品经理和测试工程师。

来源参考

本文基于公开公告、项目资料和研究论文进行原创梳理,未复制或改写单篇文章;封面为本站原创信息图。资助项目名称、版本进度和开放范围以主办方及项目维护者后续发布为准。