📝AI应用案例

OpenAI 与 Ironclad 共训 AI Agent:合同工作流成了电脑使用能力试金石

作者:AI测评网编辑部·2026-10-08·浏览 2

OpenAI 与 AI 合同管理公司 Ironclad 把保密协议、采购审批、法律条款等复杂流程拆成 11 项评测任务,GPT-6 Astra 平均得分 55%,但时间数据仍是模拟估算。

OpenAI 与 Ironclad 共训 AI Agent:合同工作流成了电脑使用能力试金石
阅读提示当前文章有1101字,阅读完大概需要3分钟。

OpenAI 于 2026 年 10 月 6 日公布与 AI 合同管理公司 Ironclad 的研究合作:双方把合同配置、审批和法律条款维护等复杂工作拆成可训练、可评分的电脑使用任务,用来检验 AI Agent 是否真的能理解业务规则,而不只是完成几个孤立的点击操作。

合作的核心:把专业软件里的“隐性规则”变成评测

OpenAI 说,双方围绕法务、商务和采购工作设计了 11 项任务,包括设置保密协议、创建采购审批流程,以及根据申请人的司法管辖区更新可复用法律条款。每项任务配置了 8 至 50 项成功标准,目标是检查智能体能否在配置表单、文档模板、审批规则和最终协议之间保持一致。

这类任务的难点并不在于某一个按钮,而在于例外和规则的联动:例如,超过支出阈值的采购要触发财务审批,特定申请还要经过安全部门审核,非标准条款则需要法务复核。流程搭好之后,还要用高于和低于阈值的不同输入验证它是否真的按预期运行。

数据与训练方式:重视可控环境,也避开客户机密

据 OpenAI 的披露,研究人员使用经过个人信息过滤的美国证券交易委员会 EDGAR 公共合同数据来构造模拟任务,没有使用 OpenAI 客户数据、内部合同或 Ironclad 未公开的客户合同。Ironclad 提供托管的软件环境,让模型可以在接近真实产品逻辑、但风险可控的环境中练习。

在训练上,团队先与熟悉业务的人共同挑选任务、制定详细的判分标准,再用合成训练任务和强化学习让模型反复练习。这样的路径把“模型会不会用电脑”进一步拆成了三个问题:它是否理解规则、是否能跨步骤保持状态、以及是否能用可复现的标准验证结果。

结果如何:分数提升明显,但不是客户节省时间承诺

在这 11 项研究任务中,采用 Max 推理设置的 GPT-6 Astra 平均得分为 55.0%,采用高推理设置的 GPT-5.6 Sol 为 41.6%;对应的估算平均用时分别为 19.2 分钟和 37.0 分钟。OpenAI 还称,Astra 在一段示例任务中约 20 分钟达到约 94% 的任务标准,而 GPT-5.6 Sol 在约 32 分钟达到约 85%。

这些数字需要谨慎解读:官方脚注明确说明,时间是根据假定的模型处理和生成速度进行的模拟估算,并非真实客户节省时间;评测覆盖的是 11 项研究任务,也不能代表 Ironclad 的全部工作流。此外,OpenAI 还提到,一个内部模型在这组任务上达到 63.7%,说明当前结果仍然是研究进展,而不是一个已经解决所有合同管理问题的产品承诺。

为什么这对企业 Agent 很重要

  • 评测从通用操作走向业务闭环:企业真正关心的不是“能否点击按钮”,而是流程规则、权限、异常和最终文档能否同时正确。
  • 工作流知识成为模型能力的一部分:软件公司需要把客户熟悉的业务语义转成安全的训练环境和评测标准,这可能成为企业 Agent 的新护城河。
  • 人工监督仍然不可省略:Ironclad 和 OpenAI 都强调,合同工作涉及例外和治理,即使模型能完成更多步骤,人工复核、权限控制和审计机制仍是交付前提。

适合哪些人关注

  • 法务运营、采购、销售运营和企业服务团队;
  • 正在建设电脑使用 Agent、浏览器 Agent 或 RPA 替代方案的产品与工程团队;
  • 关注 Agent Benchmark、强化学习和专业软件评测的研究人员;
  • 需要判断 AI 是否能进入合同、审批和合规流程的 CIO、CTO 与业务负责人。

来源参考