AI真正的下一站,不是更会聊天,而是更会把工作做完。
OpenAI与合同管理公司 Ironclad 的合作,正在把“专业工作”变成训练和评测 AI 代理的新考场。

从合同、规则到审批:专业工作代理需要处理的不只是文字,而是一整条流程。
一、OpenAI这次到底公布了什么
10月6日,OpenAI公布了与 AI 合同管理公司 Ironclad 的研究合作。合作的重点不是再做一个“能回答合同问题”的聊天窗口,而是把真实的合同配置、审批、条款调用和业务规则,拆成可训练、可评测的复杂任务。
OpenAI称,GPT-6 Astra 是第一个接受 Ironclad 任务训练的前沿模型。双方构建了11个来自法律、商业和采购工作的研究任务,再将 Astra 与 GPT-5.6 Sol 放在相同类型的专业流程中比较。
核心数据
Astra 在这组内部研究评测中的平均得分为 55.0%,GPT-5.6 Sol 为 41.6%;估算的单次任务耗时从37.0分钟降至19.2分钟。
这组数字需要准确理解:它不是一张覆盖所有场景的公开排行榜,而是 OpenAI 与 Ironclad 围绕11项专业任务建立的研究评测。它能说明 Astra 在这一类工作流上取得了明显进步,但不能直接等同于“AI已经可以独立替代法务人员”。
二、真正的变化:AI不再只处理文档,而是处理规则
过去的合同 AI,常见任务是总结一份文件、找出风险条款,或者根据指令改写一段话。这些能力有价值,但仍然停留在“读文档—给答案”阶段。
Ironclad的工作流更接近现实业务:一份合同进来后,系统要识别它属于哪种流程,调用组织设定的审批规则,判断哪些条款需要升级,再把结果交给具体的人或部门确认。代理不仅要理解语言,还要知道下一步该做什么、什么时候不能继续、什么结果才算完成。
这也是 OpenAI 此次合作的关键。软件公司提供的不是一批孤立问答,而是专业人士每天真正执行的任务、失败案例和验收标准。模型训练的目标,开始从“回答得像不像人”,转向“能不能按规则把事情推进到正确状态”。
一个真实任务链
采购团队上传供应商合同 → 代理提取期限、折扣、付款和终止权 → 对照企业规则检查缺失或异常条款 → 触发对应审批人 → 生成修改建议 → 记录每一步依据 → 由人类确认后进入下一环节。
这条链路中,任何一个环节出错都可能让最终结果失效。代理要面对的不只是“答案对不对”,还有权限、顺序、上下文、异常分支和责任留痕。

速度只是第一关:遇到异常时,代理必须知道何时暂停、升级并把决定交还给人。
三、为什么这比普通办公助手更难
01|规则不是写在一页纸上
企业规则往往分散在模板、审批矩阵、历史合同和权限设置里。代理需要把这些隐含约束组合起来,而不是只抓取一段关键词。
02|失败不是“答错一句话”
如果摘要少了一个日期,用户可能还能补救;但如果代理把合同送给错误的审批人,或者漏掉续约窗口,后果可能直接变成商业风险。
03|完成必须可验证
专业工作需要可审计:谁做了什么、用了哪条规则、为什么升级、最后由谁确认,都要能够回溯。
因此,OpenAI此次选择与垂直软件公司合作,透露出一个清晰方向:模型能力的下一轮竞争,不只发生在通用 benchmark 上,也发生在企业软件里的真实任务完成率上。
四、Ironclad扮演的角色:从工具变成训练场
Ironclad并不是一个单纯的合同问答产品。它正在把 Intake、Review、Redlining、Search、Renewal 等能力组织成覆盖合同生命周期的代理网络。官方资料还显示,Ironclad已经通过 MCP 让 ChatGPT、Claude 和 Slackbot 在权限范围内查询合同与流程数据。
这意味着,企业软件的价值正在发生变化:它不仅保存数据,也保存“事情应该如何被完成”的流程逻辑。对模型公司而言,这类系统提供了比公开网页更接近真实工作的训练环境;对软件公司而言,模型则可能成为连接不同业务节点的执行层。
但要注意一个边界
“代理在研究任务上得分更高”不等于“代理在你的公司里可以直接放权”。企业规则、数据权限、异常类型和责任制度各不相同,公开评测只能证明能力趋势,不能替代上线前的安全验证。
五、普通用户和开发者该怎么看
对普通用户来说,这次新闻最值得关注的不是 GPT-6 Astra 这个名字,而是 AI 产品的交互方式可能会继续变化:从“请给我一份建议”,变成“请按照我的规则,把这件事推进到下一步,并在需要时叫我确认”。
对开发者来说,机会也不只是接一个模型 API。真正有壁垒的部分,往往是:
• 把业务规则变成可执行的状态机
• 为每个动作设置权限、审批和回滚边界
• 为失败和异常准备人工接管路径
• 用真实任务完成率,而不是漂亮演示,衡量代理价值
OpenAI与 Ironclad 的合作释放出的信号很明确:下一代 AI 竞争的核心问题,正在从“谁更会生成内容”转向“谁能在复杂系统里可靠地完成工作”。
最后一句
真正成熟的 AI 代理,不是永远不需要人,而是知道什么时候可以继续、什么时候必须停下来,把决定交给对的人。