品玩

科技创新者的每日必读

打开APP
关闭

OSWorld榜首换人,中国智能体跨过90%,实现关键突破

1小时前

2026年7月27日,全球AI智能体基准OSWorld更新榜单,实在智能自研的实在Agent以90.2%的成功率登顶总榜与Agentic Framework分榜双榜首。这是OSWorld自2024年发布以来,首个突破90%的Computer-Use 智能体

01 OSWorld为什么是硬通货

OSWorld由港大、CMU、滑铁卢大学于2024年在人工智能顶会NeurIPS发表,是目前计算机使用智能体领域认可度最高的基准之一。它的设计逻辑很明确:不考“做题”,考“干活”。

与仅支持网页或API调用的传统基准不同,OSWorld在真实Ubuntu虚拟机中部署Chromium、LibreOffice、GIMP、VS Code等应用程序,设置361个实战任务,覆盖办公、编程、UI设计、系统运维全场景。每个任务配有可执行的验证脚本,由机器自动判定成功与否,排除人工评分的主观偏差。

头部厂商发布旗舰模型时均以OSWorld成绩为核心背书:OpenAI发布GPT-5.4时强调“首次超越人类”,Google发布Gemini 3.6 Flash时标注“83%全场最高分”,Anthropic发布Claude Sonnet 5时突出“81.2%”。

回看这条成绩曲线:2024年最强模型仅12.2%;2025年先后推至22.0%、72.6%,首次超越人类操作基线(72.36%);2026年5月达83.6%;两个月后改写为90.2%。从12%到83%,完成了基础能力的跨越;从83%到90%,则是对工程可靠性的极致打磨——两个阶段面临的技术挑战截然不同。

02 拆解90.2%:三个最难场景说了算

361个任务总分325.59,折合成功率90.2%。拆开看,日常办公场景(Calc 46/47、Writer 22/23、VS Code 22/23、Impress 42.96/47等)构成了稳定的技术基本盘,但真正拉开分差的,是三个公认最难场景:

跨应用协同(78.81/93)。 93个任务模拟真实办公中最繁琐的跨系统流程:Chrome下载文件→LibreOffice编辑数据→截图存档→Thunderbird发送邮件。这类任务要求智能体在四五个软件间连续穿梭,任何一个步骤的状态丢失都可能导致全链路崩溃。

GIMP图像处理(24/26,成功率92.3%)。 GIMP界面以浮动面板、非标准工具栏和像素级微操著称,是视觉模型公认的高难度场景。传统方案在这类非标准界面上频繁出现定位失准和操作偏差。26题拿下24题,显示其对非标准UI元素的识别与操作能力已达到较高水平。

系统底层操作(24/24,100%满分)。 进程管理、权限修改、命令行操作——错一步即全盘皆输的零容错场景,零失误。满分意味着底层执行闭环的稳定性已达到可验证的确定性级别。

三项能力叠加,实在Agent展示出的不是单点突围,而是全场景的工程可靠性

03 登顶密码:Agentic Framework路线凭什么赢

90.2%是怎么来的?技术路径选择是关键。

OSWorld分三条赛道:专用模型、通用模型、智能体框架。实在Agent提交的是Agentic Framework方案——不训练专用模型,而是用工程架构组织通用模型协作。一个值得注意的产业信号:榜单TOP10中6个选了框架路线,且整体成绩高于纯模型方案。

这验证了一条正在被行业反复确认的共识:Agent = Model + Harness。模型是大脑,决定推理上限;Harness是包裹模型的完整工程体系——任务拆解、工具调度、状态管理、失败恢复、安全校验——决定能不能落地。

实证层面,Stanford、清华等机构研究表明,同模型下仅优化Harness设计,复杂任务性能差距可达6-17个百分点。Pi Research的受控实验更直观:只改变传给模型的工具格式,代码任务成功率从6.7%飙至68.3%,增长近10倍。Anthropic在工程博客中明确指出:“当我们评估一个智能体时,我们评估的是harness和model一起工作。”

从OSWorld的实战表现来看,实在Agent在打榜方案中形成了三个关键工程优势:

  • 长链路状态管理。 跨应用协同93个任务拿下78.81分,在多步骤流程中维持任务一致性,避免中途丢失上下文。
  • 非标准界面视觉理解。 GIMP图像处理26题拿下24题(92.3%),在浮动面板密集的复杂视觉环境中保持操作精度。
  • 底层操作闭环校验。 系统操作24题满分,进程管理、权限修改、命令行操作实现零失误的确定性执行。

这三者叠加,构成了实在Agent在榜单上领先的工程基础。

04 从打榜到落地:工程能力如何撑住产品

打榜验证的是技术路线和工程架构的上限,产品考验的则是整套体系的产业化能力。

实在智能自2018年起步于企业自动化赛道,八年间服务了超过6000家企业客户,其中90%为世界500强、央国企和上市龙头。正是因为在企业级自动化领域的长年深耕,实在智能对真实桌面环境的交互逻辑、异常边界、合规要求有系统性的工程积累——这些积累构成了Harness体系迭代的原材料,也是首次打榜就能冲上SOTA的深层原因。

在产品层面,这套工程能力的落地体现为:

“API优先、GUI兜底”的混合执行。 不依赖单一交互路径。API能通时走API,保持高效;API不通时退回像素级GUI操作,像人一样看屏幕、点鼠标。这降低了传统自动化“接口一变就瘫痪”的脆弱性,也是实在Agent能处理跨应用、跨系统长链路任务的基础。

全链路操作留痕与安全治理。 操作动作、决策逻辑、异常处理三个维度自动记录,每一步有时间戳和截屏,支持全栈私有化部署。对于金融、能源、政务等强合规行业,这是从“技术可用”到“合规可用”的必要条件。

多模型可插拔路由。 实在Agent内置DeepSeek、豆包、千问、Kimi等主流大模型,支持端侧轻量模型与云端VLM混合调度。模型可替换,工程底座不变,企业无需因模型升级而推倒重来。

从90%到工业级99.99%,中间的差距不是简单的9.99个百分点,而是从“能干活”到“能放心让它干活”的信任鸿沟。实在Agent已在自主执行基础上构建了人机协同与安全断路器机制——高风险、敏感数据操作自动提权确认,提供操作撤销与回滚能力。这本质上是将人的判断力作为系统安全的最后一道防线,在效率与风险之间找到平衡点。

实在Agent此次登顶最值得关注的地方在于:它证明的不是“中国又出了一个高分模型”,而是“一套扎根真实场景的工程体系,可以在不依赖专用模型的前提下,把Computer-Use 智能体推到世界第一”。当行业还在讨论下一个模型参数该堆到多大时,这条路线已经给出了另一个答案——把模型当成可替换的零件,把工程做成可复用的底座。90.2%不是终点,但它的确让“智能体进产线”这件事,看起来不再遥远。

取消 发布

下载品玩App,比99.9%的人更先知道关于「智能体」的新故事

下载品玩App

比99.9%的人更先知道关于「智能体」的新故事

iOS版本 Android版本
立即下载
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测