国产智能体刷新OSWorld全球纪录:90.2%背后的Harness工程化突围
数据猿 | 2026-07-29 17:44
【数据猿导读】 2026年7月27日,国内人工智能企业实在智能宣布,其智能体产品"实在Agent"在计算机操作智能体权威基准OSWorld中取得90.2%的成功率,位列总榜与Agentic Framework分榜双榜首。据公开可查的OSWorld榜单,此前最高分数为83.6%,这是该榜单首次突破90%大关。...
2026年7月27日,国内人工智能企业实在智能宣布,其智能体产品"实在Agent"在计算机操作智能体权威基准OSWorld中取得90.2%的成功率,位列总榜与Agentic Framework分榜双榜首。据公开可查的OSWorld榜单,此前最高分数为83.6%,这是该榜单首次突破90%大关。

OSWorld由香港大学、卡内基梅隆大学、滑铁卢大学等机构于2024年在NeurIPS发表,通过在真实操作系统中部署Chromium、LibreOffice、GIMP、VS Code等真实应用程序,由机器自动判定智能体是否完成任务。
各大厂在发布旗舰模型时几乎都会引用OSWorld成绩。例如OpenAI发布GPT-5.4时强调“首次超越人类”,Google发布Gemini 3.6 Flash时强调“83%全场最高分”,Anthropic发布Claude Sonnet 5时强调“81.2%”。
01 Harness工程化:被低估的"登顶密码"
智能体领域近年来形成的一个核心共识是:Agent = Model + Harness。模型是"大脑",负责推理与决策;Harness是包裹模型的"身体与工作环境",是引导大模型执行任务并确保稳定运行的完整工程框架——简单来说,除了模型本身以外,所有让智能体不跑偏、可落地、能自愈的东西,都属于Harness。
这个等式背后是一条清晰的工程规律:模型决定天花板,Harness决定能不能落地。有工程案例显示,在相同模型、相同提示词的前提下,仅通过优化任务拆解、状态管理、步骤验证、失败恢复等Harness环节,任务成功率就能从70%以下提升到95%以上。
更极端的例子是Pi Research的受控实验:仅仅改变Harness传递给模型的编辑工具格式,某模型在代码基准上的成功率就从6.7%飙升至68.3%,实现近10倍增长;Vercel团队则发现,通过Harness强管控将模型可用工具从15个裁到2个,任务准确率反而从80%提升到100%。Anthropic在《Demystifying evals for AI agents》工程博客中明确:"当我们评估一个智能体时,我们评估的是harness和model一起工作"——这意味着任何基准分数都内含了harness的工程贡献。
行业研究进一步提出"约束条件假说":在长时序、多步骤的实际任务中,决定系统最终可靠性的瓶颈已经不再是模型本身,而是包围在模型外部的Harness基础设施。一个成熟的Harness必须具备六大闭环能力:
● 上下文管理:动态供给信息,避免上下文窗口过载导致推理质量下滑
● 工具系统:按需调用、最小权限暴露,避免工具过多引发混乱调用
● 执行编排:目标理解→信息补全→分析→输出→校验→纠正/重试的任务导轨
● 记忆与状态管理:任务状态、会话中间结果、长期记忆三者分离,避免系统混沌
● 评估与观测:输出验收、环境验证、日志追踪、错误归因,让系统"知道自己对不对"
● 约束验证与失败恢复:明确能/不能做什么,输出前后双重校验,重试/换路径/回滚到稳定态
这些能力在工业界已有成熟实践。Replit Agent生成代码后必须等待人类确认才能部署,这是典型的人在回路设计;Claude Code的Harness精确控制模型能执行的文件及系统操作范围;LangChain在Terminal Bench 2.0中引入自我验证回路,明确要求"你的工作将被程序化测试验证",并依赖LangSmith追踪系统记录每次行动、分析失败模式分布,再通过迭代优化针对高频失败点进行修复。
作为自2018年起深耕Computer-Use赛道的厂商,实在智能将八年积累的操作系统交互经验、异常处理机制、真实桌面环境数据,沉淀为一套成熟的Harness工程体系,形成"手脑一体"架构。
● 多模态感知与执行闭环:在执行侧,实在Agent形成了"API优先、GUI兜底"的混合调度能力——当API能跑通就走API,跑不通就切到GUI像素级操作,兼容跨应用、跨系统的长链路任务流转。这种"工具系统+执行编排"的一体化设计,正是Harness工程中最硬核的部分。
● 长链路状态与记忆管理:在跨应用工作流中维持任务级状态,应对需要连续穿梭多个软件的五六步流程,对应Harness中"记忆与状态管理"的核心职责
● 安全与治理层:权限校验、操作审计、异常中断与回滚机制,对应Harness中"约束验证与失败恢复"的职责。实在Agent已实现全链路操作留痕——操作动作、决策逻辑、异常处理三个维度自动记录,每一步都有时间戳和截屏,满足审计追溯要求;同时支持全栈私有化部署,数据不出机房
● 多模型路由:兼容豆包、Qwen、DeepSeek等主流大模型,支持端侧轻量模型与云端VLM混合调度,体现Harness"可拆卸性"原则——模型可插拔,工程底座不变
● 全流程工具链闭环:形成"设计器开发—运营平台管控—机器人执行—运维监控优化"的全链路工具链,对应Harness中的"评估与观测"体系
Stanford、清华等机构的研究显示,在同一底层模型前提下,仅改进Harness工程设计,OSWorld等基准上的性能差距可达6-17个百分点。中移智库在2026年的研判更为直白:"2025年人们证明了AI Agent'可以工作';2026年,人们要通过Agent Harness让AI Agent'可靠工作'"。这意味着,实在Agent的90.2%不仅是一个基准分数,更是Harness工程化能力成熟度的外显——它标志着智能体竞争的焦点,正从"模型参数"转向"Harness工程化 + 真实场景数据"。
02 从"榜单高分"到"生产力落地"的产业命题
在OSWorld的评测语境中,参赛者可分为三类技术路线:通用模型(General model)具备广泛的通用能力,"操作电脑"只是通过提示词激发的诸多能力之一,它本身仍能胜任对话、代码生成等其他任务;专用模型(Specialized model)则是专门针对"计算机操作智能体"这一角色训练而成,其他能力不在其设计重点之内;智能体框架(Agentic framework)则将至少一个通用模型和/或专用模型组织为结构化的工作流——常见形态是以GPT系列模型担任"规划器",由专有或任务专用的模型担任"定位器",分工协作完成复杂任务。
实在Agent提交的正是Agentic Framework,在OSWorld 361个实战课题中,实在Agent拿下325.59分。其中跨应用协同(multi_apps)93个任务获78.81分,领先第二名近10个百分点;GIMP图像处理26题拿下24题(成功率92.3%);系统底层操作(os)24个任务实现零失误满分。在日常高频场景中,Calc(46.0/47)、Impress(42.96/47)、Writer(22.0/23)、VS Code(22.0/23)、VLC(16.89/17)、Thunderbird(13.0/15)等均保持高完成度,构成了稳定的技术基本盘。
这意味着,在不依赖专门训练模型的前提下,仅通过架构与工程创新,智能体框架+通用模型同样能达到世界级水平。

我们注意到,OSWorld的361个任务以短周期、单应用或简单跨应用任务为主。在当前公开的榜单上,仅有排名前列的13个项目突破了人类整体成功率基线(72.36%)。

这组数据揭示了一个不争的事实:90.2%是智能体在"计算机驾照考试"中的高分,但真实企业的财务、HR、供应链场景里,还充斥着软件版本更新、随机广告弹窗、系统通知抖动、网络延迟卡顿等非标准干扰。
实在Agent接下来的工程焦点,是从90.2%向工业级99.99%可靠性跨越——通过人机协同与安全断路器机制,在涉及高风险操作时自动提权确认,并提供操作撤销与回滚能力。
相关分析指出,当前国内AI智能体产业已进入"重场景、看实效"的深耕期。在"Model + Harness"双轮结构中,Harness工程化——即对真实业务场景的长期沉淀、操作数据积累与工程化迭代——正在成为决定智能体"能不能真干活"的核心变量。这对于具备自动化背景、拥有大量企业客户与真实桌面操作数据的国产厂商而言,是一个结构性优势窗口。
实在Agent目前已服务超6000家企业客户,其中90%为世界500强、央国企、上市企业和地方龙头,覆盖跨境、制造业、能源、交通航空、医药、零售电商等行业。海量真实桌面环境的操作数据与异常处理机制,正是Harness工程迭代最宝贵的原材料。
从产业格局看,实在Agent的90.2%成绩,是国产智能体在"计算机使用"这一特定赛道上的一次标志性突破。它释放出的核心信号是:智能体竞争的焦点,正从"模型参数"转向"Harness工程化 + 真实场景数据"。模型能力逐渐同质化的当下,谁能把模型"驯化"为可靠的生产力,谁就掌握了下一阶段的主导权。
来源:数据猿
刷新相关文章
我要评论
不容错过的资讯
大家都在搜
















