品玩

科技创新者的每日必读

打开APP
关闭

MetaGPT 发布新型 AI 开发能力评估基准 RealDevWorld

2025年9月3日

品玩9月3日讯,据MetaGPT官方消息,他们近日发布全新 AI 开发能力评估基准RealDevWorld,通过 RealDevBench 数据集与 AppEvalPilot 框架,为 AI 代理在实际软件开发场景中的表现提供系统性评测。

该基准包含 194 项真实开发任务,覆盖显示(50.0%)、分析(18.6%)、游戏(17.0%)、数据(14.4%)四大类别,涉及金融追踪、市场分析等多领域场景,强调从需求理解到调试的端到端评估。其创新的 “代理即评委” 模式,通过自动化 GUI 测试与交互式评估,实现 92% 的评估准确率与 85% 的人类专家相关性。

实验数据显示,AppEvalPilot 框架在多项指标上超越传统 GUI 测试方法,效率提升 47%,评估时间缩短 33%、成本降低 77%。MGX(BoN-3)、Lovable 等模型在综合排行榜中表现突出,凸显 AI 在软件工程领域的应用潜力。该基准为行业提供了标准化评估工具,有望加速 AI 驱动的软件开发技术迭代。

取消 发布

下载品玩App,比99.9%的人更先知道关于「测试集」的新故事

下载品玩App

比99.9%的人更先知道关于「测试集」的新故事

iOS版本 Android版本
立即下载
AI阅读助手
以下有两点提示,请您注意:
1. 请避免输入违反公序良俗、不安全或敏感的内容,模型可能无法回答不合适的问题。
2. 我们致力于提供高质量的大模型问答服务,但无法保证回答的准确性、时效性、全面性或适用性。在使用本服务时,您需要自行判断并承担风险;
感谢您的理解与配合
该功能目前正处于内测阶段,尚未对所有用户开放。如果您想快人一步体验产品的新功能,欢迎点击下面的按钮申请参与内测 申请内测