品玩9月24日讯,据AIweekly 报道,OpenAI近日发布MentalHealthBench,这是一个面向心理健康领域的公开评测基准。
该基准包含1215段合成心理健康对话,配套5262条评分标准,由来自22个国家的80余名持证心理学家和精神科医生共同编写,覆盖19种语言。
对话内容按紧急程度划分:非急性场景占53.5%,高紧急度场景占18.2%,紧急场景占28.3%。
评测结果显示,GPT-6 Astra得分为57.3%,领先于GPT-6 Sol(53.9%)、Claude Opus 5.5(52.4%)和GPT-6 Luna(50.2%),远高于GPT-4o(32.1%)和Gemini 2.5 Pro(29.5%)





0 条评论
请「登录」后评论