9月30日,openai正式推出mentalhealthbench——一个开放式的评估基准,由来自全球22个国家和地区的80多位持证心理健康专业人士联合开发,旨在衡量ai在真实心理健康对话中生成实用、安全回应的能力。
该基准覆盖成人、青少年、照护者以及临床专业人员等多元用户角色,对话场景涵盖非急性、高风险及紧急心理状况等多种严重程度,并支持19种语言。
每位专家为每段模拟对话设计了详尽的评分细则,各项指标得分范围为-10至+10:正值代表有益行为,负值则对应潜在危害行为。每段对话均需经至少三位专家独立评审,仅当所有评审专家一致认可时,相关条目才会被纳入最终基准版本。OpenAI同时指出,在发布该基准之外,公司已优化ChatGPT对敏感话题的响应机制,拓展了危机干预资源的触达路径,并上线了“受信任联系人”新功能。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜












