跳到正文
加入会员

Anthropic 投入 500 万美元研究 AI 与用户福祉:为什么单轮安全测试已经不够

阅读需要 2 分钟

AI 在陪伴、情绪支持和心理健康对话中的风险往往要经过多轮才出现。Anthropic 希望资助临床专家参与、贴近真实使用并可开源复用的评测。

长时间对话轨迹中的情绪与风险变化被多学科评测系统观察

Anthropic 推出 500 万美元资助计划,支持独立研究团队开发开源的 AI 用户福祉评测。这项计划关注一个越来越现实的问题:当用户把模型当成长期对话伙伴、情绪支持或心理健康信息来源时,风险往往不能从单条回答判断。

为什么福祉比事实问答更难评测

事实问题可以检查一句话是否准确,但用户福祉取决于历史、语境和关系变化。一个普通的减重建议,对有饮食障碍历史的人可能并不合适;一个看似支持性的回答,经过几十轮互动可能强化依赖或错误信念。

小黑检查长对话卷轴,在多轮交流后发现迟到的风险信号

Anthropic 在 2026 年 8 月 25 日发布的 资助公告中称,项目将提供资金、模型访问和技术支持,获资助团队保持独立,并把成果作为开源项目发布。

什么样的评测才有价值

Anthropic 建议评测明确说明测量对象与通过标准,由临床和领域专家参与设计,既测试模型造成伤害的风险,也测试过度拒绝正常支持的问题。同时,场景应接近真实多轮使用,并让自动评分器与专家判断对齐。

这些要求避免把福祉简化成关键词拦截。用户不会总在第一句话明确表达危机,模型需要在保护隐私的前提下理解逐步出现的风险,并在必要时鼓励寻求现实支持。

独立研究为什么重要

模型厂商掌握产品数据和技术能力,但也有商业利益。让外部临床专家、心理学家和方法学研究者独立设计并公开评测,有助于发现内部团队容易忽略的问题,也让不同模型可以在相同标准下比较。

开源评测并不等于公开敏感对话。高质量项目需要使用合成或严格脱敏数据、保护参与者,并避免把危机场景做成可被滥用的脚本。

用户现在应该怎么做

AI 可以帮助整理情绪、准备就医问题和提供一般信息,但不应成为危机情况下的唯一支持来源。出现自伤风险、严重精神症状或紧急医疗问题时,应联系当地专业机构和现实中的可信人员。

平台也应明确模型不是治疗师,提供危机转介和使用控制,并允许用户管理记忆与历史。透明度材料应持续说明高风险场景的表现和已知限制。

YouCanStudy.AI 的判断

AI 福祉不能只靠‘语气温柔’来衡量。真正的安全涉及多轮趋势、依赖、错误强化、过度拒绝和现实求助。500 万美元资助能否推动共同标准,还要看研究是否独立、可复现并能进入产品改进;但把长期影响正式纳入评测,本身就是必要的一步。尤其要公开失败案例和适用边界,避免把单次表现包装成普遍安全。

想要系统学习 AI 辅助创作与开发?

文章解决具体问题;完整课程会把前置知识、操作流程、验证方法和项目资料放在一起。

查看系统课程

相关文章