2026-08-25
Anthropic 投入 500 万美元研究 AI 与用户福祉:为什么单轮安全测试已经不够
AI 在陪伴、情绪支持和心理健康对话中的风险往往要经过多轮才出现。Anthropic 希望资助临床专家参与、贴近真实使用并可开源复用的评测。
ARTICLE ARCHIVE
2026-08-25
AI 在陪伴、情绪支持和心理健康对话中的风险往往要经过多轮才出现。Anthropic 希望资助临床专家参与、贴近真实使用并可开源复用的评测。
2026-08-10
Daybreak 用 Blue 与 Red 两级访问把通用防御和高级漏洞研究分开,并通过身份核验、硬件密钥、监控和用途限制管理 GPT-5.6-Cyber 的双重用途风险。
2026-08-07
OpenAI 表示对待发布模型 Astra 的初步评测已经强到无法排除“关键级”网络能力,并因此暂停部分内部活动、加强隔离和监控。
2026-08-06
企业管理员可用统一配置批准或阻止 MCP 服务,并以默认拒绝方式覆盖 Copilot App、CLI 与 VS Code。
2026-07-27
Anthropic 认为低风险开放权重模型是公共产品,争议焦点应从“开源还是闭源”转向能力是否达到危险阈值,以及发布前是否经过统一测试。