AI 新闻

Anthropic 更新 Fable 5 生物学保护措施,减少良性问题降级

Anthropic 称,改进后的分类器将生物学相关的降级回复减少约 85%,同时保留对双重用途研究请求的保护。

发布于 更新于
AnthropicAI 安全生物学Claude

Anthropic 已更新 Fable 5 的生物学保护措施,称经修订的系统会把更少的普通生物学问题转交给能力较低的模型。公司表示,在其跨产品表面的测试中,生物学相关的降级回复减少了约 85%。这次更新旨在让模型更适用于日常健康和教育问题,同时保留对公司归类为双重用途请求的限制,包括病毒学、毒理学、分子设计和专业药物研发等领域。这是一项对既有安全边界的改进,并不代表无限制开放前沿生物学辅助。

Fable 5 最初使用的是一种范围较宽的分类器,设计上优先选择谨慎。当分类器发现可能需要保护的生物学请求时,系统会把用户转交给 Opus 5;Anthropic 将其描述为有能力但生物学能力低于 Fable 5 的模型。用户所看到的“降级”正是这一路由。该方法限制了难以处理的双重用途问题的暴露,但也会挡住课堂中可能出现的无害提问、患者理解化验结果的尝试,或对症状的一般讨论。Anthropic 现在表示,新分类器能更精确地区分这些类别。

公司的解释突出了生物学保护的核心难题:有益与有害的用途在技术上可能非常接近。研究疾病、设计治疗方法或研究病原体,可能与会被滥用的知识重叠。Anthropic 称,Fable 5 在某些高度复杂的生物学任务上可优于专家,并能在另一些任务上提供操作性支持,因此公司最初将较宽范围的问题置于保护之下。它认为,帮助合法研究者的同类能力也可能对恶意行为者提供实质协助,所以不能只根据一个问题表面上是否听起来具有教育性质来评估模型的用途。

为缩小这条边界,Anthropic 表示,它重写了分类器的“宪法”,即用于区分允许材料和受保护材料的一组规则。公司随后开发了更新的训练数据、重新训练分类器,并征求内部与外部专家意见。它称,所得系统仍会对有害和双重用途的研究生物学内容触发限制,同时允许更多良性请求。公司还表示,分类器必须能抵御越狱尝试,这使得减少误报的工作更加复杂。报告中的 85% 数字来自 Anthropic 自身测试,并非独立测量。

预期的用户体验会因产品表面而异。Anthropic 称,包括其他原因触发的降级在内,Claude.ai 上的总降级预计约减少 67%,Cowork 减少 55%,Claude Code 减少 17%,Claude Platform 减少 7%。这些数字不应被理解为每一个生物学问题现在都能由 Fable 5 回答。公司表示,双重用途的专业生物学和药物研发请求仍会被转离该模型。其长期目标是为在更受控条件下需要更强能力的研究人员建立可信访问路径。

这项发布之所以重要,是因为它说明了前沿模型部署中的常见权衡。拦截过宽的安全系统会挫伤用户,并降低产品在合法场景中的可用性;拦截过窄的系统则可能产生在模型广泛可用后更难逆转的风险。Anthropic 的办法是改变分类器而不是移除边界,通过更窄的规则和新训练数据,让更多明确良性的提问落在允许一侧。这个平衡是否能够保持,将取决于现实表现、对抗测试,以及公司在错误出现后再次调整的意愿。

对临床人员、教育者和普通用户而言,实际信息是克制的。更多日常生物学和健康问题或许会得到直接辅助,而不是被降级,但这款产品并未被表述为医疗判断的替代品或通用研究工具。对在受控、双重用途领域工作的研究者,限制仍然实质存在。这项公告表明,模型安全越来越是一个运营层面的产品问题:用户会在谁来回答、请求被转交的频率以及有帮助的答案是否可得中直接感受到它。下一批证据将来自经改进分类器在 Anthropic 内部测试之外的表现。