AI 安全

OpenAI 预览 Private Safety Processing,让前沿模型继续兼容零数据保留

OpenAI 称,Private Safety Processing 可在相关交互中识别风险模式,同时为符合条件的 API 客户保留 Zero Data Retention 承诺。

发布于 更新于
OpenAI零数据保留AI 安全

OpenAI 正在预览一种名为 Private Safety Processing 的新安全架构,试图解决企业 AI 采购中的一个难题:如何在不削弱严格隐私承诺的前提下,监测能力越来越强的前沿模型是否被严重滥用。公司在 8 月 19 日的公告中表示,符合条件并使用 Zero Data Retention 的 API 客户,仍可获得请求处理后不保留提示词和模型响应的承诺,同时新的自动化系统会跨相关交互寻找风险模式。

这一变化重要,是因为前沿模型已经不只是回答单条聊天消息。它们可以执行更长任务、调用工具、接触代码,并在多个步骤中推进工作,而风险往往只有放在时间序列中才会显现。单次请求可能看起来无害,但一组请求可能显示有人在试探安全边界、跨账户协调行动、尝试未授权访问,或让智能体在应该停止后继续行动。OpenAI 的判断是,传统的单交互安全检查已经不足以覆盖这类工作流。

Private Safety Processing 的设计目标,是在相关活动之间扩展监测,同时不给 OpenAI 人员访问客户内容的能力。对于客户控制的 ZDR 部署,内容会保留在客户自己的基础设施上。OpenAI 还在开发另一种选择,即内容存储在 OpenAI 基础设施上,但由客户控制密钥加密。在这种模式下,OpenAI 表示其人员没有读取底层提示词或响应所需的密钥。

当自动化系统识别到潜在风险时,OpenAI 称它只会收到关于活动类型和严重程度的狭义信号,类似现有安全系统,而不是收到内容本身。该信号可用于判断是否需要执行限制措施。客户则可以根据自己系统中的信息调查警报。如果客户希望申诉、解释合法活动,或支持已经确认的滥用调查,可以自行决定向 OpenAI 分享哪些信息。

这项公告回应了 AI 智能体进入受监管行业后越来越明显的矛盾。银行、医疗公司、律所、政府和研究机构希望使用前沿模型的能力,但通常不能允许供应商保存敏感记录、内部计划或专有研究供人工审查。与此同时,模型供应商也面临更大压力,要识别单条消息中看不出的有害行为。

OpenAI 表示,Private Safety Processing 正与早期客户测试,并由不同行业、地区和公司规模的组织共同塑造。公司计划 9 月开始推出并发布技术白皮书。对买家来说,仍有重要问题需要回答,包括风险类别如何定义、误报如何处理,以及客户能否获得关于加密、密钥控制和信号生成的独立保证。

更大的意义在于,隐私架构正在成为前沿模型安全的一部分。过去企业 AI 讨论中,数据保护和滥用监测常被当作相互竞争的要求。OpenAI 的方案试图把自动风险识别与人工内容访问分离,使二者兼容。如果它能按描述运作,重视隐私的组织可能更有信心把强模型用于长流程任务。如果系统过于不透明或难以审计,客户在让智能体接触敏感运营系统前仍会犹豫。