AIニュース
Anthropic、Fable 5の生物学セーフガードを更新し良性質問のフォールバックを削減
Anthropicは、改良した分類器により生物学関連のフォールバックを約85%減らしつつ、デュアルユース研究への保護を維持するとしている。
AnthropicはFable 5の生物学セーフガードを更新し、通常の生物学に関する質問が能力の低いモデルへ回される回数を大幅に減らすと発表した。同社は、製品群をまたぐテストで生物学関連のフォールバックが約85%減ったとしている。この更新は、日常的な健康や教育に関する質問でモデルを使いやすくする一方、ウイルス学、毒性学、分子設計、専門的な創薬など、デュアルユースと分類する要求には制限を残すことを目的とする。既存の安全境界を精密化したものであり、最先端の生物学支援を無制限に開放する判断ではない。
Fable 5は当初、慎重さを優先する広い分類器を使っていた。分類器が保護対象となり得る生物学の要求を検出すると、システムは利用者をOpus 5へ振り分ける。Anthropicはこれを、能力はあるがFable 5ほどの生物学能力は持たないモデルと説明する。利用者が見たフォールバックはこの経路である。この方法は難しいデュアルユースの質問への露出を抑えた一方、授業での質問、検査結果を理解しようとする患者、症状に関する一般的な議論のような良性の要求も止めてしまった。Anthropicは新しい分類器がそれらをより正確に分けるとしている。
同社の説明は、生物学の保護策が抱える中心的な難しさを示す。有益な利用と有害な利用は技術的に近い場合がある。病気を研究し、治療法を設計し、病原体を調べることは、悪用され得る知識と重なることがある。Anthropicは、Fable 5が一部の高度に複雑な生物学タスクで専門家を上回り、別のタスクでは実務的な支援を提供できるとする。そのため、合法的な研究者を助ける能力と同じ能力が、悪意ある行為者にも実質的な助けを与え得る。質問が表面上教育的に聞こえるかだけで、モデルの利用を評価することはできない。
境界を狭めるため、Anthropicは分類器の「憲法」、すなわち許可される内容と保護される内容を見分けるための規則群を書き直したと説明する。続いて新しい学習データを作り、分類器を再訓練し、社内外の専門家から意見を得た。その結果のシステムは、有害またはデュアルユースの研究生物学コンテンツには引き続き反応しつつ、より多くの良性の要求を許可するとしている。分類器はジェイルブレイクの試みにも強くなければならず、それが誤検知を減らす作業を難しくする。同社の85%という数字は独立測定ではなく、Anthropic自身のテスト結果だ。
想定される利用者体験は製品面によって異なる。Anthropicは、他の原因によるものを含む全フォールバックが、Claude.aiでは約67%、Coworkでは55%、Claude Codeでは17%、Claude Platformでは7%減る見込みだとした。この数字は、すべての生物学質問にFable 5が答えるようになる保証ではない。同社は、デュアルユースの専門的生物学・創薬要求をモデルから振り分け続けるとしている。より長期的には、管理された条件下でより強い能力を必要とする研究者のため、信頼できるアクセス経路を作ることを目標に掲げる。
この発表は、最先端モデルの展開で繰り返し現れるトレードオフを示す。広すぎる安全システムは利用者を失望させ、正当な場面での製品の有用性を下げる。狭すぎるシステムは、モデルが広く使えるようになった後では戻しにくい危険を生み得る。Anthropicの方法は、境界をなくすのではなく分類器を変え、より狭い規則と新しい学習データで、明らかに良性の質問を許可側へ移すことだ。この均衡が保てるかは、実世界での性能、敵対的テスト、誤りが見つかったときに再調整する同社の姿勢にかかる。
臨床家、教育者、一般利用者にとって実用的なメッセージは慎重なものだ。日常の生物学や健康の質問の多くはフォールバックなしで支援を得られるかもしれないが、この製品は医療判断の代替や万能な研究ツールとして示されてはいない。管理されたデュアルユース領域で働く研究者にとって、制限は依然として実質的である。この発表は、モデル安全性が運用上の製品課題になっていることを示す。誰が答えるか、要求がどの頻度で振り分けられるか、役立つ回答が得られるかという形で、利用者はそれを直接経験する。次の証拠は、改良された分類器がAnthropicの社内テストの外でどう機能するかから得られる。