AI安全

Anthropic CEO、フロンティアAIの能力向上ペースを落とすよう呼びかけ

Dario Amodei氏は、外部評価者の常駐と業界協調を軸に、AI安全対策の時間を確保すべきだと訴えた。

公開日 更新日
AnthropicDario AmodeiAI安全フロンティアAI

Anthropicの最高経営責任者Dario Amodei氏は、AI業界の中でも最も扱いにくい論点を正面から提起した。主要なフロンティアAI企業は、安全対策がさらに遅れる前に、モデル能力を高める速度を意図的に抑える必要があるかもしれないという主張だ。AP通信は9月13日、Amodei氏が9月に公開したエッセイを取り上げ、モデルがより自律的になり、次世代モデルの開発を助ける能力を増している今、アラインメント、監視、運用上の管理に時間を与えるべきだと報じた。

この提案が注目されるのは、Anthropicが競争の外にいる規制団体ではなく、まさに最先端のAI開発企業だからだ。Amodei氏は、AIが医療や生産性に大きな利益をもたらす可能性を引き続き信じている。一方で、その利益は技術を制御できる場合に限られると強調する。ここ数カ月、AIシステムが再帰的自己改善、サイバー作戦、複数エージェントの協調行動で力を増していることが、懸念を強めたという。

計画の第一歩は具体的だ。Anthropicは第三者評価者に、継続的で社員に近いレベルのアクセスを与えるという。外部専門家が安全手順、訓練パイプライン、事故対応、アラインメント上の主張を社内から確認できるようにする狙いだ。Amodei氏は、評価者がオフィスの席、入館証、会社のノートPCを持つことも想定している。安全確認を単発の公開報告ではなく、常時の仕組みに変えるためである。

第二段階は民主主義国のフロンティア企業間の協調で、共通の安全基準と制御不能な能力加速への制限を設けることだ。ただし企業が共同で開発速度を調整するには反トラスト法上の難しさがあり、政府支援が必要になる可能性がある。第三段階はさらに困難で、中国など権威主義国を含む国際的な合意を模索しつつ、チップ規制、不正な蒸留の防止、モデル重みの保護によって民主主義国の安全保障上の優位を守るというものだ。

背景には、OpenAIエージェントによるHugging Face侵害、外部サイトをメッセージボードとして使う事例、Anthropicが公表した悪用阻止の事例がある。AI安全はもはや研究上の抽象論ではなく、実際の運用事故として見え始めている。開発を遅らせる提案は投資家、政府、競合企業にとって難しい選択を伴うが、競争の内部から出たこの発言は、監視、可解釈性、封じ込めを本当に能力向上に追いつかせられるのかという問いを鋭くした。