AI 뉴스
Anthropic, Fable 5 생물학 보호 장치 개선으로 일반 질문 폴백 축소
Anthropic은 개선된 분류기가 생물학 관련 폴백을 약 85% 줄이면서 이중용도 연구 요청에 대한 보호를 유지한다고 밝혔다.
Anthropic이 Fable 5의 생물학 보호 장치를 업데이트해, 일반 생물학 질문이 능력이 낮은 모델로 돌아가는 횟수를 크게 줄이겠다고 밝혔다. 회사는 제품 전반의 시험에서 생물학 관련 폴백이 약 85% 감소했다고 말했다. 이번 변경은 일상적인 건강·교육 질문에서는 모델을 더 쓸모 있게 하되, 바이러스학, 독성학, 분자 설계, 전문 신약 개발처럼 이중용도로 분류한 요청에는 제한을 남기는 것을 목표로 한다. 이는 기존 안전 경계를 다듬은 것이며, 최첨단 생물학 지원을 제한 없이 여는 결정은 아니다.
Fable 5는 처음에 신중함을 우선하는 폭넓은 분류기를 사용했다. 분류기가 보호가 필요할 수 있는 생물학 요청을 감지하면, 시스템은 사용자를 Opus 5로 보냈다. Anthropic은 이를 유능하지만 Fable 5와 같은 수준의 생물학 능력은 없는 모델로 설명한다. 사용자가 본 폴백이 바로 이 경로다. 이 방법은 어려운 이중용도 질문에 대한 노출을 제한했지만, 수업의 질문, 검사 결과를 이해하려는 환자, 증상에 관한 일반적 논의처럼 무해한 요청도 막았다. Anthropic은 새 분류기가 이를 더 정확히 가른다고 했다.
회사의 설명은 생물학 보호 장치의 핵심 난점을 드러낸다. 유익한 사용과 해로운 사용은 기술적으로 가까울 수 있다. 질병을 연구하고 치료법을 설계하며 병원체를 연구하는 일은 악용될 수 있는 지식과 겹칠 수 있다. Anthropic은 Fable 5가 일부 복잡한 생물학 과업에서 전문가를 능가하고 다른 과업에서는 실무적 도움을 줄 수 있다고 했다. 그래서 합법적인 연구자를 돕는 능력과 같은 능력이 악의적 행위자에게도 실질적 도움을 줄 수 있으며, 질문이 겉으로 교육적으로 들리는지만으로 사용을 평가할 수 없다는 것이다.
경계를 좁히기 위해 Anthropic은 허용되는 내용과 보호되는 내용을 구별하는 규칙 모음인 분류기의 ‘헌법’을 다시 썼다고 설명했다. 이어 새 훈련 데이터를 만들고 분류기를 재훈련했으며 내부와 외부 전문가의 의견을 구했다. 그 결과 시스템은 해롭거나 이중용도인 연구 생물학 내용에는 계속 반응하면서 더 많은 무해한 요청을 허용한다고 회사는 말한다. 분류기는 탈옥 시도에도 강해야 하므로 오탐을 줄이는 작업이 더 어렵다. 85%라는 수치는 독립 측정이 아니라 Anthropic 자체 시험 결과다.
예상되는 사용자 경험은 제품 표면에 따라 다르다. Anthropic은 다른 원인을 포함한 전체 폴백이 Claude.ai에서 약 67%, Cowork에서 55%, Claude Code에서 17%, Claude Platform에서 7% 줄 것으로 봤다. 그렇다고 모든 생물학 질문에 이제 Fable 5가 답한다는 뜻은 아니다. 회사는 이중용도 전문 생물학과 신약 개발 요청을 계속 모델 밖으로 돌리겠다고 했다. 더 장기적으로는 통제된 조건에서 더 강한 능력을 필요로 하는 연구자를 위한 신뢰 가능한 접근 경로를 만들겠다는 목표다.
이번 발표는 최첨단 모델 배포에서 반복되는 절충을 보여 준다. 너무 넓게 막는 안전 시스템은 사용자를 좌절시키고 정당한 상황에서 제품의 유용성을 떨어뜨린다. 너무 좁게 막는 시스템은 모델이 널리 쓰인 뒤 되돌리기 어려운 위험을 만들 수 있다. Anthropic의 방법은 경계를 없애는 대신 분류기를 바꾸고, 더 좁은 규칙과 새 훈련 데이터로 명백히 무해한 질문을 허용 쪽으로 옮기는 것이다. 이 균형이 유지될지는 실제 성능, 적대적 시험, 오류가 나타났을 때 다시 조정하려는 회사의 의지에 달려 있다.
임상의, 교육자, 일반 사용자에게 실용적인 메시지는 절제돼 있다. 더 많은 일상 생물학·건강 질문이 폴백 없이 도움을 받을 수 있지만, 이 제품은 의료 판단의 대체물이나 범용 연구 도구로 제시되지 않는다. 통제된 이중용도 영역에서 일하는 연구자에게 제한은 여전히 실질적이다. 이 발표는 모델 안전이 운영상의 제품 문제가 되고 있음을 보여 준다. 누가 답하는지, 요청이 얼마나 자주 다른 모델로 보내지는지, 유용한 답을 받을 수 있는지가 사용자에게 직접 드러난다. 다음 증거는 개선된 분류기가 Anthropic 내부 시험 밖에서 어떻게 작동하는지에서 나올 것이다.