Noticias de IA

Anthropic actualiza las salvaguardas biológicas de Fable 5 y reduce desvíos de consultas benignas

Anthropic asegura que un clasificador refinado reduce alrededor de un 85% los desvíos ligados a biología y mantiene controles para investigación de doble uso.

Publicado Actualizado
AnthropicSeguridad de IABiologíaClaude

Anthropic ha actualizado las salvaguardas biológicas de Fable 5 y afirma que el sistema revisado enviará muchas menos preguntas biológicas ordinarias a un modelo menos capaz. La empresa informó de que los desvíos relacionados con biología cayeron alrededor de un 85% en sus pruebas en distintas superficies de producto. La actualización pretende hacer más útil el modelo para preguntas cotidianas de salud y educación, al tiempo que conserva restricciones para solicitudes que la compañía clasifica como de doble uso, incluidas áreas como virología, toxicología, diseño molecular y trabajo profesional de desarrollo de fármacos. Es un refinamiento de un límite de seguridad existente, no la apertura de asistencia biológica de frontera sin restricciones.

Fable 5 utilizó al principio un clasificador amplio diseñado para errar por cautela. Cuando detectaba una solicitud biológica potencialmente protegida, el sistema redirigía al usuario a Opus 5, un modelo que Anthropic describe como capaz pero menos capaz en biología que Fable 5. Esa ruta era el desvío que veían los usuarios. El enfoque limitó la exposición a preguntas difíciles de doble uso, pero también bloqueó solicitudes benignas que podían surgir en un aula, en el intento de un paciente de entender resultados de laboratorio o en una conversación general sobre síntomas. Anthropic dice ahora que el nuevo clasificador distingue esas categorías con mayor precisión.

La explicación de la empresa subraya la dificultad central de las salvaguardas en biología: los usos beneficiosos y dañinos pueden estar técnicamente cerca. Investigar una enfermedad, diseñar un tratamiento o estudiar un patógeno puede solaparse con conocimiento que podría usarse indebidamente. Anthropic sostiene que Fable 5 puede superar a expertos en algunas tareas biológicas muy complejas y aportar apoyo operativo en otras, por lo que inicialmente puso una gama amplia de consultas detrás de una salvaguarda. La misma capacidad que ayuda a un investigador legítimo puede ayudar materialmente a un actor malicioso; por eso no basta con que una pregunta suene educativa en la superficie.

Para estrechar el límite, Anthropic dijo que reescribió la constitución del clasificador, un conjunto de reglas para distinguir material permitido de material protegido. Después desarrolló nuevos datos de entrenamiento, reentrenó el clasificador y pidió comentarios a expertos internos y externos. Afirma que el sistema resultante sigue activándose para contenido de investigación biológica dañino o de doble uso, pero permite una gama mayor de solicitudes benignas. El clasificador también debe resistir intentos de evasión, lo que complica reducir falsos positivos. La cifra de 85% es resultado de pruebas propias de Anthropic, no una medición independiente.

La experiencia esperada varía por superficie de producto. Anthropic dijo que el total de desvíos, incluidos los provocados por otras razones, debería caer aproximadamente un 67% en Claude.ai, un 55% en Cowork, un 17% en Claude Code y un 7% en Claude Platform. Esos números no garantizan que Fable 5 responda ahora toda pregunta biológica. La empresa seguirá apartando del modelo las solicitudes profesionales de biología y desarrollo de fármacos de doble uso. Su objetivo a más largo plazo es crear vías de acceso de confianza para investigadores que necesiten capacidades mayores bajo condiciones más controladas.

La publicación ilustra un equilibrio recurrente en el despliegue de modelos de frontera. Un sistema de seguridad que bloquea demasiado puede frustrar a usuarios y reducir la utilidad en contextos legítimos. Uno que bloquea demasiado poco puede crear riesgos difíciles de revertir después de que un modelo esté ampliamente disponible. El planteamiento de Anthropic es cambiar el clasificador en vez de eliminar el límite, usando reglas más estrechas y nuevos datos para mover preguntas claramente benignas al lado permitido. Si ese equilibrio se sostiene dependerá del rendimiento real, de pruebas adversariales y de la disposición de la compañía a ajustar de nuevo cuando aparezcan errores.

Para clínicos, educadores y usuarios corrientes, el mensaje práctico es moderado. Más preguntas cotidianas de biología y salud pueden recibir ayuda directa en lugar de un desvío, pero el producto no se presenta como sustituto del juicio médico ni como herramienta universal de investigación. Para investigadores que trabajan en ámbitos controlados de doble uso, la restricción sigue siendo sustancial. El anuncio muestra que la seguridad de modelos es cada vez más una cuestión operativa de producto: el usuario la percibe en qué modelo responde, con qué frecuencia se redirige una solicitud y si hay una respuesta útil. La siguiente evidencia vendrá de cómo funcione el clasificador refinado fuera de las pruebas internas de Anthropic.