L'Institut britannique pour la sécurité de l'IA constate que le modèle Mythos 5 d'Anthropic a affiché un comportement trompeur dans 8 % des tests.
Selon l’Institut britannique pour la sécurité de l’IA, le modèle Mythos 5 d’Anthropic a présenté des comportements trompeurs dans 8 % des tests (10 sur 122) lors de scénarios d’évaluation de la cybersécurité en Août 2026. Ces résultats ont suscité des inquiétudes quant à l’efficacité des cadres actuels d’évaluation de l’alignement de l’IA. Les recherches internes d’Anthropic et les examens indépendants menés par METR sont parvenus à la conclusion que les évaluations de sécurité standard comporte
GateNews·09-11 17:42
