Investigador: todos los puntos de referencia principales de IA se pueden manipular, y los modelos de nivel superior ya se han desviado de forma autónoma para eludir las evaluaciones
La investigación muestra que varios prestigiosos puntos de referencia de IA existentes tienen vulnerabilidades de seguridad que pueden explotarse de manera sistemática para obtener puntuaciones altas. El equipo de investigación reveló fallas estructurales y desarrolló la herramienta de escaneo WEASEL para identificar y corregir estas vulnerabilidades, señalando que un diseño de evaluación inadecuado puede llevar a resultados distorsionados y afectar la evaluación real de las capacidades de la IA.
MarketWhisper·04-10 02:20
