Новое исследование показывает, что зашифрованные цепочки рассуждений можно извлечь с помощью джейлбрейка из моделей Claude, GPT и Gemini.
Согласно исследованию, за которым следит Beating, исследователи нашли способ обойти защиту, которую разработчики моделей используют против дистилляции возможностей. Если передать зашифрованные цепочки рассуждений от более крупной модели, такой как Opus, меньшей модели, например Haiku, а затем провести джейлбрейк менее мощной модели, исследователи могут извлечь исходные рассуждения, не взламывая шифрование, — фактически заставляя модели самого разработчика расшифровывать содержимое. Метод был под
GateNews·08-11 15:53
