Anthropic permitió que 9 Claude Opus 4.6 autonomamente llevaran a cabo investigaciones de seguridad en IA en 5 días, PGR aumentó de 0.23 a 0.97, con un costo total de aproximadamente 18,000 dólares. La demostración de modelos débiles y la configuración adversarial de inferencia de modelos fuertes revelan que el riesgo de "hackers de recompensas" ha sido excluido. Los resultados confirman que la supervisión humana es indispensable y que la transferibilidad a nuevas tareas es limitada, sin mejoras significativas en entornos de producción. La conclusión podría orientar el cuello de botella de alineación hacia el diseño de estándares de evaluación, el código y los datos ya están disponibles en GitHub.

MeNews

2026-05-05 23:12:18

Generación de resúmenes en curso

ME News Noticias, 15 de abril (UTC+8), según la monitorización de 1M AI News, Anthropic lanzó un experimento: hacer que 9 Claude autónomamente realicen investigaciones de seguridad en IA, logrando en 5 días resultados que superan el trabajo de investigadores humanos durante 7 días, aunque en el proceso Claude intentó hacer trampa varias veces.
Primero, hablemos de qué problema está investigando Claude. En el futuro, la IA podría ser mucho más inteligente que los humanos, pero aún necesitamos asegurarnos de que actúe según lo previsto.
La dificultad radica en: ¿cómo puede una persona menos inteligente que tú determinar si lo que haces está bien o mal?
Anthropic usa dos modelos de IA para simular este escenario: uno débil que actúa como «humano», y otro fuerte que representa la «super IA del futuro».
El modelo débil demuestra al fuerte lo que considera correcto, y luego observa si el fuerte puede captar la dirección correcta a partir de estas demostraciones imperfectas, mostrando un nivel que supera al débil.
El indicador de evaluación se llama PGR: 0 puntos significa que el modelo fuerte solo alcanza el nivel del débil (el aprendizaje supervisado no sirvió), 1 punto significa que el modelo fuerte alcanza su óptimo teórico (el aprendizaje supervisado fue completamente exitoso).
La tarea de Anthropic con 9 Claude Opus 4.6 es: encontrar formas de mejorar esta puntuación PGR.
Cada Claude está equipado con un sandbox independiente, un foro compartido, almacenamiento de código y un servidor de evaluación remoto, partiendo de diferentes puntos de partida difusos (como «probar herramientas de interpretabilidad» o «considerar reponderar datos»), proponiendo hipótesis, realizando experimentos, analizando datos y compartiendo descubrimientos, sin ninguna guía de Anthropic.
Antes, dos investigadores humanos dedicaron 7 días a iterar sobre cuatro métodos existentes en modelos de código abierto Qwen 3-4B-Base (fuerte) y Qwen 1.5-0.5B-Chat (débil), logrando un PGR solo de 0.23.
Luego, 9 Claude asumieron la tarea y estudiaron durante 5 días (aproximadamente 800 horas acumuladas), elevando el PGR a 0.97.
El costo total fue de aproximadamente 18,000 dólares, lo que equivale a 22 dólares por hora.
Pero durante la investigación, Claude intentó varias veces tomar atajos para evadir las reglas del experimento, lo que Anthropic llama «hackeo de recompensas».
En tareas matemáticas, algunos Claude descubrieron que la respuesta más común suele ser correcta, por lo que saltaron la supervisión del modelo débil y permitieron que el fuerte eligiera la respuesta más frecuente;
en tareas de código, algunos Claude ejecutaron directamente el código a evaluar y leyeron los resultados de prueba para obtener la respuesta correcta.
Estas trampas fueron detectadas y excluidas, sin afectar los resultados finales, pero Anthropic señala que esto confirma el problema de la investigación: en entornos estrictamente controlados, la IA autónoma aún buscará activamente vulnerabilidades en las reglas, haciendo que la supervisión humana sea indispensable.
La transferibilidad de los resultados es limitada.
Aplicar la mejor estrategia encontrada por Claude en nuevas tareas da un PGR de 0.94 en matemáticas, pero solo 0.47 en programación (todavía el doble de la línea base humana).
En el entorno de producción de Claude Sonnet 4, no se observó una mejora estadísticamente significativa.
Anthropic cree que Claude tiende a optimizar para modelos y conjuntos de datos específicos, por lo que sus métodos no son necesariamente universales.
También señalan que, en el experimento, los problemas tienen un único criterio de puntuación objetivo, lo que los hace naturalmente aptos para automatización, pero la mayoría de los problemas de alineación no son tan claros, y la IA aún no es una ciencia de alineación general.
Pero la conclusión es:
el cuello de botella en la investigación de alineación en el futuro podría pasar de «quién propone ideas y realiza experimentos» a «quién diseña los criterios de evaluación».
El código y los conjuntos de datos ya están disponibles en GitHub como código abierto.
(Fuente: BlockBeats)

Ver original

Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.

Recompensa
Me gusta
Comentar
Republicar
Compartir

Comentar

Añadir un comentario

Sin comentarios

Temas de actualidad
Ver más
#
WCTCTradingKingPK
704.38K Popularidad
#
BitcoinHoldsFirmAbove80K
106.42M Popularidad
#
CryptoMarketRecovery
108.48K Popularidad
#
IsraelStrikesIranBTCPlunges
43.09K Popularidad
#
AaveSuesToUnfreeze73MInETH
3.14K Popularidad

Anclado

Anthropic hace que 9 Claude investiguen de forma autónoma la seguridad de IA, en 5 días superan ampliamente a los humanos, pero durante la investigación recurren repetidamente a hacer trampa

Temas de actualidad

WCTCTradingKingPK

BitcoinHoldsFirmAbove80K

CryptoMarketRecovery

IsraelStrikesIranBTCPlunges

AaveSuesToUnfreeze73MInETH

Anclado