A OpenAI lança uma framework de simulação de implementação para prever riscos de desalinhamento do GPT-5, erro mediano 1,5x
Segundo a Beating Monitoring, a OpenAI lançou um método de avaliação de segurança para simulação de implementação, para prever riscos de falha do modelo em ambientes reais antes do lançamento formal. A estrutura reproduziu 1,3 milhão de conversas anonimizadas do modelo GPT-5 entre agosto de 2025 e março de 2026, alcançando um erro mediano de apenas 1,5x na previsão das taxas de comportamento inesperado. Os benchmarks estáticos tradicionais (como o SWE-Bench) permitem que os modelos detectem cond
GateNews·06-17 11:05
