Os modelos de difusão, em tarefas de raciocínio, são piores do que a autoregressão tradicional? Esta pesquisa é bastante contraintuitiva, vale a pena ler com atenção.

Ver original
CoinNetwork
A equipa Huang Gao da Universidade Tsinghua ganhou o Prémio de Artigo de Destaque no ICML 2026, e o Prémio de Teste do Tempo foi atribuído ao algoritmo clássico A3C.
O prémio de melhor artigo do ICML 2026 foi atribuído ao artigo da equipa de Huang Gao da Universidade Tsinghua em colaboração com a Alibaba, que indica que a flexibilidade dos modelos de linguagem difusos para geração em ordem arbitrária pode limitar o potencial de tarefas de raciocínio como matemática e programação, e que a geração da esquerda para a direita é mais concisa e melhora significativamente a precisão do raciocínio. O prémio de teste do tempo foi atribuído ao artigo de 2016 da equipa do Google DeepMind, que propôs a arquitetura Actor-Critic com Vantagem Assíncrona (A3C), aumentando significativamente a eficiência de treino da aprendizagem por reforço profunda.
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado