Modelos de difusão são piores do que a autoregressão tradicional em tarefas de raciocínio? Esta pesquisa é bastante contraintuitiva, vale a pena ler com atenção.

Ver original
CoinNetwork
A equipe de Huang Gao da Universidade Tsinghua ganhou o Prêmio de Artigo Destaque do ICML 2026, e o Prêmio de Teste do Tempo foi concedido ao algoritmo clássico A3C.
O Prêmio de Melhor Artigo do ICML 2026 foi concedido ao artigo da equipe de Huang Gao da Tsinghua em colaboração com a Alibaba, apontando que a flexibilidade da geração em ordem arbitrária dos modelos de linguagem de difusão pode limitar o potencial em tarefas de raciocínio como matemática e programação, sendo que a geração da esquerda para a direita é mais concisa e melhora significativamente a precisão do raciocínio. O Prêmio de Teste do Tempo foi concedido ao artigo de 2016 da equipe do Google DeepMind, que propôs a arquitetura Asynchronous Advantage Actor-Critic (A3C), aumentando significativamente a eficiência do treinamento em aprendizado por reforço profundo.
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado