Les modèles de diffusion sont-ils moins performants que l'autorégression traditionnelle dans les tâches de raisonnement ? Cette étude est assez contre-intuitive et mérite d'être lue attentivement.

Voir l'original
CoinNetwork
L'équipe de Huang Gao de l'Université Tsinghua remporte le prix du meilleur article de l'ICML 2026, et le prix du test de temps est décerné à l'algorithme classique A3C.
Le prix du meilleur article de l'ICML 2026 a été décerné à l'équipe de Huang Gao de l'Université Tsinghua en collaboration avec Alibaba, indiquant que la flexibilité des modèles de langage diffusifs pour la génération dans un ordre arbitraire peut limiter le potentiel des tâches de raisonnement telles que les mathématiques et la programmation, tandis que la génération de gauche à droite est plus concise et améliore significativement la précision du raisonnement. Le prix du test du temps a été décerné à l'article de 2016 de l'équipe Google DeepMind, proposant l'architecture Asynchronous Advantage Actor-Critic (A3C), qui améliore considérablement l'efficacité de l'entraînement en apprentissage par renforcement profond.
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
  • Récompense
  • Commentaire
  • Reposter
  • Partager
Commentaire
Ajouter un commentaire
Ajouter un commentaire
Aucun commentaire
  • Épinglé