¿Los modelos de difusión son peores que la autoregresión tradicional en tareas de razonamiento? Esta investigación es bastante contraintuitiva, vale la pena leerla con atención.

Ver original
CoinNetwork
El equipo de Huang Gao de la Universidad Tsinghua ganó el premio al artículo destacado de ICML 2026, y el premio Test of Time fue otorgado al algoritmo clásico A3C.
El Premio al Artículo Destacado de ICML 2026 fue otorgado al artículo en colaboración entre el equipo de Huang Gao de la Universidad de Tsinghua y Alibaba, que señala que la flexibilidad de los modelos de lenguaje de difusión para generar en cualquier orden puede limitar el potencial de las tareas de razonamiento como matemáticas y programación, y que la generación de izquierda a derecha es más concisa y mejora significativamente la precisión del razonamiento. El Premio a la Prueba del Tiempo fue otorgado a un artículo de 2016 del equipo de Google DeepMind, que propuso la arquitectura Asynchronous Advantage Actor-Critic (A3C), mejorando enormemente la eficiencia del entrenamiento en aprendizaje profundo por refuerzo.
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado