AIMPACT propose une méthode systématique pour transformer un modèle d'inférence post-entraînement en un solveur de niveau olympique, en trois étapes : une fine-tuning supervisée avec un cours de perplexité inversée pour intégrer la recherche de preuve et l'auto-vérification ; une extension par apprentissage par renforcement en deux phases ; et une amélioration par mise à l'échelle lors de l'inférence. Appliqué à l'architecture 30B-A3B, utilisant environ 340 000 trajectoires sous 8K, suivi de 200 étapes de RL, pour obtenir SU-01. Ce modèle peut effectuer une inférence stable sur des problèmes difficiles, avec des trajectoires dépassant 100 000 tokens, atteignant un niveau de médaille d'or dans des compétitions telles que l'IMO/USAMO/IPhO, tout en montrant une capacité de généralisation en raisonnement scientifique au-delà des domaines mathématiques/physiques.

MeNews

2026-05-26 18:44:37

Création du résumé en cours

AIMPACT message, le 16 mai (UTC+8), un nouvel article propose une méthode systématique pour transformer un modèle de raisonnement post-entraînement en un solveur de niveau olympique, et entraîne le modèle SU-01 basé sur cette méthode. La méthode comprend trois étapes : d'abord, un ajustement supervisé avec un cours de perplexité inversée pour inculquer une recherche de preuve rigoureuse et un comportement d'auto-vérification ; ensuite, l'expansion de ces comportements par un apprentissage par renforcement en deux phases (passant d'un apprentissage par renforcement avec récompense vérifiable à un apprentissage par renforcement au niveau des preuves) ; enfin, une amélioration des performances par mise à l'échelle lors de l'évaluation. L'équipe de recherche a appliqué la méthode au modèle de base 30B-A3B, en utilisant environ 340 000 trajectoires de sous-8K tokens pour un ajustement supervisé, suivi de 200 étapes d'apprentissage par renforcement, pour obtenir SU-01. Ce modèle peut effectuer un raisonnement stable sur des problèmes difficiles, avec une longueur de trajectoire dépassant 100 000 tokens, atteignant un niveau de médaille d'or dans des compétitions telles que IMO 2025/USAMO 2026 et IPhO 2024/2025, et montrant une capacité de généralisation dans le domaine du raisonnement scientifique au-delà des mathématiques et de la physique. (Source : InFoQ)

Voir l'original

Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.

7 J'aime

Récompense
7
6
2
Partager

Commentaire

Ajouter un commentaire

NoSleepBridge

· Il y a 4h

Après la formation, cette méthodologie de transformation, d'autres domaines peuvent-ils copier le travail ?

Voir l'originalRépondre0

ExitLiquidityStan

· Il y a 4h

Le mécanisme d'auto-vérification est essentiel, beaucoup de modèles en manquent.

Voir l'originalRépondre0

NftsOutsideTheTidalLine

· Il y a 4h

340 000 trajectoires alimentées, RL en seulement 200 étapes, l'efficacité est impressionnante

Voir l'originalRépondre0

PineNeedlesAndColdWind

· Il y a 4h

Enfin, quelqu'un a considéré la recherche de preuve comme une compétence centrale, la direction est bonne

Voir l'originalRépondre0

MirrorPetals

· Il y a 4h

Peut-on aussi faire des compétitions de physique ? Cette capacité de généralisation est vraiment inattendue

Voir l'originalRépondre0

SudoSoul

· Il y a 4h

Niveau médaille d'or IMO... À l'avenir, les compétitions devront-elles être divisées en groupe humain et groupe IA ?

Voir l'originalRépondre0

Sujets populaires
Afficher plus
#
StockTradingChallengeUpTo17000U
16.22M Popularité
#
USStrikesIran
9.32M Popularité
#
IsraelStrikesIranBTCPlunges
49.49K Popularité
#
GatePredictionMarketAddsSmartMoneyTracking
13.8M Popularité
#
InstitutionalCapitalRotatesFromBTCToHYPEAndXRP
14.33M Popularité

Épinglé

Le modèle d'inférence post-entraînement SU-01 a atteint des performances de médaille d'or dans les questions de niveau olympique

Sujets populaires

StockTradingChallengeUpTo17000U

USStrikesIran

IsraelStrikesIranBTCPlunges

GatePredictionMarketAddsSmartMoneyTracking

InstitutionalCapitalRotatesFromBTCToHYPEAndXRP

Épinglé