Muon silenciosamente "morre" de fome em 25% dos neurônios: após a reparação do Aurora, a eficiência dos dados aumenta cem vezes

robot
Geração do resumo em andamento
De acordo com o monitoramento Beating, a Tilde Research descobriu que o otimizador Muon, utilizado pelos modelos de ponta como DeepSeek V4, Kimi K2.5, GLM-5, possui uma falha oculta: ele faz com que, nos estágios iniciais do treinamento, mais de um quarto dos neurônios da camada MLP morram permanentemente. Com base nisso, a equipe desenvolveu um otimizador alternativo chamado Aurora e o open-souceou. Um modelo de 1,1B apenas com cerca de 100B de tokens conseguiu igualar o desempenho de Qwen3-1.7B treinado com 36T de tokens em benchmarks de compreensão de linguagem como HellaSwag e Winogrande.

O problema está em uma característica matemática do Muon ao lidar com a matriz de pesos da MLP. No início do treinamento, alguns neurônios acidentalmente recebem sinais de gradiente mais fracos. Otimizadores tradicionais como AdamW normalizam os parâmetros ao longo do tempo, suavizando essa diferença; mas a etapa de ortogonalização do Muon transmite o sinal fraco sem alterações. Os neurônios com sinais fracos continuam recebendo atualizações fracas, tornando-se cada vez mais silenciosos, formando um ciclo vicioso de "os fortes ficam mais fortes". Até o passo 500 do treinamento, mais de um quarto dos neurônios já estavam praticamente mortos, desperdiçando capacidade de parâmetro.

A versão aprimorada anterior, NorMuon, tentou mitigar isso forçando a normalização do tamanho de cada linha da matriz de atualização, mas ao custo de destruir a ortogonalidade da matriz de atualização (que permite que cada passo seja o mais eficiente possível, sendo uma vantagem central do Muon), resultando em perda de precisão na otimização. Aurora combina as restrições de "atualização uniforme" e "ortogonalidade" em uma restrição conjunta, usando iteração alternada para satisfazer ambas simultaneamente: garantindo que cada neurônio tenha uma oportunidade justa de aprender, sem sacrificar a precisão da atualização.

Sem ajustes de hiperparâmetros, Aurora consome apenas 6% a mais de cálculo do que Muon, podendo ser usado como substituto direto. Nos testes de pontuação de otimização do modded-nanoGPT, Aurora quebrou o recorde atual em 3175 passos. A vantagem do Aurora aumenta com a largura da MLP: quanto maior o fator de expansão, maior a melhora.

O código e o modelo pré-treinado de 1,1B já estão open-sourced.
Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado