Meituan open-sources LongCat-Video-Avatar 1.5 estrutura de avatar digital com inferência reduzida para 8 passos

robot
Geração do resumo em andamento
Notícias do site BiJie.com, a equipe do LongCat da Meituan open-sourou o framework de geração de pessoas digitais LongCat-Video-Avatar 1.5, reconstruindo os algoritmos de extração de áudio e geração de vídeo, com foco na estabilidade espacial-temporal de nível industrial e inferência ultrarrápida. O framework substitui o codificador wav2vec2 pelo codificador de áudio whisper-large-v3, melhorando a sincronização dos movimentos labiais e a dinâmica dos lábios, além de reforçar a robustez na geração de movimentos labiais multilingues e multilíngues. O modelo foi otimizado por aprendizado por reforço GRPO, reduzindo artefatos como deformações nas mãos e quadros com falhas anormais, além de melhorar a consistência de identidade em vídeos longos. O framework utiliza inferência de segmentos múltiplos com rolagem, aproveitando vídeos anteriores para estabelecer um contexto temporal global, mantendo a coerência da identidade do personagem. Na inferência, foi introduzida a técnica de destilação de poucos passos DMD2, comprimindo a iteração de remoção de ruído na geração para 8 passos, equilibrando eficiência de inferência e fidelidade da imagem. A avaliação foi realizada com base em 508 pares de imagens e áudios, coletando 13.240 julgamentos de 770 avaliadores, com 10 especialistas avaliando em múltiplos aspectos. O framework pode ser generalizado para estilos de anime e animais, suportando entrada de áudio mono e multicanal, com pesos do modelo publicados sob licença MIT. O conteúdo exibido é apenas para uso acadêmico; uso comercial requer verificação de conteúdo relacionado.
Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • 11
  • 3
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
MoonlightColdWallet
· 05-22 10:09
GRPO Os detalhes das mãos são um pouco interessantes, o problema clássico dos modelos de difusão é o desastre nos dedos
Ver originalResponder0
BudgetValidator
· 05-22 07:58
whisper-large-v3 colocou a boca realmente mais precisa, antes o cenário do wav2vec2 multilíngue frequentemente não combinava
Ver originalResponder0
CurveWhaleWatcher
· 05-22 07:31
A licença MIT é bem avaliada, mas os termos de uso comercial precisam ser analisados cuidadosamente para evitar problemas
Ver originalResponder0
MacroTide
· 05-22 07:26
A melhoria na estabilidade do espaço-tempo é muito mais significativa do que simplesmente aumentar o FID, a geração de vídeo finalmente está na direção certa.
Ver originalResponder0
SlippageSailor
· 05-22 07:19
Você quer saber se deve incluir um conjunto de dados focado em acadêmico? Quer tentar reproduzir o resultado?
Ver originalResponder0
ArbShuttle
· 05-22 07:19
O design de raciocínio por segmentos múltiplos é inteligente, não travar o rosto em vídeos longos é fundamental.
Ver originalResponder0
GotLiquidatedAgainLastNight.
· 05-22 07:10
LongCat esse nome foi quem escolheu, os engenheiros do Meituan também gostam de tirar fotos de gatos?
Ver originalResponder0
DeltaSmile
· 05-22 07:10
Suporte para múltiplos canais mono e estéreo, é muito adequado para ferramentas de dublagem.
Ver originalResponder0
SeaSaltAirdropNotes
· 05-22 07:10
A consistência de identidade finalmente está sendo levada a sério, antes na segunda metade dos vídeos de troca de rosto, frequentemente mudavam as pessoas
Ver originalResponder0
CrystalBallForSentiment
· 05-22 07:10
Qual é o aumento de eficiência do DMD2? Você tem dados de latência na A100?
Ver originalResponder0
Ver projetos
  • Fixado