美團開源LongCat-Video-Avatar 1.5數字人框架推理縮至8步

robot
摘要生成中
币界網消息,美團長貓團隊開源了數字人生成框架LongCat-Video-Avatar 1.5,重構了音頻提取與視頻生成算法,主打工業級時空穩定性與极速推理。框架將wav2vec2編碼器替換為whisper-large-v3音頻編碼器,提升了口型同步和唇形動態,增強了多語種和跨語言口型生成的魯棒性。模型通過GRPO強化學習優化,降低了手部變形和異常抽幀等偽影,提升了長視頻的身份一致性。框架採用多片段滾動推理,利用前序視頻建立全局時序上下文,保持角色身份連貫。推理端引入DMD2的少步蒸餾技術,將生成去噪迭代壓縮至8步,平衡推理效率與圖像保真度。評估測試基於508組圖像與音頻配對樣本,770名評估者收集了13240次判斷,10名專家從多個維度進行評分。框架可泛化至動漫與動物風格,支持單聲道與多聲道音頻輸入,模型權重以MIT協議發布,展示內容僅供學術使用,商用需核對相關內容。
查看原文
此頁面可能包含第三方內容,僅供參考(非陳述或保證),不應被視為 Gate 認可其觀點表述,也不得被視為財務或專業建議。詳見聲明
  • 打賞
  • 11
  • 3
  • 分享
回覆
請輸入回覆內容
請輸入回覆內容
月光冷钱包
· 05-22 10:09
GRPO 搞手部細節有點意思,擴散模型老毛病就是手指災難
查看原文回復0
BudgetValidator
· 05-22 07:58
whisper-large-v3 換上去口型確實準多了,之前 wav2vec2 multilingual 場景經常對不上
查看原文回復0
Curve Whale watcher
· 05-22 07:31
MIT 許可好評,但商用條款得仔細看,別踩坑
查看原文回復0
宏观潮汐
· 05-22 07:26
時空穩定性提升比單純漲 FID 有意義多了,視頻生成終於卷對方向
查看原文回復0
SlippageSailor
· 05-22 07:19
以學術為主的話,資料集要不要放?想復現看看
查看原文回復0
套利穿梭者
· 05-22 07:19
多片段滾動推理這個設計聰明,長視頻不崩臉太關鍵了
查看原文回復0
昨晚又被清算
· 05-22 07:10
LongCat 這名字誰取的,美團工程師也吸貓嗎
查看原文回復0
Delta微笑
· 05-22 07:10
單多聲道都支持,做配音工具很合適啊
查看原文回復0
海盐空投笔记
· 05-22 07:10
身份一致性終於有人認真做了,之前換臉視頻後半段經常換人
查看原文回復0
水晶球看情绪
· 05-22 07:10
DMD2 效率提升有多少?A100 上 latency 數據有嗎
查看原文回復0
查看更多