Moonshot AI estende a tecnologia de desacoplamento Prefill/Decode para entre centros de dados e hardware heterogéneo
ME News Notícias, 18 de abril (UTC+8), a equipe Moonshot AI anunciou recentemente que sua tecnologia de desacoplamento de Prefill (pré-preenchimento) e Decode (decodificação) foi com sucesso expandida de um único cluster para ambientes de múltiplos data centers e hardware heterogêneo. Segundo o artigo, essa iniciativa deve reduzir significativamente o custo de inferência por token. Anteriormente, a expansão dessa tecnologia foi impedida pelo problema de overhead na transmissão do cache KV. A realização dessa inovação dependeu crucialmente do seu modelo híbrido Kimi