A barreira de hardware local para o Kimi K3? A partir de 64 GPUs, consumo de 45kW de energia, os jogadores montam a própria solução e saem do jogo

A parte escura da Lua publicou esta semana o Kimi K3, que, com 2,8 biliões de parâmetros no total, se torna o maior modelo open-source de pesos de sempre; os pesos completos deverão ser disponibilizados na plataforma até 27 de Julho. As orientações oficiais de implementação indicam que, para o utilizador montar por conta própria, são pelo menos 64 placas de aceleradores; para quem joga num único computador, há apenas dois caminhos: a família K2 ou a utilização da API oficial.
(Antecedentes: a A parte escura da Lua, Moonshot AI, vai lançar o Kimi K3! Com 2,8 biliões de parâmetros e texto longo de “milhões”, o desempenho fica perto do Anthropic Opus 4.8.)
(Informação de contexto: o meu computador consegue executar localmente modelos de IA? O CanIRun.ai ajuda-te a analisar rapidamente.)

Índice do artigo

Alternar

  • O que é MoE?
  • Limite oficial: a partir de 64 GPUs
  • A geração anterior ainda cabia numa única máquina

Mais cedo esta semana, a A parte escura da Lua (Moonshot AI) anunciou o Kimi K3, com 2,8 biliões de parâmetros no total, tornando-se o maior modelo open-source de pesos de sempre. Só para guardar estes 2,8 biliões de parâmetros em disco, usando o formato nativo oficial de 4 bits (MXFP4), são necessários entre 1,4TB e 1,5TB de espaço, e isto ainda antes de começar a fazer inferência. Para as pessoas comuns, o limite é extremamente, extremamente elevado.

A A parte escura da Lua indica que os pesos de código aberto completos deverão ser disponibilizados antes de 27 de Julho, utilizando uma licença Modified-MIT que permite a configuração por conta própria. Até ao momento em que este artigo foi concluído, os pesos completos e também as versões quantificadas da comunidade (por exemplo, GGUF) ainda não tinham surgido.

O que é MoE?

O Kimi K3 usa uma arquitetura MoE (Mixture of Experts, mistura de especialistas). Em termos simples: dentro do modelo existem 896 “redes de especialistas” filhas; quando o sistema processa um token, apenas selecciona 16 especialistas por roteamento mais o cálculo dos especialistas partilhados, não calcula tudo de uma vez. É por isso que os parâmetros que estão efectivamente “activos” durante o funcionamento são apenas de 50 a 60 mil milhões.

O modelo também adoptou uma nova arquitectura, Kimi Delta Attention (KDA), juntamente com Attention Residuals. A avaliação oficial indica que, em contexto de longa extensão com um milhão de tokens, a velocidade de descodificação melhora até 6,3 vezes; a janela de contexto atinge 1 milhão de tokens e o modelo também suporta nativamente a entrada visual.

Limite oficial: a partir de 64 GPUs

Nas orientações oficiais de implementação do sistema, a A parte escura da Lua indica que para montar o K3 por conta própria são necessários pelo menos 64 ou mais aceleradores. Os pesos MXFP4 nativos são cerca de 1,5TB, ou seja, 3,7 vezes mais do que o DeepSeek-R1 671B (na quantificação Q4, cerca de 407GB). Se apenas convertermos a forma de “colocar os pesos”, quantas GPUs são necessárias:

  • H100 (80GB): cerca de 19 placas
  • H200 (141GB): cerca de 11 placas
  • B200 (192GB): cerca de 8 placas

E isto ainda não inclui o KV cache, ou seja, a memória que o modelo usa para recordar o contexto da conversa; a necessidade de KV cache para um contexto com 1 milhão de tokens ainda não foi divulgada oficialmente, mas só pode ser maior, não menor.

Em termos de preço, um H100 de 80GB custa cerca de 25 mil a 33 mil dólares por placa (PCIe); a versão SXM custa 35 mil a 40 mil dólares ou mais. Um servidor de 8 GPUs H100 ultrapassa os 300 mil dólares. Cumprindo o limiar oficial de 64 placas, equivale a 8 servidores com 8 GPUs; só a compra de hardware ultrapassa 2,4 milhões de dólares, cerca de mais de 70 milhões de TWD.

Em termos de consumo de energia, cada H100 consome cerca de 700W; com 64 GPUs, isso dá cerca de 45kW, muito acima da capacidade típica de fornecimento eléctrico de uma casa, sendo um consumo ao nível de centro de dados.

A geração anterior ainda cabia num computador

A diferença sente-se ainda mais quando comparamos com a família K2 da geração anterior (1 bilião de parâmetros, cerca de 32 mil milhões de parâmetros activados). A quantificação extrema de 1,8 bit feita pela comunidade para o K2 permite executá-lo com cerca de 247GB; uma GPU de consumo de 24GB, combinada com descarregamento para a memória do sistema, também consegue funcionar. No caso do K2.5, é necessário mais de 380GB de memória unificada; quanto ao K2.6 na versão Q2, são cerca de 350GB.

Uma Mac Studio com 512GB conseguia fazer o trabalho da geração anterior com dificuldade, mas o K3 empurra directamente o limite para o nível de centro de dados. Para investidores individuais que queiram usar, o ideal é fazer downgrade para a família K2 ou, em alternativa, chamar directamente a API oficial.

Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado