Requisitos de hardware para rodar o Kimi K3 localmente? Começa com 64 GPUs, consome 45 kW de energia e os jogadores precisam montar sua própria solução, ou seja, fica fora de alcance

月之暗面本週 publicou o Kimi K3, com 2,8 trilhões de parâmetros totais, tornando-se o maior modelo de pesos abertos da história. Os pesos completos devem ser disponibilizados até 27 de julho. As orientações oficiais de implantação indicam que, para montar por conta própria, é necessário pelo menos 64 aceleradores; já para jogadores individuais, existem basicamente duas rotas: usar a família K2 ou chamar a API oficial.
(Recap: a Moonshot AI (Moonshot AI) vai lançar o Kimi K3! Com 2,8 trilhões de parâmetros e um contexto de texto de milhões de tokens, o desempenho fica muito perto do Anthropic Opus 4.8)
(Complemento de contexto: meu computador consegue rodar modelos de IA localmente? O CanIRun.ai ajuda você a analisar rapidamente)

Sumário

Toggle

  • O que é MoE?
  • Requisito oficial: começa com 64 GPUs
  • A geração anterior ainda cabia em um computador

Mais cedo nesta semana, a Moonshot AI publicou o Kimi K3, com 2,8 trilhões de parâmetros, que se tornou o maior modelo aberto de pesos da história. Só para armazenar esses 2,8 trilhões de parâmetros em disco, usando o formato nativo de 4 bits oficial (MXFP4), são necessários de 1,4 TB a 1,5 TB de espaço — e isso ainda nem começou a rodar inferência. Para a maioria das pessoas, o nível de exigência é extremamente, extremamente alto.

A Moonshot AI afirma que os pesos completos e abertos devem ser publicados até 27 de julho, com licença Modified-MIT, permitindo configurações por conta própria. No momento em que este texto foi fechado, os pesos completos e também versões quantizadas da comunidade (como GGUF) ainda não apareceram.

O que é MoE?

O Kimi K3 usa uma arquitetura MoE (mistura de especialistas). Em termos simples, o modelo mantém 896 “redes de especialistas” internas; quando processa um token, o sistema escolhe apenas 16 especialistas de roteamento, além de um cálculo de especialistas compartilhados, em vez de calcular tudo — por isso, os parâmetros realmente “ativos” ao rodar ficam entre 50 bilhões e 60 bilhões.

O modelo também adota uma nova arquitetura, Kimi Delta Attention (KDA), combinada com Attention Residuals; na autoavaliação oficial, em contexto longo de milhões de tokens, a velocidade de decodificação melhora até 6,3 vezes. A janela de contexto chega a 1 milhão de tokens e o modelo também oferece suporte nativo a entradas visuais.

Requisito oficial: começa com 64 GPUs

Nas orientações oficiais de implantação, a Moonshot AI deixa claro que montar o K3 por conta própria exige pelo menos 64 aceleradores. Os pesos nativos MXFP4 têm cerca de 1,5 TB; isso é 3,7 vezes o DeepSeek-R1 671B (quantização Q4 em torno de 407 GB). Fazendo apenas a conversão para colocar os pesos, quantas GPUs seriam necessárias:

  • H100 (80GB): cerca de 19 GPUs
  • H200 (141GB): cerca de 11 GPUs
  • B200 (192GB): cerca de 8 GPUs

E isso ainda não conta o KV cache, ou seja, a memória usada para o modelo guardar o histórico do diálogo (contexto). A necessidade de KV cache para contexto de 1 milhão de tokens ainda não foi divulgada oficialmente, mas só tende a aumentar, não a diminuir.

Em preços, uma H100 de 80GB custa em torno de US$ 25 mil a US$ 33 mil por placa (PCIe); na versão SXM, fica acima de US$ 35 mil a US$ 40 mil por placa. Um servidor com 8 placas H100 custa mais de US$ 300 mil. Considerando o limite oficial de 64 GPUs, isso equivale a 8 servidores com 8 placas; só a compra de hardware ultrapassa US$ 2,4 milhões, algo como acima de US$ 70 milhões em moeda local (aprox. Taiwan).

Em consumo de energia, uma H100 tem cerca de 700W; com 64 GPUs, isso dá aproximadamente 45kW. É muito acima da capacidade de energia de uma residência comum, sendo um nível típico de data center.

A geração anterior ainda cabia em um computador

Comparando com a geração anterior da família K2 (1 trilhão de parâmetros, cerca de 32 bilhões de parâmetros ativados), a diferença fica bem mais clara. A quantização extrema de 1,8 bit feita pela comunidade para o K2 permite rodar com aproximadamente 247GB; uma GPU de consumo de 24GB, junto com capacidade de descarregamento (offload) usando memória do sistema, também dá para fazer funcionar. Já o K2.5 precisa de mais de 380GB de memória unificada, e o K2.6 na versão Q2 fica em torno de 350GB.

A geração anterior, em um Mac Studio de 512GB, até dá para rodar “no limite”, mas o K3 volta o patamar diretamente para o nível de data center. Para investidores pessoa física que queiram usar, o caminho é reduzir a versão e usar a família K2, ou então chamar a API oficial diretamente.

Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado