A Moonshot AI lançou a maior modelo de IA aberta Kimi K3 - ForkLog

AI-agents ИИ агенты 3# Moonshot AI lançou o maior modelo aberto de IA: Kimi K3

A startup chinesa de IA Moonshot AI apresentou o Kimi K3 — o primeiro modelo aberto do mundo da classe 3T com 2,8 biliões de parâmetros, visão nativa e um contexto de 1 milhão de tokens. Pelas suas próprias estimativas, no cômputo geral, ficou atrás apenas dos modelos proprietários Claude Fable 5 e GPT 5.6 Sol.

O Kimi K3 foi construído sobre uma nova arquitetura, Kimi Delta Attention (KDA) e Attention Residuals (AttnRes). A KDA permite processar sequências de dados longas com mais eficiência, enquanto a AttnRes extrai a informação necessária não de todas as camadas de forma igual, mas de maneira seletiva. Com isso, o modelo compreende o contexto de forma mais profunda e mantém o sentido mesmo ao processar textos complexos.

A esparsidade é assegurada pelo framework Stable LatentMoE: de 896 especialistas, apenas 16 trabalham em simultâneo. Em conjunto com novos dados e ajustes de treino, isto resultou num aumento de eficiência de cerca de 2,5 vezes face ao K2.

Segundo os desenvolvedores, nove dos últimos 12 meses os modelos Kimi mantiveram o recorde de tamanho entre os modelos abertos.

Fonte: blog da Kimi. O novo modelo da Moonshot AI já está disponível no site, no Kimi Work, Code e API. Por padrão, está ativado o modo máximo de raciocínio; outros serão lançados mais tarde. Os pesos completos e o relatório serão publicados a 27 de julho.

Resultados em benchmarks

Em parte dos testes, o K3 obteve resultados superiores aos do Fable 5 e do GPT-5.6 Sol, mas noutros ficou claramente atrás. Lidera em SWE Marathon (42 vs 35 e 39), BrowseComp (91,2 vs 88 e 90,4) e Program Bench (77,8 vs 76,8 e 77,6). No Terminal Bench 2.1, o K3 tem 88,3 pontos: acima do Fable 5 (84,6) e apenas 0,5 ponto abaixo do Sol (88,8).

Ao mesmo tempo, no FrontierSWE o K3 marcou 81,2 vs 86,6 do Fable 5, e no HLE-Full — 43,5 vs 53,3. As metodologias de teste também diferiram: parte dos modelos foi avaliada via Claude Code; a outra parte, via Codex ou pelo próprio KimiCode.

Programação e tarefas de agentes

O K3 consegue conduzir longas sessões de engenharia com quase nenhuma intervenção humana, orientar-se em grandes repositórios e gerir ferramentas de terminal.

Num teste de otimização dos núcleos de GPU do modelo, núcleos individuais trabalharam de forma independente durante até 24 horas em quatro tarefas — incluindo núcleos AttnRes, KDA e MLA com dimensão de cabeça 512 — na NVIDIA H200 e em GPUs de outro fabricante. O K3 apresentou um resultado ao nível do Fable 5 e ultrapassou de forma notável o Opus 4.8, GPT-5.6 Sol e GPT-5.5. Nas fases finais do desenvolvimento, uma versão inicial do K3 fazia sozinha grande parte dessa otimização dentro da equipa da Moonshot.

Fonte: blog da Kimi. De forma independente, o modelo escreveu do zero o MiniTriton — um compilador compacto para núcleos de GPU com uma camada IR própria por cima do MLIR e geração de código PTX.

Design de chips e desenvolvimento de jogos

Como demonstração, o K3 projetou autonomamente um chip para uma rede neural na sua arquitetura própria.

O arranque autónomo demorou 48 horas: o modelo utilizou ferramentas EDA open-source e a biblioteca Nangate 45 nm. O chip coube em 4 mm², mantém uma frequência de 100 MHz e gera mais de 8700 tokens por segundo na simulação. Inclui 1,46 milhões de células padrão, 0,277 MB de SRAM e um array de INT4 MAC com descuantização integrada.

O K3 também combina raciocínio 3D, código e visão para criar protótipos de jogos e interativos a partir de conceitos, imagens e vídeos.

Trabalho com conhecimento e vídeo

Num dos casos, o K3 reproduziu relações universais I-Love-Q da astrofísica computacional. Foram cerca de duas horas, em vez de uma a duas semanas de trabalho de um investigador experiente. O modelo verificou mais de 20 artigos científicos, avaliou mais de 300 equações de estado, encontrou inconsistências nas fórmulas publicadas e escreveu mais de 3000 linhas de código em Python, apresentando o resultado num dashboard HTML interativo.

Noutro caso, o K3 preparou um relatório interativo sobre 42 anos da história da indústria de chips ASIC em 120 rondas de autoaperfeiçoamento recursivo, processando mais de 11 000 páginas de 87 relatórios trimestrais e 99 PDFs originais.

Fonte: blog da Kimi. Graças ao trabalho nativo com vídeo, o K3 sabe montar vídeos: num exemplo, o modelo fez uma animação explicativa da sua arquitetura no estilo 3Blue1Brown; noutro, montou sozinho um teaser sobre o seu lançamento a partir de 56 clipes de origem, incluindo seleção de frames, sincronização com a música e processamento de áudio. Segundo a Moonshot, esse trabalho levaria um a dois dias a um editor experiente e três a cinco a um iniciante.

Limitações

A equipa do projeto destacou que o K3 é sensível à perda do histórico de raciocínio quando se muda o ambiente do agente no meio de uma sessão e pode demonstrar iniciativa excessiva em situações ambíguas. Em termos de facilidade de utilização, o modelo ainda fica claramente atrás do Fable 5 e do GPT-5.6 Sol.

Recorde-se que, em julho de 2025, a Moonshot AI lançou o Kimi K2 — o primeiro modelo da linha com 1 trilião de parâmetros, que rapidamente se tornou um dos principais sistemas abertos para tarefas de agentes.

NVDA0,11%
Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado