Moonshot AI lanzó el mayor modelo de IA abierto Kimi K3 - ForkLog

AI-agents ИИ агенты 3# Moonshot AI lanza el mayor modelo abierto de IA: Kimi K3

El startup chino de IA Moonshot AI presentó Kimi K3, el primer modelo abierto de clase 3T del mundo con 2,8 billones de parámetros, visión nativa y contexto de 1 millón de tokens. Según las estimaciones del propio proyecto, en el ranking general solo quedó por detrás de los modelos propietarios Claude Fable 5 y GPT 5.6 Sol.

Kimi K3 se construyó sobre una nueva arquitectura, Kimi Delta Attention (KDA) y Attention Residuals (AttnRes). KDA permite procesar de forma más eficiente secuencias largas de datos, mientras que AttnRes extrae la información necesaria no de todos los niveles de manera igual, sino de forma selectiva. Como resultado, el modelo entiende el contexto con más profundidad y conserva el sentido incluso al procesar textos complejos.

La escasez la gestiona el framework Stable LatentMoE: de 896 expertos, solo 16 trabajan al mismo tiempo. Esto, junto con nuevos datos y ajustes de entrenamiento, permitió un aumento de eficiencia de dos con medio veces frente a K2.

Según los desarrolladores, nueve de los últimos 12 meses los modelos de Kimi mantuvieron el récord en tamaño entre los modelos abiertos.

Fuente: blog de Kimi. El nuevo modelo de Moonshot AI ya está disponible en el sitio web, en Kimi Work, Code y API. Por defecto, está activado el modo máximo de razonamiento; otros aparecerán más adelante. Los pesos completos y el informe se publicarán el 27 de julio.

Resultados en los benchmarks

En parte de las pruebas, K3 mostró resultados superiores a Fable 5 y GPT-5.6 Sol, pero en otras quedó claramente rezagada. Lidera en SWE Marathon (42 frente a 35 y 39), BrowseComp (91,2 frente a 88 y 90,4) y Program Bench (77,8 frente a 76,8 y 77,6). En Terminal Bench 2.1, K3 tiene 88,3 puntos: es más que Fable 5 (84,6) y solo 0,5 puntos por debajo de Sol (88,8).

Al mismo tiempo, en FrontierSWE, K3 obtuvo 81,2 frente a 86,6 de Fable 5, y en HLE-Full, 43,5 frente a 53,3. Las metodologías de las pruebas, sin embargo, diferían: parte de los modelos se evaluaron mediante Claude Code, y otra parte mediante Codex o el propio KimiCode.

Codificación y tareas de agentes

K3 puede llevar sesiones de ingeniería largas con casi nula intervención humana, orientarse en repositorios grandes y gestionar herramientas del terminal.

En una prueba de optimización de núcleos de GPU del modelo, cuatro tareas trabajaron de forma independiente durante hasta 24 horas, incluyendo los núcleos AttnRes, KDA y MLA con dimensión de cabeza 512, en NVIDIA H200 y en GPU de otro fabricante. K3 logró un resultado al nivel de Fable 5 y superó con claridad a Opus 4.8, GPT-5.6 Sol y GPT-5.5. En etapas tardías del desarrollo, una versión temprana de K3 realizó de manera autónoma gran parte de esta optimización dentro del equipo de Moonshot.

Fuente: blog de Kimi. De forma adicional, el modelo escribió desde cero MiniTriton, un compilador compacto para núcleos de GPU con una capa IR propia sobre MLIR y generación de código PTX.

Diseño de chips y desarrollo de juegos

Como demostración, K3 diseñó de forma autónoma un chip para una red neuronal con su arquitectura propia.

El lanzamiento autónomo tomó 48 horas: el modelo usó herramientas EDA open source y la biblioteca Nangate 45 nm. El chip cabió en 4 mm², mantiene una frecuencia de 100 MHz y entrega más de 8700 tokens por segundo en simulación. Incluye 1,46 millones de celdas estándar, 0,277 MB de SRAM y una matriz INT4 MAC con decuantización integrada.

K3 también combina razonamiento 3D, código y visión para crear prototipos de juegos e interactivos a partir de conceptos, imágenes y video.

Trabajo con conocimientos y video

En un caso, K3 reprodujo relaciones universales I-Love-Q de la astrofísica computacional. Esto tomó alrededor de dos horas en lugar de una o dos semanas de trabajo de un investigador experimentado. El modelo revisó más de 20 artículos científicos, evaluó más de 300 ecuaciones de estado, encontró inconsistencias en fórmulas publicadas y escribió más de 3000 líneas de código en Python, presentando el resultado en un tablero HTML interactivo.

En otro caso, K3 preparó un informe interactivo sobre 42 años de historia de la industria de chips ASIC en 120 rondas de auto-mejora recursiva, procesando más de 11 000 páginas de 87 informes trimestrales y 99 PDF originales.

Fuente: blog de Kimi. Gracias al trabajo nativo con video, K3 sabe editar clips: en un ejemplo, el modelo hizo una animación explicativa de su arquitectura al estilo 3Blue1Brown; en otro, editó de forma autónoma un teaser sobre su lanzamiento a partir de 56 clips fuente, incluyendo selección de tomas, sincronización con música y procesamiento de audio. Según la estimación de Moonshot, un trabajo así tomaría a un editor experimentado uno o dos días, y a un principiante tres a cinco.

Limitaciones

El equipo del proyecto subrayó que K3 es sensible a la pérdida del historial de razonamiento al cambiar el entorno de agentes a mitad de una sesión, y puede mostrar una iniciativa excesiva en situaciones ambiguas. En facilidad de uso, por ahora el modelo aún está claramente por detrás de Fable 5 y GPT-5.6 Sol.

Recordemos que, en julio de 2025, Moonshot AI lanzó Kimi K2, la primera modelo de la serie con 1 billón de parámetros, que rápidamente se convirtió en uno de los sistemas abiertos líderes para tareas de agentes.

NVDA0,11%
Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado