Moonshot AI випустив найбільшу відкриту ІІ-модель Kimi K3 - ForkLog

AI-agents ИИ агенты 3# Moonshot AI випустив найбільшу відкриту ШІ-модель Kimi K3

Китайський ШІ-стартап Moonshot AI представив Kimi K3 — першу у світі відкриту модель класу 3T із 2,8 трлн параметрів, нативним зором і контекстом на 1 млн токенів. За власними оцінками проєкту, у загальному заліку вона поступилася лише пропрієтарним Claude Fable 5 і GPT 5.6 Sol.

Kimi K3 побудована на новій архітектурі Kimi Delta Attention (KDA) та Attention Residuals (AttnRes). KDA дає змогу ефективніше обробляти довгі послідовності даних, а AttnRes витягує потрібну інформацію не з усіх шарів однаково, а вибірково. У результаті модель глибше розуміє контекст і зберігає зміст навіть під час обробки складних текстів.

За розрідженість відповідає фреймворк Stable LatentMoE: із 896 експертів одночасно працюють лише 16. Це в сукупності з новими даними та налаштуваннями навчання дало зростання ефективності в півтора раза порівняно з K2.

За словами розробників, дев’ять із останніх 12 місяців моделі Kimi утримували рекорд за розміром серед відкритих моделей.

Джерело: блог Kimi. Нова модель Moonshot AI уже доступна на сайті, у Kimi Work, Code та API. За замовчуванням увімкнено максимальний режим роздумів, інші з’являться пізніше. Повні ваги та звіт опублікують 27 липня.

Результати на бенчмарках

На частині тестів K3 показала результати вищі, ніж у Fable 5 та GPT-5.6 Sol, але в інших помітно відстала. Вона лідирує на SWE Marathon (42 проти 35 і 39), BrowseComp (91,2 проти 88 і 90,4) та Program Bench (77,8 проти 76,8 і 77,6). На Terminal Bench 2.1 у K3 — 88,3 бали: це вище Fable 5 (84,6) і лише на 0,5 бала нижче Sol (88,8).

При цьому на FrontierSWE K3 набрала 81,2 проти 86,6 у Fable 5, а на HLE-Full — 43,5 проти 53,3. Методики тестування при цьому відрізнялися: частину моделей оцінювали через Claude Code, інші — через Codex або власний KimiCode.

Кодування та агентні задачі

K3 уміє вести довгі інженерні сесії майже без участі людини, орієнтуватися у великих репозиторіях і керувати термінальними інструментами.

У тесті оптимізації GPU-ядер моделі незалежно працювали до 24 годин над чотирма задачами — включно з ядрами AttnRes, KDA та MLA з розмірністю голови 512 — на NVIDIA H200 та GPU іншого виробника. K3 показала результат на рівні Fable 5 і помітно випередила Opus 4.8, GPT-5.6 Sol та GPT-5.5. На пізніх етапах розробки рання версія K3 самостійно виконувала більшу частину такої оптимізації всередині команди Moonshot.

Джерело: блог Kimi. Окремо модель із нуля написала MiniTriton — компактний компілятор для GPU-ядер із власним IR-шаром поверх MLIR і генерацією PTX-коду.

Проєктування чипів і розробка ігор

Як демонстрацію K3 самостійно спроєктувала чип для нейромережі на власній архітектурі.

Автономний запуск зайняв 48 годин: модель використовувала open-source EDA-інструменти та бібліотеку Nangate 45 нм. Чип умістився в 4 мм², тримає частоту 100 МГц і видає понад 8700 токенів за секунду в симуляції. Він включає 1,46 млн стандартних комірок, 0,277 МБ SRAM та масив INT4 MAC із вбудованою деквантизацією.

K3 також поєднує 3D-міркування, код і зір для створення ігрових та інтерактивних прототипів із концептів, зображень і відео.

Робота зі знаннями та відео

У одному з кейсів K3 відтворила універсальні співвідношення I-Love-Q із обчислювальної астрофізики. На це пішло приблизно дві години замість однієї–двох тижнів роботи досвідченого дослідника. Модель перевірила понад 20 наукових статей, оцінила понад 300 рівнянь стану, знайшла неузгодженості в опублікованих формулах і написала понад 3000 рядків коду на Python, оформивши результат в інтерактивний HTML-дашборд.

В іншому випадку K3 підготувала інтерактивний звіт про 42 роки історії індустрії ASIC-чипів за 120 раундів рекурсивного самовдосконалення, обробивши понад 11 000 сторінок із 87 квартальних звітів і 99 оригінальних PDF.

Джерело: блог Kimi. Завдяки нативній роботі з відео K3 уміє монтувати ролики: в одному прикладі модель зробила пояснювальну анімацію власної архітектури в стилі 3Blue1Brown, в іншому — самостійно змонтувала тизер про свій запуск із 56 вихідних кліпів, включно з добором кадрів, синхронізацією з музикою та обробкою звуку. За оцінкою Moonshot, така робота зайняла б у досвідченого монтажера один–два дні, а в новачка — три–п’ять.

Обмеження

Команда проєкту підкреслила, що K3 чутлива до втрати історії роздумів під час перемикання агентного середовища в середині сесії, може проявляти надмірну ініціативу в неоднозначних ситуаціях. За зручністю використання модель наразі помітно поступається Fable 5 і GPT-5.6 Sol.

Нагадаємо, в липні 2025 року Moonshot AI випустила Kimi K2 — першу модель лінійки з 1 трлн параметрів, яка швидко стала однією з провідних відкритих систем для агентних задач.

NVDA1,01%
Переглянути оригінал
Ця сторінка може містити контент третіх осіб, який надається виключно в інформаційних цілях (не в якості запевнень/гарантій) і не повинен розглядатися як схвалення його поглядів компанією Gate, а також як фінансова або професійна консультація. Див. Застереження для отримання детальної інформації.
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Прокоментувати
Додати коментар
Додати коментар
Немає коментарів
  • Закріплено