Локально запускати Kimi K3: апаратний поріг? Від 64 GPU, споживання електроенергії 45 кВт, гравці самі збирають і йдуть з гри

Теми місяця цього тижня опублікували Kimi K3, із 2,8 трлн загальної кількості параметрів і як найбільшу в історії відкриту (open-source) вагову модель; повні ваги планують завантажити до 27 липня. Офіційна інструкція з розгортання вказує, що для власного хостингу щонайменше потрібно 64 прискорювачі, для гравців-одиночок лишаються два варіанти: родина K2 або офіційне API.
(Передісторія: Moonshot AI з «Теми місяця» ось-ось випустить Kimi K3! Має 2,8 трлн параметрів і мільйонну довжину контексту, продуктивність дуже близька до Anthropic Opus 4.8)
(Додатковий контекст: Мій комп’ютер може локально запускати моделі ШІ? CanIRun.ai допоможе швидко проаналізувати)

Зміст статті

Toggle

  • Що таке MoE?
  • Офіційний поріг: старт від 64 GPU
  • Попереднє покоління ще вміщалося в один комп’ютер

Трохи раніше цього тижня «Тема місяця» (Moonshot AI) представила Kimi K3, загальна кількість параметрів — 2,8 трлн, що робить її найбільшою у світі відкритою ваговою моделлю. Вже щоб зберегти ці 2,8 трлн параметрів на диску, за офіційним нативним 4-бітним форматом (MXFP4) потрібно 1,4TB до 1,5TB простору, і це ще не починаючи запускати інференс. Для пересічних людей поріг дуже, дуже високий.

«Тема місяця» заявляє, що повні відкриті ваги планують викласти до 27 липня, з ліцензією Modified-MIT, що дозволяє самостійне розгортання. На момент здачі матеріалу повні ваги та версії для кількісного квантування спільноти (наприклад, GGUF) ще не з’явилися.

Що таке MoE?

Kimi K3 використовує архітектуру MoE (мікротвір експертів / mix of experts). У простих словах: усередині моделі вирощено 896 «експертів» підмереж; під час обробки кожного token система відбирає лише 16 маршрутних експертів плюс обчислення спільних експертів, не рахуючи все одразу — саме тому фактично «активні» працюючі параметри становлять лише від 50 до 60 мільярдів.

Модель також застосовує нову архітектуру Kimi Delta Attention (KDA) у поєднанні з Attention Residuals; за оцінкою офіційних представників, у задачах із мільйонною довжиною контексту швидкість декодування може зростати до 6,3 разів, а вікно контексту досягає 1000000 token; також вона нативно підтримує візуальні входи.

Офіційний поріг: старт від 64 GPU

Офіційні рекомендації «Теми місяця» з розгортання вказують, що для власного запуску K3 потрібно щонайменше 64 чи більше прискорювачів. Нативні ваги MXFP4 мають обсяг близько 1,5TB — це 3,7 раза від DeepSeek-R1 671B (квантування Q4 приблизно 407GB). Чисто за підрахунком, скільки GPU потрібно, щоб просто розмістити ваги:

  • H100 (80GB): приблизно 19 штук
  • H200 (141GB): приблизно 11 штук
  • B200 (192GB): приблизно 8 штук

І це ще без урахування KV cache, тобто пам’яті, яку модель використовує, щоб запам’ятовувати контекст діалогу; офіційні потреби KV cache для контексту довжиною 1000000 token ще не оприлюднені, але їх буде більше, а не менше.

За цінами: H100 80GB — приблизно від 2,5 тис. до 3,3 тис. доларів США за одну (PCIe); версія SXM — 3,5 тис. до 4 тис. доларів США і вище; сервер із 8 картами H100 — понад 300 тис. доларів США. Якщо взяти офіційний поріг 64 карти, це 8 серверів із 8 картами: лише закупівля заліза перевищує 2,4 млн доларів США, тобто понад 70 млн нових тайванських доларів.

За енергоспоживанням: H100 — близько 700W на одну карту; 64 карти GPU — приблизно 45kW, що значно перевищує можливості електромереж звичайної домівки — це рівень енергоспоживання дата-центру.

Попереднє покоління ще можна було запустити на одному комп’ютері

Порівняно з попереднім поколінням родини K2 (1 трлн параметрів, приблизно 32 мільярди активованих параметрів), це відчувається ще сильніше. Спільнота для K2 зробила екстремальне квантування 1,8 біта — приблизно 247GB достатньо, щоб запускати напряму; одна 24GB споживча відеокарта разом із вивантаженням даних через системну пам’ять також може запрацювати. Для K2.5 потрібно понад 380GB єдиного обсягу пам’яті, а Q2-версія K2.6 потребує близько 350GB.

Попереднє покоління: один Mac Studio на 512GB ледве витягує, а K3 безпосередньо піднімає поріг до рівня дата-центру. Для пересічних роздрібних користувачів, якщо хочуть користуватися, доведеться знизити версію до родини K2 або просто викликати офіційне API.

Переглянути оригінал
Ця сторінка може містити контент третіх осіб, який надається виключно в інформаційних цілях (не в якості запевнень/гарантій) і не повинен розглядатися як схвалення його поглядів компанією Gate, а також як фінансова або професійна консультація. Див. Застереження для отримання детальної інформації.
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Прокоментувати
Додати коментар
Додати коментар
Немає коментарів
  • Закріплено