Kimi K3 Чим дешевший чип, тим його більше бракує? Ефективність різко зростає, попит на апаратне забезпечення стрімко зростає

Kimi K3 зниження ціни не зменшить попит на чипи, а навпаки може підвищити загальне споживання апаратного забезпечення.
(Попередній контекст: місцевий запуск Kimi K3 Апартний поріг? старт від 64 карт GPU, 45kW електроенергії, гравці, що збирають самі, вибувають)
(Додатковий фон: за обсягом угод — 10 мільярдів доларів! Кажуть, що Anthropic має намір орендувати обчислювальні ресурси у Meta, щоб пом’якшити кризу дефіциту GPU)

Зміст статті

Увімкнути

  • Поява Kimi K3: ефективність різко зростає та віддзеркалює потребу в обладнанні
  • Парадокс Джевонса: низька ціна запускає більше споживання token
  • Зростання KV Cache: довгі контексти «вичавлюють» пам’ять
  • Конкуренція різко охолоджується: американські AI-гіганти продовжують нарощувати інвестиції
  • Відкритий код «скуповує»: дані OpenRouter показують зростання
  • Висновок: Kimi K3 — апаратний каталізатор

Kimi K3 повертає AI-інвесторів до ключового питання: якщо модель дешевша й ефективніша, чи означає це зниження попиту на чипи та пам’ять? Відповіді Citi та Bank of America Securities схиляються до заперечення — зростання ефективності, імовірно, вивільнить більше використання, а отже підвищить загальне споживання ресурсів.

За даними Tailing the Trend Trading (майданчика для трейдингу «за кимось»), Kimi K3, випущений компанією «Місяця темна сторона», має 2,8 трлн параметрів-записів і орієнтований на контекстне вікно 1 млн token та завдання довгострокових розумних агентів. Аналітик Citi по напівпровідниках Peter Lee вважає, що навіть якщо Kimi K3 буде широко використовуватися, загальні потреби в пам’яті загального призначення на кшталт серверної DDR5 та eSSD все одно зростатимуть.

У своєму дослідженні від 17 липня аналітик Bank of America Securities по напівпровідниках Vivek Arya також заявив, що американські передові AI-лабораторії, скоріше, збільшуватимуть витрати на обчислювальні потужності, а не зменшуватимуть. Якщо китайські open-source моделі й надалі наближатимуться, таким лідерам, як OpenAI, Anthropic та Google, доведеться використовувати більші масштаби навчання, більше контурів reinforcement learning і синтетичних даних, важчі тести-виводи під час інференсу та швидші ітерації продуктів, щоб зберегти диференціацію.

Це означає, що цінова логіка Kimi K3 не може спиратися лише на зниження вартості разового інференсу. Найважливіше — чи призведе дешевша модель до більшої кількості викликів, довших ланцюжків завдань і більшого генерування token. Якщо відповідь «так», то GPU, HBM, DDR5, eSSD, високошвидкісні мережі та інференсні системи також і надалі можуть отримувати вигоду.

Поява Kimi K3: ефективність різко зростає та віддзеркалює потребу в обладнанні

Citi розглядає Kimi K3 як потенційний кейс «парадоксу Джевонса» в AI-індустрійному ланцюжку. Суть цього парадоксу в тому, що після зростання технічної ефективності та зниження питомої вартості використання обсяг застосування може зрости в рази, а в підсумку загальне споживання ресурсів не знизиться, а навпаки зросте.

Привабливість Kimi K3 — у поєднанні низької вартості та високої продуктивності. З опублікованих цін видно: ціна за кешований вхід становить 0.3 долара за мільйон token, а ціна за вихід — 15 доларів за мільйон token. Повний план вагових коефіцієнтів (weights) буде розкрито 27 липня; мета — підтримка робіт довготривалих розумних агентів.

Оцінка Citi полягає в тому, що здешевлення моделі не автоматично зменшує потребу в апаратному забезпеченні. Навпаки, низька собівартість може підвищити бажання розробників і підприємств викликати модель, стимулюючи розгортання більшої кількості AI-агентів. Завдання агентів — це не одноразові питання-відповіді, а безперервне генерування упродовж послідовних завдань: читання й обробка token. Зі зростанням кількості викликів і довжини завдань падіння питомої вартості буде знову конвертоване в загальне споживання ресурсів.

Отже, вплив Kimi K3 на напівпровідниковий ланцюжок полягає не в тому, «чи дешевший разовий виклик», а в тому, «чи збільшиться загальний обсяг token». Саме тому Citi бачить попит на серверні DDR5 та eSSD.

Парадокс Джевонса: низька ціна запускає більше споживання token

Kimi K3 використовує три ключові технології: Kimi Delta Attention, Attention Residuals і Stable LatentMoE. Kimi Delta Attention застосовується для зниження вартості контекстного вікна 1 млн token; Attention Residuals — для вибіркового пошуку представлень між різними глибинами моделі; Stable LatentMoE — для підвищення міри розрідження (sparsity), де кожен token активує лише 16 експертів із 896.

Технічні матеріали компанії «Місяця темна сторона» стверджують, що ця архітектура дає Kimi K3 ефективність масштабування у 2.5 рази більшу, ніж у K2. Висока розрідженість і можливості довгого контексту є важливою основою для зниження витрат на виконання.

Але Citi підкреслює: це не означає, що тиск ресурсів на стороні інференсу зникає. Kimi K3 усе ще не є рішенням для легкої (легковагової) інсталяції; для виконання потрібен кластер багатьох вузлів, а конфігурація супер-вузла перевищує 64 GPU. Більш того, довгі контексти та завдання агентів підвищують зайнятість KV Cache, збільшуючи навантаження на пам’ять на стороні інференсу.

Потреба у KV Cache напряму пов’язана із серверною DDR5 та eSSD. DDR5 бере на себе високочастотний доступ до даних, тоді як eSSD виграє від більшого кешу та потреб у зберіганні даних. Для виробників пам’яті ключовою змінною є не те, чи економить один-єдиний конкретний модельний проєкт обчислювальні ресурси, а те, скільки разів модель викликають після зниження ціни, скільки token генерує кожен виклик і як довго розтягується ланцюжок завдань агента.

Зростання KV Cache: довгі контексти «вичавлюють» пам’ять

Висновок Bank of America Securities перегукується з Citi, але фокус більш зміщений на GPU та AI-інфраструктуру. Vivek Arya вважає, що більш потужні китайські open-source моделі не обов’язково змусять американських AI-гігантів скорочувати інвестиції в обчислювальну потужність. Навпаки, звуження розриву моделей підвищить вартість для лідерів, аби зберегти перевагу.

Bank of America Securities заявляє: якщо open-source моделі й надалі наближатимуться, то OpenAI, Anthropic і Google мають покладатися на навчання у ще більших масштабах, більше циклів reinforcement learning і синтетичних даних, важчий інференс під час тестування та швидший темп релізів продуктів, щоб втримати диференціацію.

Ця логіка не залежить від того, яка саме модель короткостроково лідирує. Рейтинги великих моделей можуть швидко змінюватися, але компанії реально купують стабільний, низьколатентний, високодоступний AI-вивід і нижчу вартість «за одиницю ефективної продуктивності». Коли можливості моделей збігаються, конкурентний тиск переходить у базову інфраструктуру, включно з GPU, HBM, високошвидкісними мережами та інференсними системами.

Тому Bank of America Securities вважає, що поява Kimi K3 та подібних моделей не варто просто трактувати як «моделі ефективніші — чипів потрібно менше». Набагато реалістичніший шлях такий: конкуренція моделей посилюється, і лідери, щоб зберігати дистанцію, продовжують нарощувати обчислювальну потужність.

Конкуренція різко охолоджується: американські AI-гіганти продовжують нарощувати інвестиції

Kimi K3 використовує архітектуру MoE, що означає можливість відокремити загальну кількість параметрів від параметрів, які фактично активуються під час кожного інференсу. Ця зміна знижує частину обчислювального навантаження, але також переносить «вузьке місце» інфраструктури з простих обчислень на доступ до відеопам’яті, маршрутизацію експертів, затримку відповіді та можливості інтерконекту.

Bank of America Securities підкреслює: для MoE-інференсу система має ефективніше транспортувати дані, планувати експертні модулі та підключати більші обчислювальні кластери. Nvidia заявляє, що сучасний MoE-інференс потребує більшого домену GPU. Їхні підрахунки показують, що для GB300 NVL72 енергоефективність на кожен ват у провідних open-source моделях може досягати до 25 разів у порівнянні з платформою Hopper.

CoreWeave також наводить приклад тестів навколо Kimi K2.6: навіть якщо open-source MoE-моделі за раз активують лише частину параметрів, щоб зберегти лідерство у швидкості та ціновій ефективності, все одно потрібна оптимізована базова інфраструктура Nvidia GB300/GB200 NVL72.

Це означає, що вагові коефіцієнти (model weights) можуть поступово стати «коммодіті», але GPU, висока пропускна здатність пам’яті, мережеві інтерконекти й інференсні системи, необхідні для виконання моделей, не втратять цінності. Навпаки, зі збільшенням обсягів викликів ці елементи можуть стати місцем, де конкуренція буде концентрованішою.

Відкритий код «скуповує»: дані OpenRouter показують зростання

Bank of America Securities також посилається на дані OpenRouter: обсяг викликів моделей продовжує швидко зростати. Як третій-партійна API-платформа, що підключає кілька лабораторій моделей, OpenRouter бачить постійне збільшення використання token на платформі; і вже токен-споживання моделей китайських AI-лабораторій перевищило споживання моделей не-китайських лабораторій.

Ці дані не можуть напряму представляти всі бізнес-кейси та сценарії споживачів, але принаймні вони показують: вибір розробників у відкритій екосистемі моделей змінюється. Зниження цін на моделі та підвищення їхніх можливостей, імовірно, підтримуватимуть подальше розширення обсягів викликів, а не буде компенсовано зростанням ефективності одиночної моделі.

Також зростає платне корпоративне використання. Дані Ramp показують, що станом на 2026 рік 6 місяць близько 55% американських компаній мають платну підписку на AI-моделі на платформі або інструменти — це вище за оцінку 21% у BTOS-опитуванні Бюро перепису населення США. За моделями: рівень корпоративного впровадження Anthropic — 42.4%, OpenAI — 39.5%.

Висновок: Kimi K3 — апаратний каталізатор

Проте AI-витрати все ще дуже концентровані. Топ-1% корпоративних користувачів у середньому витрачають близько 4833 долара на місяць AI-на працівника, топ-10% — 516 доларів, тоді як загальна медіана лише 11 доларів. Частка підписок у технологічній та медіа-індустрії досягає 79.8%, впровадження великими компаніями — 65.5%, що вище за 61.3% у середніх компаній і 48.7% у малих.

Ці дані підтримують такий висновок: використання AI все ще перебуває на стадії поширення (дифузії). Якщо низькобюджетні моделі знизять бар’єр входу, то майбутні додаткові потреби можуть надходити від більшої кількості компаній, більшої кількості розробників і більшої кількості застосунків агентів.

Спільний висновок Citi та Bank of America Securities такий: значення Kimi K3 полягає не в тому, чи знижує конкретна модель питомі витрати на інференс, а в тому, чи вивільняє низька вартість можливість для більшого масштабу робочих навантажень.

Для Citi найбільш безпосередній напрям вигоди — серверна DDR5 та eSSD. Довгі контексти, KV Cache та завдання агентів підвищують потреби в доступі до пам’яті та зберіганні. Для Bank of America Securities більш значущими є GPU, HBM, високошвидкісні мережі та інференсні системи, оскільки конкуренція моделей змусить лідерів продовжувати інвестувати в інфраструктуру.

Bank of America Securities також зазначає, що «45-нанометровий open-source EDA», який стосується Kimi K3, не слід просто трактувати як заміну комерційних EDA. Натомість це показує, що дизайн чипів усе ще не може обійтися без інструментів EDA. У передових технологічних процесах комерційні EDA-вендори на кшталт Cadence та Synopsys залишаються в критично важливому положенні.

Ризик у іншому сценарії: якщо моделі стискають (компресують), то інференсна оптимізація та зростання ефективності в залізі можуть випереджати нарощування довгострокового обсягу нових робочих навантажень; тоді розширення AI-інфраструктури може періодично охолоджуватися. Але в межах рамки обох цих інвестбанків Kimi K3 радше є каталізатором зростання використання, а не сигналом, що попит на чипи зменшиться. Після зростання ефективності ринку, навпаки, потрібно зосередитися на більшій кількості token, більшій кількості інференсів і більшому споживанні базового апаратного забезпечення.

META-0,02%
C-0,46%
CRWV-0,23%
RAMP-0,52%
SNPS-1,54%
Переглянути оригінал
Ця сторінка може містити контент третіх осіб, який надається виключно в інформаційних цілях (не в якості запевнень/гарантій) і не повинен розглядатися як схвалення його поглядів компанією Gate, а також як фінансова або професійна консультація. Див. Застереження для отримання детальної інформації.
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Прокоментувати
Додати коментар
Додати коментар
Немає коментарів
  • Закріплено