Kimi K3: чем дешевле чип, тем он дефицитнее? Спрос на оборудование резко растёт на фоне взрывного роста эффективности

Kimi K3 降价 не снижает спроса на чипы — напротив, может подстегнуть общий расход аппаратных ресурсов.
(Предыстория: аппаратный порог для Kimi K3? старт от 64 GPU, потребление 45 кВт, игрокам приходится собирать свою инфраструктуру)
(Дополнение по фону: объем сделок, похоже, достигает 10 миллиардов долларов! Сообщается, что Anthropic намерена арендовать вычислительные мощности у Meta, чтобы смягчить кризис дефицита GPU)

Оглавление

Toggle

  • Kimi K3 выходит на сцену: рост эффективности возвращает спрос на железо
  • Парадокс Дженсена: низкая цена запускает больше расхода токенов
  • KV Cache растет: длинные контексты выжимают память
  • Конкуренция дает отбой: американские ИИ-гиганты продолжают наращивать
  • Open source — активная закупка: данные OpenRouter указывают на рост
  • Итог: Kimi K3 становится аппаратным катализатором

Kimi K3 снова выводит инвесторов в ИИ к ключевому вопросу: если модель дешевле и эффективнее, означает ли это снижение потребности в чипах и памяти? Ответы Citigroup и Bank of America Securities скорее отрицательные: рост эффективности может высвободить больше трафика и, в итоге, повысить общий расход ресурсов.

По данным трейдинговой платформы «追风交易臺», Kimi K3, выпущенный «Лунной тьмой», имеет 2,8 триллиона параметров и рассчитан на контекстное окно в 1 миллион token, а также задачи для долгосрочных интеллектуальных агентов. Аналитик по полупроводникам Citigroup Peter Lee считает, что даже при широком использовании Kimi K3 спрос на универсальную память для серверов — DDR5 и eSSD — будет расти.

Аналитик по полупроводникам Bank of America Securities Vivek Arya в исследовании от 17 июля тоже отметил: американские передовые ИИ-лаборатории скорее увеличат вложения в вычислительные мощности, а не сократят. Если китайские открытые модели продолжат приближаться, OpenAI, Anthropic и Google — лидерам рынка — придется наращивать объемы обучения, активнее усиливать этапы рассуждений и ускорять итерации продукта, чтобы сохранять дифференциацию.

Это означает, что логика ценообразования Kimi K3 не может сводиться только к снижению стоимости единичного вывода. Ключевое — приводит ли удешевление моделей к большему числу вызовов, более длинным цепочкам задач и большему генерированию token. Если ответ «да», то продолжат выигрывать GPU, HBM, DDR5, eSSD, высокоскоростные сети и инфраструктура вывода.

Kimi K3 выходит на сцену: рост эффективности возвращает спрос на железо

Citigroup рассматривает Kimi K3 как потенциальный кейс «парадокса Дженсена» в цепочке ИИ-индустрии. Суть этого парадокса: после снижения единичной стоимости за счет технологической эффективности объем использования может вырасти многократно, и в итоге общий расход ресурсов не уменьшится, а увеличится.

Привлекательность Kimi K3 — в связке низкой стоимости и высокой производительности. По публичным ценам: стоимость входа при попадании в кеш составляет 0,3 доллара за 1 миллион token, стоимость выхода — 15 долларов за 1 миллион token. Полный план по весам будет раскрыт 27 июля; цель — поддержка работы долгосрочных интеллектуальных агентов.

Оценка Citigroup такова: снижение цены модели само по себе не означает уменьшение спроса на железо. Напротив, низкая стоимость может увеличить готовность разработчиков и компаний вызывать модель, стимулируя большее развертывание ИИ-агентов. Задачи умных агентов — это не разовый диалог, а постоянная генерация в рамках непрерывных задач, с чтением и обработкой token. Рост числа вызовов и длины задач заново конвертирует снижение единичной стоимости в общий расход ресурсов.

Поэтому влияние Kimi K3 на полупроводниковую цепочку заключается не в том, «дешевле ли становится один вызов», а в том, «увеличивается ли общий объем token». Это и есть причина, по которой Citigroup позитивно смотрит на спрос на серверные DDR5 и eSSD.

Парадокс Дженсена: низкая цена запускает больше расхода токенов

Kimi K3 использует три ключевые технологии: Kimi Delta Attention, Attention Residuals и Stable LatentMoE. Kimi Delta Attention снижает стоимость контекстного окна в 1 миллион token, Attention Residuals позволяет выборочно извлекать представления между разными глубинами модели, а Stable LatentMoE повышает степень разреженности: на каждый token задействуются 16 из 896 экспертов.

Технические данные «Лунной тьмы» утверждают, что эта архитектура обеспечивает эффективность масштабирования Kimi K3 на уровне 2,5 раза относительно K2. Высокая разреженность и способность работать с длинным контекстом — важная основа для снижения издержек выполнения.

Но Citigroup подчеркивает: это не означает, что на inference-стороне снимается нагрузка на ресурсы. Kimi K3 не является решением легкого развертывания; для исполнения нужен кластер с несколькими узлами, а конфигурация «суперузла» включает более 64 GPU. Существенно и то, что длинные контексты и агентные задачи увеличивают занятость KV Cache, повышая нагрузку на память на стороне вывода.

Потребность в KV Cache напрямую связана с спросом на серверную DDR5 и eSSD. DDR5 отвечает за высокочастотный доступ к данным, eSSD выигрывает от более больших требований к кешу и хранению данных. Для производителей памяти ключевая переменная — не то, экономит ли отдельная модель вычисления, а сколько раз после удешевления модель будет вызываться, сколько token будет генерироваться за каждый вызов и насколько длинной становится цепочка задач агентных сценариев.

KV Cache растет: длинные контексты выжимают память

Вывод Bank of America Securities перекликается с оценкой Citigroup, но фокусируется больше на GPU и базовой инфраструктуре ИИ. Vivek Arya считает, что более сильные китайские открытые модели не обязательно заставят американских ИИ-гигантов урезать инвестиции в вычислительные мощности. Напротив, сокращение разрыва увеличивает стоимость для лидеров сохранять преимущество.

Bank of America Securities отмечает: если открытые модели продолжат приближаться, OpenAI, Anthropic и Google будут вынуждены опираться на более масштабное обучение, больше циклов reinforcement learning и синтетических данных, более тяжелый тестовый inference и более быстрый темп выпуска продуктов, чтобы удерживать дифференциацию.

Эта логика не зависит от того, какая модель краткосрочно впереди. Рейтинг больших моделей может быстро меняться, но компании реально покупают стабильные, с низкой задержкой и высокой доступностью ИИ-результаты, а также более низкую стоимость «за единицу эффективной полезности». Когда способности моделей сближаются, конкуренция начинает «передаваться» на нижний уровень инфраструктуры — включая GPU, HBM, высокоскоростные сети и системы вывода.

Поэтому Bank of America Securities считает, что появление моделей вроде Kimi K3 не стоит упрощенно понимать как «модели эффективнее, чипов нужно меньше». Более реалистичный путь таков: конкуренция за модели усиливается, и лидеры, чтобы держать дистанцию, продолжают наращивать вычислительные мощности.

Конкуренция дает отбой: американские ИИ-гиганты продолжают наращивать

Kimi K3 использует MoE-архитектуру, что означает, что общее количество параметров и фактически задействованные параметры за один inference могут быть разделены. Это снижает часть вычислительной нагрузки, но одновременно переносит «узкое горлышко» инфраструктуры с чистой мощности на доступ к видеопамяти, маршрутизацию экспертов, задержки ответа и возможности по interconnect.

Bank of America Securities подчеркивает: для MoE-inference системе нужно эффективнее «перетаскивать» данные, планировать экспертные модули и подключать более крупные вычислительные кластеры. NVIDIA считает, что современному MoE-inference нужны более крупные GPU-ресурсы. Расчеты показывают: GB300 NVL72 по эффективности на ватт на ведущих открытых моделях может достигать до 25 раз относительно платформы Hopper.

CoreWeave на тестах вокруг Kimi K2.6 тоже показала: даже если открытая MoE-модель задействует лишь часть параметров за раз, чтобы удерживать лидерство по скорости и соотношению цена/качество, все равно требуется оптимизированная инфраструктура NVIDIA GB300/GB200 NVL72.

Это означает: веса модели могут постепенно «товаризироваться», но ценность GPU, high-bandwidth памяти, сетевых interconnect и систем inference, необходимых для выполнения моделей, не исчезнет. Наоборот, по мере расширения объема вызовов эти элементы могут стать местом более концентрированной конкуренции.

Open source — активная закупка: данные OpenRouter указывают на рост

Bank of America Securities также приводит данные OpenRouter, показывающие, что объем вызовов моделей продолжает быстро расти. Как третья-party API-платформа, подключающая множество моделей различных лабораторий, OpenRouter демонстрирует устойчивый рост token usage; при этом токен-потребление моделей китайских ИИ-лабораторий уже превысило потребление моделей не из Китая.

Эти данные не могут напрямую отражать все корпоративные и потребительские сценарии, но как минимум показывают, что выбор разработчиков в экосистеме открытых моделей меняется. Падение цен на модели и рост их возможностей могут поддерживать дальнейшее расширение объемов вызовов, а не быть «перебитыми» одной лишь эффективностью отдельной модели.

Также растет платное корпоративное использование. Данные Ramp показывают: по состоянию на июнь 2026 года около 55% американских компаний имеют платные подписки на AI-модели, платформы или инструменты, что выше оценки в 21% по опросу BTOS от Бюро переписи населения США. По моделям: корпоративное внедрение у Anthropic — 42,4%, у OpenAI — 39,5%.

Итог: Kimi K3 становится аппаратным катализатором

Однако расходы на ИИ по-прежнему сильно сконцентрированы. Топ-1% корпоративных пользователей тратят в среднем около 4 833 доллара AI-расходов на сотрудника в месяц, топ-10% — 516 долларов, а общий медианный показатель — всего 11 долларов. В индустрии технологий и медиа доля подписок достигает 79,8%, крупные компании — 65,5%, что выше, чем у средних (61,3%) и малых (48,7%) компаний.

Эта серия данных поддерживает вывод: использование ИИ все еще находится в фазе распространения. Если низкая цена снижает барьеры входа, будущий прирост спроса может прийти от большего числа компаний, большего числа разработчиков и большего числа применений ИИ-агентов.

Общий вывод Citigroup и Bank of America Securities таков: значение Kimi K3 не в том, снизилась ли стоимость единичного inference для одной модели, а в том, что низкая стоимость способна высвободить более масштабные рабочие нагрузки.

Для Citigroup самое прямое направление бенефициаров — серверные DDR5 и eSSD. Длинные контексты, KV Cache и агентные задачи увеличивают требования к обращению к памяти и ее хранению. Для Bank of America Securities более важны GPU, HBM, высокоскоростные сети и системы inference: конкуренция моделей заставит лидеров продолжать вкладываться в инфраструктуру.

Bank of America Securities также отмечает, что упоминание по Kimi K3 «45-нанометрового open source EDA» не следует упрощенно трактовать как замену коммерческих EDA. Напротив, это указывает, что дизайн чипов все еще не обходится без EDA-инструментов. На продвинутых техпроцессах коммерческие EDA-вендоры вроде Cadence и Synopsys по-прежнему занимают ключевые позиции.

Риск заключается в другом сценарии: если модели сжимаются, а оптимизация inference и рост эффективности железа будут опережать расширение новых рабочих нагрузок, то рост инфраструктуры ИИ может временами замедляться. Но в рамках текущих двух инвестбанков Kimi K3 больше похож на катализатор, который подталкивает рост использования, а не на сигнал, что спрос на чипы ослабевает. После повышения эффективности рынок должен фокусироваться уже на другом: на большем числе token, большем количестве inference и большем расходе базового «железа».

META-0,37%
C3,16%
CRWV8,95%
RAMP0,38%
SNPS2,76%
Посмотреть Оригинал
На этой странице может содержаться сторонний контент, который предоставляется исключительно в информационных целях (не в качестве заявлений/гарантий) и не должен рассматриваться как поддержка взглядов компании Gate или как финансовый или профессиональный совет. Подробности смотрите в разделе «Отказ от ответственности» .
  • Награда
  • комментарий
  • Репост
  • Поделиться
комментарий
Добавить комментарий
Добавить комментарий
Нет комментариев
  • Закреплено