Kimi K3: ¿Los chips más baratos son los que más escasean? Aumenta la eficiencia y se dispara la demanda de hardware

Kimi K3 的降价 no reduciría la demanda de chips; al contrario, podría impulsar un mayor consumo total de hardware.
(Antecedente: ¿umbral de hardware para ejecutar Kimi K3 localmente? Partida desde 64 GPU, 45kW de consumo eléctrico; los jugadores que montan su propia configuración quedan fuera)
(Información de contexto: ¡El tamaño del mercado asciende a 10 mil millones de dólares! Se rumorea que Anthropic planea alquilar recursos de cómputo a Meta para mitigar la crisis de escasez de GPU)

Tabla de contenido

Toggle

  • Debut de Kimi K3: eficiencia disparada que revierte hacia una mayor demanda de hardware
  • La paradoja de Jensen: el precio bajo enciende un mayor consumo de tokens
  • KV Cache en alza: el contexto largo exprime la memoria
  • Competencia que se enfría: gigantes de IA de EE. UU. siguen aumentando apuestas
  • Compra en código abierto: datos de OpenRouter muestran crecimiento
  • Conclusión: Kimi K3 como catalizador de hardware

Kimi K3 vuelve a situar a los inversionistas de IA ante un problema central: si los modelos son más baratos y eficientes, ¿significa que caerán la demanda de chips y de memoria? Tanto Citi como Bank of America Securities tienen respuestas más bien negativas: el aumento de eficiencia podría liberar más uso y, con ello, elevar el consumo total de recursos.

Según ### TradeFollow (la plataforma de seguimiento de operaciones en tiempo real), Kimi K3, lanzado por el Dark Side of the Moon, cuenta con 2,8 billones de parámetros y está orientado a una ventana de contexto de 1 millón de tokens y a tareas de agentes de ciclo largo. El analista de semiconductores de Citi, Peter Lee, cree que, incluso si Kimi K3 se usa ampliamente, seguirá aumentando la demanda general de memoria, como DDR5 y eSSD, en servidores.

El analista de semiconductores de Bank of America Securities, Vivek Arya, también señaló en un estudio del 17 de julio que es más probable que los laboratorios de IA de vanguardia en EE. UU. incrementen su inversión en cómputo, en lugar de reducirla. Si los modelos de código abierto de China continúan acercándose, OpenAI, Anthropic y Google —líderes del sector— tendrán que sostener la diferenciación con escalas de entrenamiento mayores, más inferencia y ciclos de iteración de producto más rápidos.

Esto implica que la lógica de fijación de precios de Kimi K3 no puede juzgarse solo por la caída del costo de inferencia por ejecución. Lo más importante es si un modelo de bajo precio genera más llamadas, cadenas de tareas más largas y más generación de tokens. Si la respuesta es sí, GPU, HBM, DDR5, eSSD, redes de alta velocidad y sistemas de inferencia podrían seguir beneficiándose.

Debut de Kimi K3: la eficiencia que dispara la demanda de hardware

Citi ve Kimi K3 como un posible caso de la “paradoja de Jensen” en la cadena industrial de IA. El núcleo de esa paradoja es que, cuando la eficiencia técnica reduce el costo por unidad de uso, la utilización podría aumentar de forma considerable; al final, el consumo total de recursos no bajaría, sino que incluso podría subir.

El atractivo de Kimi K3 proviene de la combinación entre bajo costo y alto rendimiento. Los precios publicados muestran que la tarifa de entrada con aciertos de caché es de 0,3 dólares por cada millón de tokens, y la de salida es de 15 dólares por cada millón de tokens. Su plan completo de pesos se divulgará el 27 de julio; su objetivo es respaldar el trabajo de agentes de ciclo largo.

El criterio de Citi es que la bajada de precios del modelo no reduce automáticamente la demanda de hardware. Por el contrario, un costo más bajo podría aumentar la disposición de desarrolladores y empresas para llamar al modelo, impulsando el despliegue de más agentes de IA. Las tareas de los agentes no son solo una ronda de preguntas y respuestas: son la generación continua dentro de tareas encadenadas, con lectura y procesamiento de tokens. A medida que suben el número de llamadas y la longitud de las tareas, la caída del costo unitario se vuelve a convertir en mayor consumo total de recursos.

Por lo tanto, el impacto de Kimi K3 en la cadena de semiconductores no se centra en “si la llamada única es más barata”, sino en “si el volumen total de tokens se expande”. Esa es la razón por la que Citi considera favorable la demanda de DDR5 y eSSD en servidores.

La paradoja de Jensen: el precio bajo enciende un mayor consumo de tokens

Kimi K3 utiliza tres tecnologías clave: Kimi Delta Attention, Attention Residuals y Stable LatentMoE. Kimi Delta Attention se usa para reducir el costo en la ventana de contexto de 1 millón de tokens; Attention Residuals sirve para seleccionar de manera selectiva representaciones entre diferentes profundidades del modelo; y Stable LatentMoE mejora el grado de dispersión (sparsity), de modo que cada token solo activa 16 de 896 expertos.

La información técnica del Dark Side of the Moon afirma que esta arquitectura hace que la eficiencia de escalamiento de Kimi K3 alcance 2,5 veces la de K2. Alta dispersión y capacidad de contexto largo constituyen la base importante para reducir el costo de ejecución.

Pero Citi subraya que esto no significa que desaparezca la presión de recursos en el extremo de inferencia. Kimi K3 aún no es una solución de despliegue “liviana”: su ejecución requiere clústeres de varios nodos, con configuraciones de nodos que superan 64 GPU. Más aún, el contexto largo y las tareas de agentes elevan el uso de KV Cache, lo que incrementa la carga de memoria en inferencia.

La demanda de KV Cache está directamente relacionada con DDR5 y eSSD en servidores. DDR5 asume el acceso de datos de alta frecuencia, mientras que eSSD se beneficia de mayores requisitos de caché y almacenamiento de datos. Para los fabricantes de memoria, la variable clave no es si un solo modelo ahorra cómputo, sino cuántas veces se llama al modelo después de la bajada de precios, cuántos tokens genera por llamada y qué tan larga se vuelve la cadena de tareas del agente.

KV Cache en alza: el contexto largo exprime la memoria

Las conclusiones de Bank of America Securities coinciden con Citi, aunque con un enfoque más inclinado hacia GPU e infraestructura de IA. Vivek Arya opina que los modelos de código abierto más fuertes de China quizá no lleven a los gigantes de IA de EE. UU. a recortar su inversión de cómputo. Al contrario, cuando se acorta la brecha, aumenta el costo de que los líderes mantengan su ventaja.

Bank of America Securities afirma que, si los modelos de código abierto continúan acercándose, OpenAI, Anthropic y Google tendrán que apoyarse en un entrenamiento de mayor escala, más ciclos de aprendizaje por refuerzo y datos sintéticos, una inferencia en pruebas más pesada y un ritmo más rápido de publicación de productos para sostener la diferenciación.

Esta lógica no depende de qué modelo lidere a corto plazo. El ranking de modelos grandes podría rotar con rapidez, pero lo que realmente compran las empresas es una salida de IA estable, con baja latencia y alta disponibilidad, además de un costo menor de “producción efectiva por unidad”. Cuando las capacidades de los modelos se vuelven más parecidas, la presión competitiva se trasladará a la infraestructura subyacente, incluidas GPU, HBM, redes de alta velocidad y sistemas de inferencia.

Por ello, Bank of America Securities considera que la aparición de modelos como Kimi K3 no debería entenderse de forma simple como “más eficiente implica menos chips”. El camino más realista es que la competencia de modelos se intensifique y que los líderes, para mantener la distancia, sigan aumentando su inversión en cómputo.

Competencia que se enfría: gigantes de IA de EE. UU. siguen aumentando apuestas

Como Kimi K3 emplea una arquitectura MoE, significa que la cantidad total de parámetros y los parámetros que realmente se activan en cada inferencia pueden separarse. Este cambio reduce parte de la presión de cómputo, pero también hace que el cuello de botella de infraestructura pase de ser solo potencia de cálculo a ser acceso a memoria de video, enrutamiento de expertos, latencia de respuesta y capacidad de interconexión.

Bank of America Securities enfatiza que la inferencia MoE exige un sistema que transporte datos con mayor eficiencia, programe módulos de expertos y se conecte a clústeres de cómputo más grandes. Nvidia plantea que la inferencia MoE moderna necesita un dominio de GPU mayor. Sus cálculos muestran que, en términos de eficiencia por vatio en modelos abiertos líderes, GB300 NVL72 puede llegar hasta 25 veces la plataforma Hopper.

CoreWeave, en pruebas alrededor de Kimi K2.6, también muestra que incluso los modelos MoE de código abierto que activan solo una parte de los parámetros en cada ejecución, si quieren mantener la ventaja en velocidad y valor-precio, aún necesitan la infraestructura optimizada de Nvidia GB300/GB200 NVL72.

Esto significa que los pesos del modelo podrían irse convirtiendo gradualmente en un producto básico, pero las GPU necesarias para ejecutar el modelo, la memoria de alto ancho de banda, la interconexión de red y los sistemas de inferencia no perderían valor. Al contrario, a medida que crezca el volumen de llamadas al modelo, estos componentes podrían convertirse en el foco de competencia más concentrado.

Compra en código abierto: datos de OpenRouter muestran crecimiento

Bank of America Securities también cita datos de OpenRouter y afirma que el volumen de llamadas a modelos sigue aumentando con rapidez. Como una plataforma de API de terceros que conecta a múltiples laboratorios de modelos, el uso de tokens en OpenRouter continúa creciendo; y en el caso de los modelos de laboratorios de IA de China, el uso de tokens ya supera al de los laboratorios no chinos.

Estos datos no representan directamente todos los escenarios para empresas y consumidores, pero al menos indican que las elecciones de los desarrolladores dentro del ecosistema de modelos abiertos están cambiando. Cuando bajan los precios de los modelos y mejora la capacidad, es posible que el volumen de llamadas siga expandiéndose, en lugar de que la mejora de eficiencia de un único modelo sea suficiente para compensar ese efecto.

El uso pago por parte de empresas también va en aumento. Los datos de Ramp muestran que, a junio de 2026, cerca del 55% de las empresas estadounidenses ya tiene suscripción paga a modelos de IA, plataformas o herramientas; cifra superior al 21% estimado por la encuesta BTOS de la Oficina del Censo de EE. UU. Según el tipo de modelo, la tasa de adopción empresarial para Anthropic es 42,4% y para OpenAI es 39,5%.

Conclusión: Kimi K3 como catalizador de hardware

Sin embargo, el gasto en IA sigue muy concentrado. El 1% superior de usuarios empresariales destina en promedio unos 4833 dólares al mes en IA por empleado; el 10% superior, 516 dólares; y la mediana general es de solo 11 dólares. La tasa de suscripción en la industria de tecnología y medios alcanza 79,8%; la tasa de adopción en grandes empresas es 65,5%, superior al 61,3% de empresas medianas y al 48,7% de empresas pequeñas.

Estos datos respaldan una lectura: el uso de IA todavía está en proceso de difusión. Si los modelos de bajo precio reducen la barrera de entrada, es posible que la demanda incremental futura provenga de más empresas, más desarrolladores y más aplicaciones de agentes.

La conclusión conjunta de Citi y Bank of America Securities es que el significado de Kimi K3 no radica en si un único modelo reduce el costo unitario de inferencia, sino en si un costo menor libera una mayor escala de carga de trabajo.

Para Citi, la dirección de beneficio más directa es DDR5 en servidores y eSSD. El contexto largo, KV Cache y las tareas de agentes incrementan los requisitos de acceso a memoria y almacenamiento. Para Bank of America Securities, lo más relevante es GPU, HBM, redes de alta velocidad y sistemas de inferencia, porque la competencia entre modelos obliga a los líderes a seguir invirtiendo en infraestructura.

Bank of America Securities también menciona que lo de “45 nanómetros de EDA de código abierto” relacionado con Kimi K3 no debería interpretarse de forma simplista como que el EDA comercial queda sustituido. Por el contrario, esto muestra que el diseño de chips todavía no puede prescindir de herramientas EDA. En procesos avanzados, los proveedores comerciales de EDA como Cadence y Synopsys siguen en una posición clave.

El riesgo es otro escenario: si la compresión del modelo, la optimización de inferencia y las mejoras de eficiencia del hardware avanzan a largo plazo más rápido que la incorporación de nuevas cargas de trabajo, la expansión de la infraestructura de IA podría enfriarse por fases. Pero dentro del marco de estas dos firmas de inversión, Kimi K3 se parece más a un catalizador que impulsa el uso que a una señal de debilitamiento de la demanda de chips. Después de mejoras de eficiencia, el mercado debería enfocarse en más tokens, más inferencia y más consumo de hardware subyacente.

META-0,02%
C-0,46%
CRWV-0,23%
RAMP-0,52%
SNPS-1,54%
Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado