torygreen

vip
Antigüedad 3años
Nivel máximo 0
Aún no hay contenido
La velocidad de inferencia está empezando a importar para los agentes de una forma mucho más amplia que simplemente hacer que las respuestas parezcan más rápidas.
El nuevo CS-4 de Cerebras afirma ofrecer una inferencia hasta 30 veces más rápida que los sistemas de GPU, con más de 4.400 tok/s en GPT-OSS-120B.
Para los agentes, esa velocidad se convierte en presupuesto adicional de razonamiento.
En la misma ventana de 30 segundos, un sistema más rápido puede explorar más rutas, reintentar fallos, realizar más verificaciones o usar un modelo más grande sin hacer esperar más al usuario.
Por eso, l
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Llega un punto en el que las empresas de IA verticales dejan de parecer clientes de API y empiezan a parecer empresas de modelos.
Harvey pasó de aproximadamente 1 billón -> 14,5 billones de tokens al mes en seis meses. Ahora está realizando el postentrenamiento de su propio modelo jurídico sobre Kimi K3, utilizando tareas específicas del sector, comentarios de expertos y datos propios de sus flujos de trabajo.
Thomson Reuters avanza en la misma dirección con su propio modelo jurídico.
Parece una evolución bastante natural.
Con un volumen bajo, las API de modelos punteros son la opción obvia. C
KIMI-1,16%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
La programación quizá solo haya sido el primer mercado de agentes, no el más grande.
Desde febrero, los usuarios activos semanales de Codex crecieron :
> 108x en el ámbito jurídico,
> 41x en ventas,
> 41x en contratación
> 26x en marketing.
El área de ingeniería solo creció 5x.
Y para junio, el uso de agentes ya representaba el 64 % de los tokens de salida combinados de Codex + ChatGPT entre los clientes empresariales.
Probablemente el software era el lugar más fácil para empezar porque el trabajo está estructurado, requiere muchas herramientas y es relativamente fácil de verificar.
Ahora que
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Los LLM tenían internet esperándolos. La IA incorporada no.
Los robots necesitan enormes cantidades de datos de interacción del mundo real, y ACE Robotics estima que todo el sector solo cuenta hoy con unas 100 mil horas útiles.
China ya está intentando fabricar ese conjunto de datos: los centros de entrenamiento compran robots, los operan a distancia mientras realizan tareas reales, recopilan las trayectorias y luego devuelven esos datos a los fabricantes de robots.
Por eso, algunos de los primeros despliegues de humanoides están haciendo más que probar hardware. Están generando los datos de e
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Es bastante increíble lo rápido que se está acumulando la capacidad sin que el presupuesto de hardware aumente casi al mismo ritmo.
> Qwen3.5-27B obtuvo una puntuación de 35 en Artificial Analysis en febrero.
> Qwen3.6-27B la elevó a 38 en abril.
> Qwen3.8-27B está ahora en 52, manteniéndose dentro de prácticamente el mismo límite de 27B de parámetros.
Y su rendimiento agéntico se sitúa ahora al nivel de modelos que son mucho más grandes y bastante más caros de servir.
Para mí, eso parece más importante que otra reorganización de la tabla de clasificación.
Durante años, una IA mejor significab
Ver original
post-image
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
La interconexión de IA empieza a parecer su propio miniciclo de capex.
@Cisco cerró el ejercicio fiscal 2026 con pedidos de infraestructura de IA de 9300 millones de dólares por parte de los hyperscalers y prevé que los ingresos por infraestructura de IA pasen de ~$4B a 7500 millones de dólares el próximo año. Arista acaba de crecer un 37,7 % interanual hasta los 3040 millones de dólares
Creo que el cambio interesante está en hacia dónde empieza a dirigirse el dólar marginal de la IA.
La primera fase del despliegue estuvo dominada por poner en funcionamiento tantos aceleradores como fuera pos
CSCO-0,73%
Ver original
  • Recompensa
  • Comentar
  • 1
  • Compartir
Hace unos años, los hiperescaladores representaban alrededor del 16% del gasto de capital del S&P 500. El próximo año, cinco de ellos podrían gastar tanto como las otras 495 empresas combinadas.
Microsoft, Amazon, Alphabet, Meta, Oracle
BofA estima ahora aproximadamente 1,07 billones de dólares para las cinco en 2027, frente a unos 1,06 billones de dólares para todas las demás empresas del índice.
Esa concentración empieza a importar mucho más allá de las GPU.
La IA ha alcanzado tal magnitud que la demanda de capacidad de cómputo está empezando a arrastrar consigo a la economía física. Goldman
MSFT0,82%
AMZN1,31%
META1,68%
ORCL-2,75%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
El tráfico agéntico en la web está creciendo lo bastante rápido como para que Cloudflare haya creado un navegador específicamente para agentes de IA (Kitesurf).
Los agentes básicamente están heredando unos 30 años de decisiones de diseño de navegadores hechas para humanos frente a pantallas, y gran parte de eso se convierte en sobrecarga innecesaria cuando ejecutas miles de sesiones a la vez.
El tráfico web impulsado por IA casi se triplicó durante 2025, mientras que el tráfico de agentes de IA y navegadores agénticos creció un 7.851% interanual.
Con las estimaciones actuales, los agentes gene
NET-4,33%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Es una locura que la creciente escasez de memoria ya esté empezando a rediseñar el panorama de las GPU antes incluso de que se lancen.
@nvidia está probando ahora opciones de HBM con menos capas para Rubin Ultra. El diseño original de HBM4e de 12-Hi, que podría alcanzar 14–16 Gbps, mientras que la nueva alternativa optimizada de HBM4 podría situarse en 11–12.
El atractivo es el volumen. Menos capas de DRAM por acelerador permiten que la misma oferta de obleas se distribuya entre más GPU.
Pero el modelo no se reduce porque lo haya hecho la pila de memoria. Cuando tiene que repartirse entre más
NVDA-2,92%
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Los compromisos de infraestructura de IA de las grandes tecnológicas se extienden mucho más allá de las cifras de gasto de capital que solemos ver. Han comprometido aproximadamente 1,09 billones de dólares en futuros pagos de arrendamiento, principalmente para centros de datos de IA.
Actualmente, solo unos 285 mil millones de dólares aparecen como pasivos por arrendamiento, porque muchos contratos no se reconocen hasta que las instalaciones comienzan a operar.
El riesgo real es el desajuste en la duración. Algunos arrendamientos se extienden entre 15 y 30 años, mientras que los chips, los mode
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
La demanda energética de los centros de datos está creciendo tan rápido que las redes no pueden seguir el ritmo, y las empresas ahora transportan turbinas de gas en camiones para sortearlo.
APR Energy acaba de desplegar ocho unidades móviles, 1,1 GW, destinadas directamente a la demanda de los centros de datos.
Piénsalo. Una turbina sobre un remolque es peor opción que una conexión a la red en todos los sentidos salvo en uno: puedes tenerla funcionando en meses en lugar de años. Pagar esa prima solo tiene sentido si la espera es lo que te está perjudicando, y ahora mismo la espera supera los 5
APR7,57%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Ejecutar DeepSeek V4 Flash 0731 en tu propio hardware ya es real, pero lo que cuesta y si vale la pena depende mucho de quién eres.
las máquinas que realmente lo ejecutan:
> 256GB M3 Ultra Mac Studio (~7-9 mil USD): guarda la compilación en 4 bits con margen, caja única y limpia.
> 512GB M3 Ultra (~10 mil USD+ si puedes conseguir uno): ejecuta cómodamente la versión casi sin pérdidas.
> 2x H200 o 4x A100 en servidor: checkpoint completo con 1M de contexto, pero ahora ya estás rozando dinero de centro de datos.
técnicamente también corre en 128GB, pero solo con una compresión pesada de 3 bits q
DEEPSEEK-3,44%
Ver original
post-image
  • Recompensa
  • 1
  • Republicar
  • Compartir
GateUser-3e640a4c:
¿Ese es el “DeepSeek” de fabricación nacional?
Proveedor de chips. Prestamista de infraestructura. Inversor de equity en sus propios clientes. Nvidia es ahora las tres cosas a la vez, y este mes la factura de llevar los tres sombreros llegó a $750B
> $250B , respaldando el arrendamiento de Ohio de OpenAI.
> $500B entrelazado con SK Group en memoria.
> $5B entrando en SSI, una empresa sin producto.
> $1B entrando en Naver. Una participación en Nebius. Chips fluyendo hacia instalaciones en Texas que les arrienda de vuelta a sí misma.
El bucle que Nvidia esencialmente ha creado es financiar al cliente -> el cliente compra chips de Nvidia -
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Así que ya hemos superado ~$1T en capex de centros de datos globales, encaminándonos hacia 1,7 billones de dólares para 2030. Desde $455B en 2024.
Eso es casi 4 veces en seis años. Los cuatro hiperescaladores de EE. UU. se duplican aproximadamente en ese tramo. El resto: neoclouds, laboratorios de IA, proyectos soberanos… es lo que realmente curva la tendencia, creciendo alrededor de 39% al año en promedio. Para 2030, Amazon, Google, Meta y Microsoft son solo cerca de la mitad.
Hace dos años, la expansión era básicamente de cuatro empresas. Ahora es todo un campo de ellas, y el dinero nu
AMZN1,31%
META1,68%
MSFT0,82%
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
2026 no es el año en el que los laboratorios cerrados planearon cerrar, y el espacio donde un modelo de frontera cerrada puede cobrar dinero ahora es de aproximadamente tres puntos de ancho después de K3 desde @Kimi_Moonshot
K3 acaba de aterrizar limpiamente por encima de Opus 4,8 en capacidad, a la mitad del precio por tarea, con los pesos haciéndose públicos en cuestión de días. Solo Fable 5 y GPT-5.6 Sol siguen por encima de eso. Todo lo que queda por debajo de esa línea ahora es territorio abierto: modelos que cualquiera puede servir a coste de hardware, sin margen de I+D que recuperar.
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
  • Fijado