torygreen

vip
Idade 3.1Ano
Nível máximo 0
Ainda não há conteúdo
A Xiaomi acabou de publicar algo que os laboratórios normalmente mantêm escondido: a fatura real de RL.
MiMo-V2.6 Pro e Flash foram treinados com 753 mil amostras e pararam na etapa 30.
> O Pro custou US$ 2,62 milhões.
> O Flash custou US$ 854 mil.
Esse gasto extra de 3,1x rendeu 6,89 pontos no DeepSWE.
Então o Flash ainda superou o Pro no AutomationBench.
Já é possível ver o mesmo formato de produto surgindo em todo lugar: um modelo para as tarefas absolutamente mais difíceis e outro logo abaixo dele, barato o suficiente para operar o dia inteiro.
ZAI, Deepseek, Qwen e Xiaomi agora têm isso e
DEEPSEEK-1,58%
  • 6
  • 1
As horas de GPU podem estar se tornando algo que você protege.
A CFTC já está explorando derivativos de computação, e a Liquid Compute acaba de captar $15M para construir um mercado regulado de futuros, opções + swaps de GPU.
Faz sentido se a computação para IA realmente crescer de ~$360B em 2025 para ~US$ 2,3 trilhões até 2030.
A parte estranha é a padronização.
Uma hora de H100 em uma região não é o mesmo produto que uma hora de B200 em outro lugar, com redes, custos de energia e tamanhos de cluster diferentes.
Então, antes que a computação tenha um mercado de futuros de verdade, alguém pr
post-image
H100+0,23%
B200+3,80%
.@OpenAI gastou US$ 6,5 bilhões construindo a equipe de dispositivos e agora pode estar gastando outros US$ 300 milhões+ na parte que decide o que o modelo poderá ver em primeiro lugar (imagens da Glass).
A Glass trabalha abaixo do app de câmera, diretamente com dados brutos do sensor. Seu sistema móvel proposto usa um sensor ~2x maior que os maiores sensores de smartphones atuais e afirma capturar até 10x mais luz.
Para um assistente sempre ativo, isso importa muito.
Tudo o que o sensor não captura se perde. O modelo precisa contornar isso depois, o que significa mais incerteza, mais computaç
post-image
A contagem de consultas está prestes a se tornar um indicador bastante ruim da demanda por IA.
Ao longo de 8 semanas, um usuário do Claude Code digitou 1.138 prompts. Isso se transformou em cerca de 14 mil chamadas ao modelo e 3,2 bilhões de tokens processados. O uso estimado de energia ficou em cerca de 150 Wh por prompt digitado, aproximadamente 625 vezes o de um prompt de texto mediano do Gemini.
A maior parte do processamento acontece depois que o usuário para de digitar. O agente relê o contexto, chama ferramentas, tenta novamente, cria ramificações e continua trabalhando em segundo plano
post-image
O mercado já está contornando a diferença nos benchmarks.
7 dos 10 principais modelos da OpenRouter em volume semanal de tokens são chineses, representando cerca de 75% do uso entre os 10 primeiros.
Os laboratórios dos EUA ainda têm vantagem na vanguarda, mas a maioria das cargas de trabalho não precisa do melhor modelo absoluto. Elas precisam de algo bom o suficiente, barato o suficiente e fácil de colocar em produção.
Os laboratórios chineses parecem estar acertando nessa parte e melhorando a cada lançamento. Mantenha-se próximo da vanguarda, reduza os custos, facilite a implantação, e o uso
Há 2 anos, o Google processava 9,7 trilhões de tokens de IA por mês.
Hoje, está acima de 3,2 quatrilhões. Isso representa um aumento de 330 vezes.
Não existe uma contagem global confiável, então o número do Google pode ser mais bem tratado como um piso divulgado.
Mesmo que o crescimento desacelere para 2 vezes ao ano, o Google sozinho chegaria a 51 quatrilhões de tokens por mês até 2030.
E essa carga de trabalho será muito diferente de alguém abrindo um chatbot hoje. Agentes de longa duração manterão o contexto, dividirão tarefas em subtarefas, chamarão outros modelos, tentarão novamente em ca
post-image
GOOGL+0,47%
Um contrato da Anthropic está trazendo US$ 3,5 bilhões em financiamento e toda uma expansão de GPUs para o presente.
A Nscale teria assinado um acordo de aproximadamente $45B com a Anthropic, busca US$ 3,5 bilhões antes de um IPO e mostrou aos investidores $103B em receita projetada de arrendamentos assinados. A Nvidia pode fornecer $2B da captação.
O compromisso da Anthropic dá aos credores algo concreto para financiar, e o capital da Nvidia ajuda a antecipar suas próprias vendas de GPUs. A Nscale transforma ambos em capacidade antes que a maior parte da receita chegue.
É nessa defasagem d
NVDA+1,23%
  • 3
Os data centers estão se tornando um importante mercado de crédito.
A JLL espera que as originações de dívida permanente na América do Norte saltem de $80B em 2025 para $175B neste ano e, depois, para $322B até 2028. Isso representa aproximadamente $722B ao longo dos três anos projetados.
Mas o custo desse capital já está dividindo o mercado. Construções respaldadas por hyperscalers podem chegar a cerca de 85% de loan-to-cost, com spreads na faixa baixa de 200 pontos-base, enquanto projetos ligados a laboratórios de IA e neoclouds podem ser precificados com spreads 200–300 pontos-base maio
post-image
JLL-0,13%
30x mais trabalho de agentes com o mesmo megawatt.
É isso que @nvidia afirma que o Vera Rubin NVL72 entregou em comparação com o GB300 NVL72 no DeepSeek V4 Pro, com um custo por milhão de tokens até 35x menor.
A carga de trabalho é o que torna isso mais do que um benchmark normal de throughput. O AgentX mantém intactas as partes mais problemáticas do uso real de agentes: contexto crescente, chamadas repetidas a ferramentas e subagentes que se ramificam no meio da tarefa.
Se esses números iniciais forem confirmados pela análise da SemiAnalysis, a implicação para a infraestrutura é bastante sign
post-image
NVDA+1,23%
DEEPSEEK-1,58%
  • 1
A memória está se tornando uma parte muito maior do problema de escalabilidade da IA.
A J.P. Morgan estima que os preços de DRAM podem subir mais de 400% do início de 2024 até o fim de 2026, enquanto a SK hynix espera que a escassez persista até 2030.
Essa pressão já está moldando os dois lados da pilha. Os modelos estão apostando mais em MoE, quantização e eficiência do cache KV, enquanto o Rubin, da Nvidia, amplia para 288 GB de HBM4 e 22 TB/s de largura de banda por GPU.
Passamos anos tratando FLOPs como a principal variável de escalabilidade. Para agentes de contexto longo e cargas de trab
SK Hynix+0,59%
SKHY+2,61%
SKHYV-0,98%
NVDA+1,23%
A pesquisa mais recente da McKinsey, State of AI, traz uma estatística que deveria deixar muitas empresas de SaaS desconfortáveis:
32% das empresas afirmam que já deixaram de comprar pelo menos um produto ou recurso de software porque agentes de programação poderiam desenvolvê-lo internamente.
Isso não significa que as empresas vão parar de comprar software. Significa que a camada de “recursos” fica muito mais difícil de monetizar.
Se uma equipe interna consegue recriar um fluxo de trabalho específico em um ou dois dias, os fornecedores precisam justificar o modelo de assinatura com algo que o
post-image
A velocidade de inferência está começando a importar muito mais para os agentes do que apenas fazer as respostas parecerem mais rápidas.
O novo CS-4 da Cerebras promete inferência até 30x mais rápida que os sistemas com GPU, com mais de 4.400 tok/s no GPT-OSS-120B.
Para os agentes, essa velocidade se transforma em orçamento adicional de raciocínio.
Na mesma janela de 30 segundos, um sistema mais rápido pode explorar mais caminhos, tentar novamente operações que falharam, executar mais verificações ou usar um modelo maior sem fazer o usuário esperar mais.
Assim, tokens/segundo está gradualmente
Chega um ponto em que as empresas de IA vertical deixam de parecer clientes de API e começam a parecer empresas de modelos.
A Harvey passou de aproximadamente 1 trilhão -> 14,5 trilhões de tokens/mês em seis meses. Agora, está fazendo o pós-treinamento de seu próprio modelo jurídico sobre o Kimi K3, usando tarefas específicas do domínio, feedback de especialistas e dados proprietários de fluxo de trabalho.
A Thomson Reuters está seguindo na mesma direção com seu próprio modelo jurídico.
Isso parece uma evolução bastante natural.
Em baixo volume, as APIs de modelos de fronteira são a escolha ób
post-image
KIMI+1,69%
A programação pode ter sido apenas o primeiro mercado de agentes, não o maior.
Desde fevereiro, os usuários ativos semanais do Codex cresceram:
> 108x no setor jurídico,
> 41x em vendas,
> 41x em recrutamento
> 26x em marketing.
A engenharia cresceu apenas 5x.
E, em junho, o uso de agentes já respondia por 64% dos tokens de saída combinados do Codex + ChatGPT entre clientes corporativos.
O software provavelmente foi o lugar mais fácil para começar porque o trabalho é estruturado, exige muitas ferramentas e é relativamente fácil de verificar.
Agora que os agentes estão melhorando na navegação p
Os LLMs tinham a internet esperando por eles. A IA incorporada, não.
Os robôs precisam de enormes quantidades de dados de interação no mundo real, e a ACE Robotics estima que todo o setor tenha hoje apenas ~100 mil horas úteis.
A China já está tentando fabricar esse conjunto de dados: centros de treinamento compram robôs, operam-nos remotamente em tarefas reais, coletam as trajetórias e depois devolvem esses dados aos fabricantes de robôs.
Por isso, algumas das primeiras implantações de humanoides estão fazendo mais do que testar hardware. Elas estão gerando os dados de treinamento de que a pr
post-image
É insano como a capacidade está se acumulando tão rápido sem que o orçamento de hardware aumente quase na mesma proporção.
> O Qwen3.5-27B marcou 35 na Artificial Analysis em fevereiro.
> O Qwen3.6-27B elevou isso para 38 em abril.
> O Qwen3.8-27B agora está em 52, mantendo-se basicamente no mesmo patamar de 27 bilhões de parâmetros.
E seu desempenho agentivo agora está próximo ao de modelos dramaticamente maiores e muito mais caros de operar.
Isso me parece mais importante do que outra reformulação do ranking.
Durante anos, uma IA melhor significava principalmente escalar o hardware por baixo