torygreen

vip
Idade 3Ano
Nível máximo 0
Ainda sem conteúdo
A velocidade de inferência está a começar a ser importante para os agentes de uma forma muito mais significativa do que simplesmente tornar as respostas mais rápidas.
O novo CS-4 da Cerebras promete uma inferência até 30 vezes mais rápida do que os sistemas com GPU, com mais de 4 400 tok/s no GPT-OSS-120B.
Para os agentes, essa velocidade transforma-se em orçamento adicional para raciocínio.
Na mesma janela de 30 segundos, um sistema mais rápido pode explorar mais caminhos, repetir tentativas após falhas, executar mais verificações ou utilizar um modelo maior sem obrigar o utilizador a esperar
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Há um ponto em que as empresas de IA vertical deixam de parecer clientes de API e começam a parecer empresas de modelos.
A Harvey passou de cerca de 1T -> 14,5T tokens/mês em seis meses. Agora está a fazer o pós-treino do seu próprio modelo jurídico com base no Kimi K3, utilizando tarefas específicas do domínio, feedback de especialistas e dados proprietários dos fluxos de trabalho.
A Thomson Reuters está a avançar na mesma direção com o seu próprio modelo jurídico.
Isto parece uma evolução bastante natural.
Com baixo volume, as APIs de fronteira são a escolha óbvia. Com mais de 10T tokens/mês
KIMI-1,16%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
A programação pode ter sido apenas o primeiro mercado de agentes, não o maior.
Desde fevereiro, o número semanal de utilizadores ativos do Codex cresceu:
> 108x no setor jurídico,
> 41x nas vendas,
> 41x no recrutamento
> 26x no marketing.
A engenharia cresceu apenas 5x.
E, em junho, a utilização de agentes já representava 64% do total combinado de tokens de saída do Codex + ChatGPT entre os clientes empresariais.
O software foi provavelmente o ponto de partida mais fácil, porque o trabalho é estruturado, exige muitas ferramentas e é relativamente fácil de verificar.
Agora que os agentes estão
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Os LLM tinham a Internet à sua espera. A IA incorporada não.
Os robôs precisam de enormes quantidades de dados de interação no mundo real, e a ACE Robotics estima que todo o setor dispõe atualmente de apenas ~100K horas úteis.
A China já está a tentar criar esse conjunto de dados: os centros de formação compram robôs, controlam-nos remotamente durante tarefas reais, recolhem as trajetórias e depois devolvem esses dados aos fabricantes de robôs.
Por isso, algumas das primeiras implementações de humanoides estão a fazer mais do que testar hardware. Estão a gerar os dados de formação de que a pró
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
É mesmo impressionante a rapidez com que as capacidades estão a aumentar, sem que o orçamento para hardware acompanhe na mesma medida.
> O Qwen3.5-27B obteve 35 na Artificial Analysis em fevereiro.
> O Qwen3.6-27B elevou esse valor para 38 em abril.
> O Qwen3.8-27B está agora nos 52, mantendo-se praticamente dentro do mesmo limite de 27B parâmetros.
E o seu desempenho como agente está agora ao nível de modelos muito maiores e bastante mais dispendiosos de servir.
Isso parece-me mais importante do que mais uma reviravolta nas tabelas de classificação.
Durante anos, uma IA melhor significava sob
Ver original
post-image
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
As redes de IA estão a começar a parecer o seu próprio mini ciclo de capex.
@Cisco encerrou o exercício fiscal de 2026 com $9.3B em encomendas de infraestruturas de IA de hiperescaladores e prevê receitas de infraestruturas de IA de ~$4B para $7.5B no próximo ano. A Arista acabou de crescer 37.7% YoY, para $3.04B
Penso que a mudança interessante está no destino que o dólar marginal de IA começa a ter.
A primeira fase da expansão foi dominada pela colocação online do maior número possível de aceleradores. Assim que os clusters atingem uma dimensão suficiente, manter essas GPUs abastecidas com
CSCO-0,73%
Ver original
  • Recompensa
  • Comentar
  • 1
  • Partilhar
Há alguns anos, os hyperscalers representavam cerca de 16% das despesas de capital do S&P 500. No próximo ano, cinco deles poderão gastar tanto como as outras 495 empresas combinadas.
Microsoft, Amazon, Alphabet, Meta, Oracle
A BofA estima agora cerca de 1,07 biliões de dólares para as cinco em 2027, contra aproximadamente 1,06 biliões de dólares para todas as restantes empresas do índice.
Essa concentração começa a ter impacto muito para além das GPUs.
A IA tornou-se tão grande que a procura por capacidade computacional começa a arrastar consigo a economia física. A Goldman estima que já repr
MSFT0,82%
AMZN1,31%
META1,68%
ORCL-2,75%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
O tráfego agêntico na web está a crescer suficientemente depressa para que a Cloudflare tenha criado um navegador especificamente para agentes de IA (Kitesurf).
Os agentes estão, basicamente, a herdar cerca de 30 anos de decisões de design dos navegadores feitas para humanos que olham para ecrãs, e grande parte disso torna-se sobrecarga desnecessária quando se executam milhares de sessões em simultâneo.
O tráfego web impulsionado por IA quase triplicou ao longo de 2025, enquanto o tráfego proveniente de agentes de IA e navegadores agênticos cresceu 7,851% YoY.
Segundo as estimativas atuais, os
NET-4,33%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
É incrível que a crescente escassez de memória esteja agora a começar a redesenhar o panorama das GPU antes de sequer chegarem ao mercado.
@nvidia está agora a testar opções HBM de menor altura para a Rubin Ultra. O design original de HBM4e 12-Hi, que poderia atingir 14–16 Gbps, enquanto a nova opção otimizada de HBM4 poderá ficar-se pelos 11–12.
A vantagem está no volume. Menos camadas DRAM por acelerador permitem que o mesmo fornecimento de wafers seja distribuído por mais GPU.
Mas o modelo não fica mais pequeno só porque a pilha de memória ficou. Quando tem de ser distribuído por mais acele
NVDA-2,92%
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Os compromissos da Big Tech relativos à infraestrutura de IA vão muito além dos valores de capex que normalmente vemos. Estas empresas comprometeram cerca de 1,09 biliões de dólares em futuros pagamentos de locação, sobretudo para centros de dados de IA.
Atualmente, apenas cerca de 285 mil milhões de dólares surgem como passivos de locação, uma vez que muitos contratos não são reconhecidos até as instalações entrarem em funcionamento.
O verdadeiro risco está no desfasamento entre as durações. Alguns contratos de locação prolongam-se por 15 a 30 anos, enquanto os chips, os modelos e a procura d
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
A procura de energia dos centros de dados está a crescer tão rapidamente que as redes elétricas não conseguem acompanhar, e as empresas estão agora a transportar turbinas a gás para contornar o problema.
A APR Energy acaba de disponibilizar oito unidades móveis, com 1,1GW, direcionadas diretamente para a procura dos centros de dados.
Pense no que isto significa. Uma turbina num reboque é pior do que uma ligação à rede em todos os aspetos, exceto num: pode estar a funcionar em meses, em vez de anos. Pagar esse prémio só faz sentido se a espera for aquilo que o está a impedir — e, neste mome
APR7,57%
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Executar o DeepSeek V4 Flash 0731 no seu próprio hardware já é real, mas o que custa e se vale a pena depende muito de quem você é.
as máquinas que realmente o fazem correr:
> 256GB M3 Ultra Mac Studio (~$7-9k): guarda a versão em 4-bit com margem, caixa única e limpa.
> 512GB M3 Ultra (~$10k+, se conseguir encontrar um): corre a versão quase sem perdas com conforto.
> 2x H200 ou 4x A100 server: checkpoint completo com 1M de contexto, mas agora já está a entrar em valores de datacenter.
ele também corre tecnicamente num 128GB, mas apenas com uma compressão pesada em 3-bit que prejudi
DEEPSEEK-3,44%
Ver original
post-image
  • Recompensa
  • 1
  • Republicar
  • Partilhar
GateUser-3e640a4c:
É o DeepSeek daquelas empresas nacionais?
Fornecedor de chips. Credor de infraestruturas. Investidor de capital nos seus próprios clientes. A Nvidia é agora os três ao mesmo tempo, e este mês a conta por envergar as três “tetas” atingiu $750B
> $250B , apoiando as obrigações do arrendamento da OpenAI no Ohio.
> $500B ligada com o SK Group na memória.
> $5B no SSI, uma empresa sem produto.
> $1B na Naver. Uma participação na Nebius. Chips a escoar para instalações no Texas que ela própria arrenda de volta.
O ciclo que a Nvidia criou, de forma quase essencial, é financiar o cliente -> o cliente compra chips da Nvidia -> a Nvidia reco
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Portanto, já ultrapassámos ~$1T em capex de data centers a nível global, e estamos a caminho de $1.7T até 2030. Acima de $455B em 2024.
Quase 4x em seis anos. Os quatro hyperscalers dos EUA aumentam aproximadamente o dobro nesse período. Toda a gente que vem a seguir — neoclouds, laboratórios de IA, projectos soberanos — é o que, na prática, faz a curva “dobrar”, crescendo a uma média de cerca de 39% ao ano. Até 2030, Amazon, Google, Meta e Microsoft são apenas cerca de metade disso.
Há dois anos, a expansão era basicamente de quatro empresas. Agora é um campo inteiro delas, e o novo din
AMZN1,31%
META1,68%
MSFT0,82%
Ver original
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
2026 não é o ano em que os laboratórios fechados planeavam encerrar, e o espaço onde um modelo de fronteira fechado consegue cobrar dinheiro é agora cerca de três pontos de largura após o K3 de @Kimi_Moonshot.
O K3 acabou de aterrar de forma limpa acima do Opus 4.8 em capacidade, a metade do preço por tarefa, com os pesos a tornarem-se públicos em dias. Apenas o Fable 5 e o GPT-5.6 Sol ainda ficam acima dele. Tudo o que está abaixo dessa linha é agora território aberto, modelos que qualquer pessoa pode servir ao custo do hardware, sem margem de R&D para recuperar.
Essa é a nova matemática
Ver original
post-image
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
  • Fixado