A Zhipu reduziu em 80% os custos de inferência de tokens desde o início de 2026, utilizando 100 mil chips nacionais.
Segundo a Zhipu, a empresa conseguiu realizar inferência de baixo custo em escala com 100 000 chips domésticos, reduzindo os custos de inferência por token em 80% desde o início de 2026. O modelo GLM-5.3-Flash processou anteriormente 6,2 biliões de tokens durante os testes beta, sob o pseudónimo Ox-Alpha, na OpenRouter e na OpenCode. Após o seu lançamento oficial, todo o tráfego em linha continua a ser processado pela frota de 100 000 chips domésticos, validando a capacidade da infraestrutura pa
GateNews·08-31 11:37
