AMD MI355X atteint l'inférence GLM 5.2 pour moitié moins cher que le NVIDIA B200
Selon Wafer, une startup spécialisée dans l'optimisation d'inférence, les puces AMD MI355X exécutant le dernier modèle open-source GLM 5.2 ont atteint des coûts d'inférence environ deux fois moins élevés que ceux du GPU phare NVIDIA B200, tout en offrant environ 80 % des performances. Les tests ont montré un débit agrégé mono-nœud de 2 626 tokens par seconde, avec un débit mono-flux atteignant 213 tokens par seconde. L'optimisation a utilisé des techniques logicielles incluant la quantification
GateNews·07-06 20:46
