ME News ニュース、4月18日(UTC+8)、Moonshot AI チームは最近、Prefill(事前入力)とDecode(デコード)のデカップリング技術が単一クラスターからデータセンター間および異種ハードウェア環境へと成功裏に拡張されたことを発表しました。記事の見解によると、この動きは各トークンの推論コストを大幅に削減することが期待されています。以前は、この技術の拡張はKVキャッシュの伝送コストの問題により妨げられていました。今回の突破は、ハイブリッドモデルKimi Linearに依存した重要な成果です。(出典:InFoQ)
Moonshot AI は Prefill/Decode のデカップリング技術を、データセンター間および異種ハードウェアに拡張しました
ME News ニュース、4月18日(UTC+8)、Moonshot AI チームは最近、Prefill(事前入力)とDecode(デコード)のデカップリング技術が単一クラスターからデータセンター間および異種ハードウェア環境へと成功裏に拡張されたことを発表しました。記事の見解によると、この動きは各トークンの推論コストを大幅に削減することが期待されています。以前は、この技術の拡張はKVキャッシュの伝送コストの問題により妨げられていました。今回の突破は、ハイブリッドモデルKimi Linearに依存した重要な成果です。(出典:InFoQ)