フォロー

なんか KV Cache の正解がよく分かんないな。TurboQuant って圧縮に凄く時間がかかる気がするんですよ。だから LLM が体感遅くなる。

---

Google Research、LLMのKVキャッシュを6倍圧縮する「TurboQuant」発表 最大8倍高速化・精度低下なし | Ledge.ai -
ledge.ai/articles/google_resea

ただメモリがパンクしてクラッシュするという事故は確実に減る。でも遅すぎて Timeout に引っかかりがち。あっちを立てればこっちが立たず。

ログインして会話に参加
:realtek:

思考の /dev/null