なんか KV Cache の正解がよく分かんないな。TurboQuant って圧縮に凄く時間がかかる気がするんですよ。だから LLM が体感遅くなる。
---
Google Research、LLMのKVキャッシュを6倍圧縮する「TurboQuant」発表 最大8倍高速化・精度低下なし | Ledge.ai -https://ledge.ai/articles/google_research_turboquant_kv_cache_compression_llm
ただメモリがパンクしてクラッシュするという事故は確実に減る。でも遅すぎて Timeout に引っかかりがち。あっちを立てればこっちが立たず。
思考の /dev/null