AI 量子化でLLMの推論コストが増大 — 精度維持でも費用増
量子化でコスト削減を図っても、推論型LLMでは連鎖思考のトークンが膨張して費用が増すケースがあることをarXiv論文が示しました。精度だけでなくトークン消費量を実測してコスト評価に組み込む必要があります。
AI
AI
AI
AI
AI
AI
AI
AI
AI
AI