Did Codex Reset
GitHub

#llm-inference

すべてのAIニュースを見る

DeepLearning.AI、The Batch で DeepSeek のキャッシュ削減と Flash のベンチマーク結果を詳述

DeepLearning.AI は The Batch の最新号で DeepSeek のアーキテクチャを分析し、トークンあたりのキャッシュが 890 バイトと DeepSeek-V1 より 437 倍削減されたと報告した。また、入力が 4K から 1M トークンに拡大すると出力トークンあたりの計算量が 25% 増加する点や、AA Index で Flash が V4-Pro を上回った点も指摘している。