Multi-Query / Grouped-Query Attention(MQA/GQA)— KVキャッシュを削ってLLM推論を軽くする 2026年7月2日 Transformer 長い文章をLLMに書かせていると、最初の応答が出るまでは待たされるのに、そこから... GQAKVキャッシュLLMMQATransformer推論高速化深層学習
KVキャッシュの仕組み — LLM推論を高速化する基本技術 2026年6月28日 Transformer ChatGPTやClaudeでテキストを生成するとき、最初の1文字が表示されるま... KVキャッシュLLMTransformer推論高速化深層学習
投機的デコーディングの数理と実装 2026年6月7日 Transformer 投機的デコーディング(Speculative Decoding)は、小さなドラフ... LLMSpeculative Decoding投機的デコーディング推論高速化深層学習
LLMの量子化(INT8/INT4)を理論から実装まで解説 2026年6月7日 Transformer 量子化(Quantization)は、ニューラルネットワークの重みや活性化を低精... INT4INT8LLM推論高速化深層学習量子化
Speculative Decoding(投機的デコーディング)— 小さなモデルでLLM推論を高速化する 2026年6月7日 Transformer ChatGPTやClaudeのような大規模言語モデル(LLM)を使っていると、「... LLMSpeculative DecodingTransformer推論高速化深層学習