Multi-Query / Grouped-Query Attention(MQA/GQA)— KVキャッシュを削ってLLM推論を軽くする 2026年7月2日 Transformer 長い文章をLLMに書かせていると、最初の応答が出るまでは待たされるのに、そこから... GQAKVキャッシュLLMMQATransformer推論高速化深層学習