QLoRAの理論と実装 — 4bit量子化+LoRAで大規模LLMを効率的にファインチューニング 2026年6月7日 Transformer 65Bパラメータのモデルを単一の48GB GPUでファインチューニングできる —... LLMLoRANF4QLoRAファインチューニング機械学習量子化