BLIP-2を徹底解説 — 凍結した画像エンコーダとLLMをQ-Formerで橋渡しする【ICML 2023】 2026年6月27日 機械学習 GPT-4Vのような「画像を見て言葉で答えるAI」を作りたいとします。素直に考え... BLIP-2LLMQ-Formerゼロショットマルチモーダル視覚言語モデル