カテゴリ
マルチモーダルの記事一覧
3件の記事があります。
マルチモーダル
MuRAGとは?画像とテキストを一緒に検索して答えるマルチモーダルRAG
MuRAGは、画像とテキストの両方を外部メモリとして検索し、回答生成に使うマルチモーダルRAGです。仕組み、既存RAGとの違い、評価結果、実務での使い道を日本語で整理します。
参照論文:MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text
マルチモーダル
LLaVAとは?画像を見て会話できるマルチモーダルAIの仕組みと実務での使い道
LLaVAは、CLIPの画像理解とLLMの対話能力をつなぎ、画像を見ながら自然言語で応答できるようにしたマルチモーダル技術です。Visual Instruction Tuningの考え方、2段階学習、評価結果、開発への応用ポイントを日本語で解説します。
参照論文:Visual Instruction Tuning
マルチモーダル
BLIP-2とは?少ない学習コストで画像理解をLLMにつなぐQ-Formerの仕組みと使い道
BLIP-2は、凍結した画像エンコーダと大規模言語モデルをQ-Formerで接続し、少ない学習コストで高性能なマルチモーダル処理を実現する技術です。なぜ画像とLLMの接続が難しいのか、BLIP-2がどう解くのか、開発でどこに応用できるのかを解説します。
参照論文:BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models