コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: マルチモーダルAI

8月 06 2026
0

MRI診断AIは順序やラベル順で診断が変わる?VLMの頑健性を検証

投稿者: ユウ

TL;DR 脳MRIの鑑別診断(GBM vs MET)において、画像ス…

8月 06 2026
0

VLM報酬モデルを構造で安定化するSAFT:オンライン自己教師あり微調整の実装解説

投稿者: ユウ

TL;DR SAFTは、VLMを報酬モデルとして使う際に、環境が持つ構…

8月 05 2026
0

リモートセンシング画像の一括アノテーションを効率化するUniEvo-RSの提案

投稿者: ユウ

TL;DR UniEvo-RSは、テキストと画像の両方のプロンプトを統…

8月 04 2026
0

QRコード型の熱パターンでIR-VLMを攻撃する新手法

投稿者: ユウ

TL;DR IR-VLM(赤外線視覚言語モデル)は、熱画像を言語で解釈…

8月 03 2026
0

MoRoute:動的レイヤールーティングで実現する統一マルチモーダル動画生成

投稿者: ユウ

TL;DR MoRouteは、凍結したVLM(Qwen3.5-9B)と…

8月 01 2026
0

災害画像100万枚にキャプション付与、LLM判定で品質検証する新手法

投稿者: ユウ

TL;DR 災害対応用の画像データセットIncidents1Mは画像の…

7月 31 2026
0

LLMが画像を見ずに特徴量プログラムを生成するScaFE:医療画像分類の新手法

投稿者: ユウ

TL;DR ScaFEは、LLMが臨床知識をPythonの特徴量抽出プ…

7月 30 2026
0

論文図の品質を4軸でスコアリング:SciFigAlignによるマルチモーダル評価手法

投稿者: ユウ

TL;DR SciFigAlignは、論文の図を「明瞭さ」「関連性」「…

7月 30 2026
0

ByDeWay-V2:訓練不要で空間推論を強化、説明可能なマルチモーダルLLM

投稿者: ユウ

TL;DR ByDeWay-V2は、MLLMの空間推論と幻覚低減を訓練…

7月 30 2026
0

セパレータトークンで視覚トークンを刈り込み、MLLMを高速化するSepPrune

投稿者: ユウ

TL;DR SepPruneは、MLLMの入力シーケンス内にある「モダ…

投稿のページ送り

前へ 1 2 3 4 … 7 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio