コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: Vision-Language Model

8月 25 2026
0

VLMの異常検知スコアは「答え」より「確率」で読むべき:ランク圧縮問題とその解決

投稿者: ユウ

TL;DR VLMで動画異常検知をする際、生成された回答(例:「はい」…

8月 18 2026
0

文字色が感情分析を左右する?VLMの視覚バイアスを検証

投稿者: ユウ

TL;DR 視覚言語モデル(VLM)は、画像内のテキストの色やコントラ…

8月 13 2026
0

VLMの空間推論を壊さず強化する「多視点関係蒸留」とは?

投稿者: ユウ

TL;DR Vision-Language Model (VLM) の…

8月 11 2026
0

時系列データを画像化してLLM推論のエネルギーを最大18倍削減する手法

投稿者: ユウ

TL;DR LLM推論のエネルギーは入力トークン数に比例します。数値時…

7月 30 2026
0

論文図の品質を4軸でスコアリング:SciFigAlignによるマルチモーダル評価手法

投稿者: ユウ

TL;DR SciFigAlignは、論文の図を「明瞭さ」「関連性」「…

7月 30 2026
0

セパレータトークンで視覚トークンを刈り込み、MLLMを高速化するSepPrune

投稿者: ユウ

TL;DR SepPruneは、MLLMの入力シーケンス内にある「モダ…

7月 28 2026
0

一枚画像から物体の質量や密度を推定するSiPhyの仕組み

投稿者: ユウ

TL;DR SiPhyは、単一のRGB画像と深度情報から物体の質量・密…

7月 23 2026
0

画像と質問の順序で精度が変わるVLMの弱点をテスト時間学習で修復

投稿者: ユウ

TL;DR Vision-Language Modelは画像→質問の順…

7月 16 2026
0

VLMのCoT推論は画像を最後まで見直していない:Visual Access Boundaryの発見

投稿者: ユウ

TL;DR Vision-Language Model (VLM) の…

7月 13 2026
0

敵対的攻撃に強いVLMを実現:テスト時プロンプト適応フレームワークRITA

投稿者: ユウ

TL;DR RITAは、CLIPなどのVision-Language …

投稿のページ送り

1 2 3 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio