コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: マルチモーダルAI

8月 26 2026
0

行動アノマリー検索を3段階で解決するActPair:ペア比較リランキングの実装ポイント

投稿者: ユウ

TL;DR ActPairは、テキストベースの人物異常行動検索を3段階…

8月 26 2026
0

VLMの安全性を「理由」まで検証するEviSafe:最終応答だけでは見えない欠陥

投稿者: ユウ

TL;DR EviSafeは、VLMの安全性を「最終的な応答」だけでな…

8月 26 2026
0

音楽推薦の新手法:マルチモーダル検索とLLM再ランキングの実践

投稿者: ユウ

TL;DR 本論文は、音楽推薦の会話システムにおいて、7つの埋め込み空…

8月 25 2026
0

ロボット動作の意図を蒸留するINDI:行動デコーダの性能を20ポイント向上

投稿者: ユウ

TL;DR INDIは、ロボットの行動デコーダに「意図」を蒸留する手法…

8月 25 2026
0

VLMの異常検知スコアは「答え」より「確率」で読むべき:ランク圧縮問題とその解決

投稿者: ユウ

TL;DR VLMで動画異常検知をする際、生成された回答(例:「はい」…

8月 22 2026
0

SAGAIで街路景観を自動評価:VLMによる郊外の歩行環境診断

投稿者: ユウ

TL;DR SAGAIは、Googleストリートビュー画像と視覚言語モ…

8月 21 2026
0

ロボットが「見えない物」を探してから計画するEAFG:VLMとTAMPの新フレームワーク

投稿者: ユウ

TL;DR EAFGは、ロボットが調理などの長期的タスクを実行する際、…

8月 18 2026
0

文字色が感情分析を左右する?VLMの視覚バイアスを検証

投稿者: ユウ

TL;DR 視覚言語モデル(VLM)は、画像内のテキストの色やコントラ…

8月 18 2026
0

病理画像の空間文脈を言語だけで扱うSLMP:重み更新なしで最大+19.6ポイント改善

投稿者: ユウ

TL;DR SLMPは、病理WSIをタイル分割し、各タイルのMLLMに…

8月 17 2026
0

VLM強化学習を高速化するRollplex:GPU空間共有で推論と学習を同時実行

投稿者: ユウ

TL;DR Rollplexは、VLMのRL後訓練において、従来は直列…

投稿のページ送り

1 2 … 7 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio