コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: VLM

8月 26 2026
0

VLMの安全性を「理由」まで検証するEviSafe:最終応答だけでは見えない欠陥

投稿者: ユウ

TL;DR EviSafeは、VLMの安全性を「最終的な応答」だけでな…

8月 25 2026
0

ロボット動作の意図を蒸留するINDI:行動デコーダの性能を20ポイント向上

投稿者: ユウ

TL;DR INDIは、ロボットの行動デコーダに「意図」を蒸留する手法…

8月 22 2026
0

SAGAIで街路景観を自動評価:VLMによる郊外の歩行環境診断

投稿者: ユウ

TL;DR SAGAIは、Googleストリートビュー画像と視覚言語モ…

8月 17 2026
0

VLM強化学習を高速化するRollplex:GPU空間共有で推論と学習を同時実行

投稿者: ユウ

TL;DR Rollplexは、VLMのRL後訓練において、従来は直列…

8月 17 2026
0

カメラ撮影文書も正確に解析するNaviDC-OCRの仕組み

投稿者: ユウ

TL;DR NaviDC-OCRは、デジタル文書とカメラ撮影文書の両方…

8月 16 2026
0

視覚言語モデルは「分からない」を内部で知っているのに答えを止められない——TRAPSBenchが示す表現ギャップ

投稿者: ユウ

TL;DR 視覚言語モデル(VLM)は、映像から答えが確定できない状況…

8月 12 2026
0

画像キャプション評価の新手法CapProbe:領域単位の高密度QAで詳細記述を検証する

投稿者: ユウ

TL;DR CapProbeは、画像キャプションの詳細な事実的正しさを…

8月 12 2026
0

実テーブル解析の盲点を可視化し、凍結パーサーを改善するDECフレームワーク

投稿者: ユウ

TL;DR 既存のテーブル解析モデルはベンチマークでは高スコアでも、実…

8月 06 2026
0

MRI診断AIは順序やラベル順で診断が変わる?VLMの頑健性を検証

投稿者: ユウ

TL;DR 脳MRIの鑑別診断(GBM vs MET)において、画像ス…

8月 06 2026
0

VLM報酬モデルを構造で安定化するSAFT:オンライン自己教師あり微調整の実装解説

投稿者: ユウ

TL;DR SAFTは、VLMを報酬モデルとして使う際に、環境が持つ構…

投稿のページ送り

1 2 3 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio