コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: マルチモーダルAI

7月 24 2026
0

構造化音声キャプション評価フレームワーク:LLM判定と数値指標の統合

投稿者: ユウ

TL;DR 本論文は、構造化された音声キャプション(タグ、説明文、数値…

7月 24 2026
0

音声とテキストの両方を使った認知機能障害検出:オープンLLMで実現する高精度・汎用的なマルチモーダルフレームワーク

投稿者: ユウ

TL;DR 本論文は、音声とその書き起こしテキストの両方から特徴を抽出…

7月 23 2026
0

画像と質問の順序で精度が変わるVLMの弱点をテスト時間学習で修復

投稿者: ユウ

TL;DR Vision-Language Modelは画像→質問の順…

7月 22 2026
0

OmniReasoner:長尺音声動画の推論を「ズームイン」ツールで効率化する手法

投稿者: ユウ

TL;DR OmniReasonerは、長い音声動画に対して、まず低コ…

7月 22 2026
0

VLM画像改ざん検出のためのシンプルなドメイン汎化フレームワーク

投稿者: ユウ

TL;DR PIXAR-DGは、VLMが生成した画像のピクセルレベルの…

7月 21 2026
0

テキストで指定した側面に基づく画像類似度指標TPIPS

投稿者: ユウ

TL;DR 人間の視覚的類似性判断は文脈(色・形・背景など)に依存する…

7月 21 2026
0

ToolSciVer:科学論文の図表を読み解く、強化学習でツールを使い分ける検証フレームワーク

投稿者: ユウ

TL;DR ToolSciVerは、科学論文の図表やグラフを正確に読み…

7月 20 2026
0

VTM-Nav:階層的視覚トポロジカルメモリで同一シーンの物体探索を再利用する

投稿者: ユウ

TL;DR VTM-Navは、同一シーンを繰り返し探索する物体ゴールナ…

7月 19 2026
0

複数LLM協調で脳腫瘍MRIレポート生成、3D VLMを実現

投稿者: ユウ

TL;DR 脳腫瘍(グリオーマ・髄膜腫)の3D MRIとテキストのペア…

7月 17 2026
0

画像付きIssueからコード位置を特定するベンチマーク「MM-IssueLoc」の紹介

投稿者: ユウ

TL;DR MM-IssueLocは、Issueに添付されたスクリーン…

投稿のページ送り

前へ 1 … 4 5 6 7 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio