コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: Vision-Language Model

7月 30 2026
0

論文図の品質を4軸でスコアリング:SciFigAlignによるマルチモーダル評価手法

投稿者: ユウ

TL;DR SciFigAlignは、論文の図を「明瞭さ」「関連性」「…

7月 30 2026
0

セパレータトークンで視覚トークンを刈り込み、MLLMを高速化するSepPrune

投稿者: ユウ

TL;DR SepPruneは、MLLMの入力シーケンス内にある「モダ…

7月 28 2026
0

一枚画像から物体の質量や密度を推定するSiPhyの仕組み

投稿者: ユウ

TL;DR SiPhyは、単一のRGB画像と深度情報から物体の質量・密…

7月 23 2026
0

画像と質問の順序で精度が変わるVLMの弱点をテスト時間学習で修復

投稿者: ユウ

TL;DR Vision-Language Modelは画像→質問の順…

7月 16 2026
0

VLMのCoT推論は画像を最後まで見直していない:Visual Access Boundaryの発見

投稿者: ユウ

TL;DR Vision-Language Model (VLM) の…

7月 13 2026
0

敵対的攻撃に強いVLMを実現:テスト時プロンプト適応フレームワークRITA

投稿者: ユウ

TL;DR RITAは、CLIPなどのVision-Language …

7月 10 2026
0

幻覚が推論を変える?VLMの「幻覚後推論」を評価するHIVE

投稿者: ユウ

TL;DR Vision-Language Model (VLM) が…

3月 02 2026
0

AIの診断を数学的に検証!医療レポートの「幻覚」を見抜く新技術

投稿者: ユウ

解説 ねえねえ、智也くん!これ、『Toward Guarantees …

2月 03 2026
0

学習いらずで即座に賢くなる!?AIの『その場しのぎ』を最強にする新技術TaTa

投稿者: ユウ

解説 ねえねえ智也くん!この『TaTa』って論文、名前が可愛くない?赤…

12月 26 2025
0

AIはイルカを見分けられるか?〜海の専門家になれるか、世界初の試験に挑戦〜

投稿者: ユウ

解説 ねえねえ、智也くん!これ見て!『MarineEval: Asse…

投稿のページ送り

1 2 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio