コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: computer vision

7月 28 2026
0

イベント発生で動画編集を自動化:EgoPlayの仕組みと実装ポイント

投稿者: ユウ

TL;DR EgoPlayは、一人称視点の動画に対して「〇〇が起きたら…

7月 28 2026
0

医療画像の2D/3Dを統合する視覚中心MLLM「ClinFusion」の実装と評価

投稿者: ユウ

TL;DR ClinFusionは、2D・3D医療画像を統合処理するカ…

7月 28 2026
0

一枚画像から物体の質量や密度を推定するSiPhyの仕組み

投稿者: ユウ

TL;DR SiPhyは、単一のRGB画像と深度情報から物体の質量・密…

7月 23 2026
0

画像と質問の順序で精度が変わるVLMの弱点をテスト時間学習で修復

投稿者: ユウ

TL;DR Vision-Language Modelは画像→質問の順…

7月 22 2026
0

VLM画像改ざん検出のためのシンプルなドメイン汎化フレームワーク

投稿者: ユウ

TL;DR PIXAR-DGは、VLMが生成した画像のピクセルレベルの…

7月 21 2026
0

テキストで指定した側面に基づく画像類似度指標TPIPS

投稿者: ユウ

TL;DR 人間の視覚的類似性判断は文脈(色・形・背景など)に依存する…

7月 19 2026
0

ネガティブプロンプト自動生成と潜在空間分類器でStable Diffusionの画質を改善

投稿者: ユウ

TL;DR 本論文は、Stable Diffusionの画質向上のため…

7月 17 2026
0

画像付きIssueからコード位置を特定するベンチマーク「MM-IssueLoc」の紹介

投稿者: ユウ

TL;DR MM-IssueLocは、Issueに添付されたスクリーン…

7月 16 2026
0

VisualRepair:画像タイプに応じたツール呼び分けと領域フォーカスでソフトウェアバグ修正

投稿者: ユウ

TL;DR VisualRepairは、ソフトウェアのバグ報告に添付さ…

7月 16 2026
0

VLMのCoT推論は画像を最後まで見直していない:Visual Access Boundaryの発見

投稿者: ユウ

TL;DR Vision-Language Model (VLM) の…

投稿のページ送り

前へ 1 2 3 … 13 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio