コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: ベンチマーク

8月 16 2026
0

研究アイデアを自動評価するLigBench:人間の判断に近づく統一ベンチマーク

投稿者: ユウ

TL;DR LigBenchは、LLMが生成した研究アイデアを、人間の…

8月 16 2026
0

LLMによる形式仕様生成の実力を測る新評価手法COINS

投稿者: ユウ

TL;DR LLMが生成する形式仕様の品質を、テストケースへの証明可能…

8月 16 2026
0

視覚言語モデルは「分からない」を内部で知っているのに答えを止められない——TRAPSBenchが示す表現ギャップ

投稿者: ユウ

TL;DR 視覚言語モデル(VLM)は、映像から答えが確定できない状況…

8月 16 2026
0

囲碁の死活問題でLLMの探索効率を測るTsuGO:推論の質を可視化する新ベンチマーク

投稿者: ユウ

TL;DR TsuGOは、囲碁の死活問題を使ってLLMの推論プロセスを…

8月 14 2026
0

実世界のAIフレームワークでTritonカーネル生成を評価する新ベンチマーク

投稿者: ユウ

TL;DR 既存のTritonカーネル生成ベンチマークは、PyTorc…

8月 14 2026
0

人間の手をロボットの手に変換する画像編集ベンチマーク「HandEdit」の実務解説

投稿者: ユウ

TL;DR HandEditは、人間の手と腕が写る一人称視点の画像を、…

8月 13 2026
0

SPICEネットリスト操作におけるLLM信頼性を検証するNetlistBench

投稿者: ユウ

TL;DR NetlistBenchは、LLMがSPICEネットリスト…

8月 13 2026
0

推論トークン予算でモデル順位が逆転する現象と実務への示唆

投稿者: ユウ

TL;DR LLMの評価は、生成トークン上限(予算)によってモデルの順…

8月 12 2026
0

金融LLMの推論を検証するV-FiLLM:計算木で作る自動生成ベンチマーク

投稿者: ユウ

TL;DR V-FiLLMは、金融表データに対するLLMの推論能力を検…

8月 12 2026
0

画像キャプション評価の新手法CapProbe:領域単位の高密度QAで詳細記述を検証する

投稿者: ユウ

TL;DR CapProbeは、画像キャプションの詳細な事実的正しさを…

投稿のページ送り

前へ 1 2 3 … 15 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio