コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: ベンチマーク

7月 21 2026
0

信念の表現方法がLLMの応答を変える:19種類の言語バリエーションを評価

投稿者: ユウ

TL;DR ユーザーがLLMに信念を伝える際、同じ事実内容でも「言い方…

7月 21 2026
0

LLM支援設計の工程別診断:振動発電デバイス設計ベンチマークVEHBench

投稿者: ユウ

TL;DR VEHBenchは、LLMが振動発電デバイス設計の各工程(…

7月 18 2026
0

ドイツ科学文献の自動主題索引:XMLCとLLM生成手法のベンチマーク比較

投稿者: ユウ

TL;DR ドイツ国立図書館の大規模統制語彙(GND-204K)を対象…

7月 17 2026
0

画像付きIssueからコード位置を特定するベンチマーク「MM-IssueLoc」の紹介

投稿者: ユウ

TL;DR MM-IssueLocは、Issueに添付されたスクリーン…

7月 17 2026
0

構造工学エージェントの証拠連鎖を検証するStructureClaw

投稿者: ユウ

TL;DR StructureClawは、LLMエージェントが構造工学…

7月 17 2026
0

PROBE:コード生成LLMを3軸で評価するベンチマークフレームワーク

投稿者: ユウ

TL;DR PROBEは、LLMによるコード生成を「機能的正当性」「正…

7月 16 2026
0

AgentCompass:エージェント評価を統合する軽量フレームワーク

投稿者: ユウ

TL;DR AgentCompassは、LLMベースのエージェント評価…

7月 15 2026
0

メモリ操作のライフサイクルで診断するLLM長期会話の弱点

投稿者: ユウ

TL;DR MemOpsは、LLMエージェントの長期記憶を「覚える」「…

7月 15 2026
0

高度な数学証明の生成と検証を評価するベンチマークスイート

投稿者: ユウ

TL;DR AdvancedMathBenchは、LLMの高度な数学証…

7月 15 2026
0

スポーツ映像理解の新ベンチマーク:複数カメラを活用するエージェントフレームワーク

投稿者: ユウ

TL;DR 既存のMLLMは単一視点の動画理解に優れるが、スポーツでは…

投稿のページ送り

前へ 1 2 3 … 12 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio