コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: LLM評価

8月 13 2026
0

推論トークン予算でモデル順位が逆転する現象と実務への示唆

投稿者: ユウ

TL;DR LLMの評価は、生成トークン上限(予算)によってモデルの順…

8月 11 2026
0

行政向けLLM評価フレームワーク「Grip on LLMs」:価値観からベンチマークへ

投稿者: ユウ

TL;DR オランダ・アムステルダム市が開発した「Grip on LL…

8月 09 2026
0

国際紛争でLLMは公平か?5次元で測る政治バイアス監査フレームワーク

投稿者: ユウ

TL;DR POLI-BIASは、国際紛争シナリオで国名を入れ替えた同…

8月 08 2026
0

ベンチマーク評価の盲点:APIとチャットUIで結果が変わる

投稿者: ユウ

TL;DR LLMの安全性評価は通常API経由・1回の実行・正解率のみ…

8月 08 2026
0

会話エージェント用ベンチマークの品質を測る新しい評価フレームワーク

投稿者: ユウ

TL;DR LLMベースの会話エージェントを評価するベンチマーク自体の…

7月 31 2026
0

UI評価を人間らしく:5人のペルソナが議論して採点するESPP手法

投稿者: ユウ

TL;DR 生成UIの品質評価を、単一のLLM判定ではなく、心理特性の…

7月 31 2026
0

PRとIssueのズレを自動検出:PaiCheckerでSWE-benchの信頼性を高める

投稿者: ユウ

TL;DR SWE-bench系ベンチマークでは、PRとIssueの対…

7月 31 2026
0

LLMの地域バイアスを抽象ステレオタイプから具体的判断まで評価するS2Dフレームワーク

投稿者: ユウ

TL;DR S2Dは中国34地域を対象に、LLMの地域バイアスを「温か…

7月 29 2026
0

フランス移民法RAGベンチマーク:許可証分類精度が最大26.9ポイント向上

投稿者: ユウ

TL;DR フランスの外国人採用における行政手続き(在留許可の種類・必…

7月 23 2026
0

2段階メタルーブリックで評価する事実完全性:GAMUTベンチマークの実装解説

投稿者: ユウ

TL;DR GAMUTは、長文生成の事実完全性(回答に必要な全情報が含…

投稿のページ送り

前へ 1 2 3 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio