コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: 評価

8月 01 2026
0

LLMは仕様の表現形式にどう反応する?対立仕様で測る選好の仕組み

投稿者: ユウ

TL;DR LLMが複数の仕様(自然言語、形式言語、自然化形式言語、入…

7月 29 2026
0

マルチモーダルLLMのタスク別忠実性監査フレームワーク:電力系統診断での実証

投稿者: ユウ

TL;DR マルチモーダルLLMが電力系統診断で本当にタスクに必要な証…

7月 29 2026
0

APS-RAG:科学施設の運用知識を統合するハイブリッドRAGとその評価

投稿者: ユウ

TL;DR APS-RAGは、米国アルゴンヌ国立研究所の放射光施設AP…

7月 28 2026
0

医療画像の2D/3Dを統合する視覚中心MLLM「ClinFusion」の実装と評価

投稿者: ユウ

TL;DR ClinFusionは、2D・3D医療画像を統合処理するカ…

7月 27 2026
0

LLMの疑似科学検証はモデルではなくデプロイ設定で変わる——Grokの事例

投稿者: ユウ

TL;DR 商用LLMが疑似科学をどう評価するかは、モデル自体の性能で…

7月 21 2026
0

発見システムのハーネス選択は万能レシピではなくハイパーパラメータである

投稿者: ユウ

TL;DR LLMを用いた自動発見システム(OpenEvolveやTT…

7月 18 2026
0

ドイツ科学文献の自動主題索引:XMLCとLLM生成手法のベンチマーク比較

投稿者: ユウ

TL;DR ドイツ国立図書館の大規模統制語彙(GND-204K)を対象…

7月 16 2026
0

AgentCompass:エージェント評価を統合する軽量フレームワーク

投稿者: ユウ

TL;DR AgentCompassは、LLMベースのエージェント評価…

7月 16 2026
0

LLM検証ゲートの相関が信頼性に与える影響:指数関数的改善から多項式へ

投稿者: ユウ

TL;DR LLMの出力を検証するゲートを直列に増やしても、ゲート間の…

7月 13 2026
0

LLMの教育制御を測る:Bloom分類学に基づくフレームワーク

投稿者: ユウ

TL;DR 本論文は、LLMがプログラミング課題の教育的意図を保ちつつ…

投稿のページ送り

1 2 3 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio