コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: 評価

7月 28 2026
0

医療画像の2D/3Dを統合する視覚中心MLLM「ClinFusion」の実装と評価

投稿者: ユウ

TL;DR ClinFusionは、2D・3D医療画像を統合処理するカ…

7月 27 2026
0

LLMの疑似科学検証はモデルではなくデプロイ設定で変わる——Grokの事例

投稿者: ユウ

TL;DR 商用LLMが疑似科学をどう評価するかは、モデル自体の性能で…

7月 21 2026
0

発見システムのハーネス選択は万能レシピではなくハイパーパラメータである

投稿者: ユウ

TL;DR LLMを用いた自動発見システム(OpenEvolveやTT…

7月 18 2026
0

ドイツ科学文献の自動主題索引:XMLCとLLM生成手法のベンチマーク比較

投稿者: ユウ

TL;DR ドイツ国立図書館の大規模統制語彙(GND-204K)を対象…

7月 16 2026
0

AgentCompass:エージェント評価を統合する軽量フレームワーク

投稿者: ユウ

TL;DR AgentCompassは、LLMベースのエージェント評価…

7月 16 2026
0

LLM検証ゲートの相関が信頼性に与える影響:指数関数的改善から多項式へ

投稿者: ユウ

TL;DR LLMの出力を検証するゲートを直列に増やしても、ゲート間の…

7月 13 2026
0

LLMの教育制御を測る:Bloom分類学に基づくフレームワーク

投稿者: ユウ

TL;DR 本論文は、LLMがプログラミング課題の教育的意図を保ちつつ…

7月 12 2026
0

PREDICATELONGBENCH:述語制約で長文LLMの限界を多軸評価するベンチマーク

投稿者: ユウ

TL;DR PREDICATELONGBENCHは、LLMの長文理解を…

7月 11 2026
0

LLMによる理論的構成概念の測定:AMALIA-9Bの妥当性検証と回復ギャップ

投稿者: ユウ

TL;DR ポルトガルの国産LLM「AMALIA-9B」が、道徳基盤「…

3月 06 2026
0

LLMの推論能力を「構造抽出」の観点から可視化するX-RAY手法

投稿者: ユウ

TL;DR X-RAYは、LLMの推論能力を「制約の相互作用」「推論の…

投稿のページ送り

前へ 1 2 3 4 5 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio