コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

8月 08 2026
0

LLMで自然言語要件をLTL仕様に自動変換する実践評価

投稿者: ユウ

TL;DR 本研究は、市販のLLM 6モデルが非構造化の自然言語要件を…

8月 08 2026
0

ベンチマーク評価の盲点:APIとチャットUIで結果が変わる

投稿者: ユウ

TL;DR LLMの安全性評価は通常API経由・1回の実行・正解率のみ…

8月 08 2026
0

教師なし自己蒸留でLLM推論を改善:多数決で擬似正解を作るU-OPSD

投稿者: ユウ

TL;DR U-OPSDは、外部の正解ラベルや教師モデルを使わずに、モ…

8月 08 2026
0

会話エージェント用ベンチマークの品質を測る新しい評価フレームワーク

投稿者: ユウ

TL;DR LLMベースの会話エージェントを評価するベンチマーク自体の…

8月 07 2026
0

国家标准文書レビューをLLMで自動化するGB/T-BenchとGB/T-Reviewer

投稿者: ユウ

TL;DR GB/T-Benchは、中国の国家標準文書(GB/T)のレ…

8月 07 2026
0

データベースから自動で意味スキーマを構築する「TYTAN」の仕組み

投稿者: ユウ

TL;DR TYTANは、データベースの構造分析とLLMの意味推論を組…

8月 07 2026
0

多言語推論を強化するRP-OPSD:推論の要所を見極めて蒸留する手法

投稿者: ユウ

TL;DR RP-OPSDは、多言語の推論性能を高めるための手法です。…

8月 07 2026
0

ツール呼び出しはJSONよりコードが有利?14モデルで検証した実務向け比較

投稿者: ユウ

TL;DR LLMに外部ツールを呼び出させる方法として、従来のJSON…

8月 07 2026
0

RAGの推論を透明化するNeSy-RAG:Prologで検証可能な回答生成

投稿者: ユウ

TL;DR NeSy-RAGは、RAGの検索結果をPrologモジュー…

8月 07 2026
0

生成型報酬モデルをRLで活かす「RRC」:ランキングから報酬を作る手法

投稿者: ユウ

TL;DR 生成型報酬モデルは応答のランキングには強いが、RLで使うス…

投稿のページ送り

1 2 … 270 次へ

Recent Posts

  • LLMで自然言語要件をLTL仕様に自動変換する実践評価
  • ベンチマーク評価の盲点:APIとチャットUIで結果が変わる
  • 教師なし自己蒸留でLLM推論を改善:多数決で擬似正解を作るU-OPSD
  • 会話エージェント用ベンチマークの品質を測る新しい評価フレームワーク
  • 国家标准文書レビューをLLMで自動化するGB/T-BenchとGB/T-Reviewer

Recent Comments

表示できるコメントはありません。

過去30日間の人気記事

Proudly powered by WordPress | テーマ: Futurio