コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

7月 12 2026
0

PLURAL:92カ国の価値観を反映する大規模選好データセット

投稿者: ユウ

TL;DR PLURALは、92カ国をカバーする社会調査IVSを基に、…

7月 12 2026
0

テスト時にエージェントの制御プログラムを進化させるTTHE:実行痕跡だけでハーネスを改善

投稿者: ユウ

TL;DR TTHEは、LLMエージェントの動作を決める「ハーネス」(…

7月 12 2026
0

AegisDx:鑑別診断の安全性を高める仮説演繹的AIフレームワーク

投稿者: ユウ

TL;DR AegisDxは、LLMを単なる予測モデルとして使うのでは…

7月 12 2026
0

内部表現を読む:LLM予測モデルのキャリブレーションと忠実性を改善するプロービング手法

投稿者: ユウ

TL;DR LLMの予測は正確でも過信しがちで、思考連鎖(CoT)は真…

7月 12 2026
0

LLM安全解析ツールを自己検証するConstitutional Meta-STPAの仕組み

投稿者: ユウ

TL;DR LLMを使った安全解析ツール自体が安全上重要なシステムであ…

7月 12 2026
0

思考連鎖エントロピーでVLMの幻覚を検出する実践手法

投稿者: ユウ

TL;DR 思考モードVLMでは回答トークンのエントロピーが幻覚検出に…

7月 12 2026
0

動画でポリシーを観察し、カリキュラムを自動生成するVIP手法

投稿者: ユウ

TL;DR VIPは、強化学習エージェントのエピソード動画をVLM(V…

7月 12 2026
0

LLMのゼロショットASTEを改善するマルチエージェントパイプラインMASTE

投稿者: ユウ

TL;DR MASTEは、LLMが苦手とするAspect-Sentim…

7月 12 2026
0

PREDICATELONGBENCH:述語制約で長文LLMの限界を多軸評価するベンチマーク

投稿者: ユウ

TL;DR PREDICATELONGBENCHは、LLMの長文理解を…

7月 12 2026
0

MCPエージェントパイプラインで自然言語のシステム記述からOSCAL準拠の監査成果物を生成

投稿者: ユウ

TL;DR 本論文は、自然言語で書かれたシステム記述(レガシー文書など…

投稿のページ送り

前へ 1 … 42 43 44 … 288 次へ

Recent Posts

  • LLMの回答を軽量な制約で検証する:知識グラフQAの新手法CES-PK
  • LLMで問題文の「うっかり重複」を検出する二重分析フレームワーク
  • プロンプト構造は脆弱性を減らさず「移動」させる:LLM生成コードのセキュリティ実証分析
  • 行動アノマリー検索を3段階で解決するActPair:ペア比較リランキングの実装ポイント
  • VLMの安全性を「理由」まで検証するEviSafe:最終応答だけでは見えない欠陥

Recent Comments

表示できるコメントはありません。

過去30日間の人気記事

Proudly powered by WordPress | テーマ: Futurio