コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: 評価

8月 26 2026
0

VLMの安全性を「理由」まで検証するEviSafe:最終応答だけでは見えない欠陥

投稿者: ユウ

TL;DR EviSafeは、VLMの安全性を「最終的な応答」だけでな…

8月 25 2026
0

LLMは文法工学をどこまで支援できるか?広東語ParGram資源と制御実験による評価

投稿者: ユウ

TL;DR 本論文は、LLM(gpt-oss-120bとGPT-5.4…

8月 23 2026
0

金融コンプライアンスLLM評価の新手法:ReguSimとReguBenchの実務的示唆

投稿者: ユウ

TL;DR LLMエージェントが金融規制を守るかを評価するため、Reg…

8月 22 2026
0

ベース言語モデルの生成ループに「新しい主題の注入」が与える効果と評価の落とし穴

投稿者: ユウ

TL;DR ベース言語モデルをタスクなしで長く生成させると、繰り返しに…

8月 22 2026
0

契約書レビューAIの実力評価:ContractScrubベンチマークの概要

投稿者: ユウ

TL;DR ContractScrubは、契約書の最終レビュー(スクラ…

8月 21 2026
0

議論の判定を理論化:LLM判定と形式意味論の比較から見える実務的示唆

投稿者: ユウ

TL;DR 本論文は、AIエージェント間の議論を事後的に判定する方法を…

8月 20 2026
0

LLM検証の「レベル」を整理する:検証仕様の出所で決まるL0〜L5

投稿者: ユウ

TL;DR LLMの推論を検証する手法は多数あるが、「レベル」という言…

8月 20 2026
0

AI翻訳の評価ギャップ:読みやすさと原文保持のズレをどう見抜くか

投稿者: ユウ

TL;DR AI翻訳では、読みやすさを優先した出力は原文の内容を保持し…

8月 20 2026
0

LLMは幾何制約を「知っている」のに使えない? 凍結LLMの内部表現を4段階で監査する

投稿者: ユウ

TL;DR 凍結LLMの内部表現を、線形復号・生成・活性化パッチ・ステ…

8月 19 2026
0

AIエージェントが恋愛マッチングを変える?送る側と受け取る側の非対称性を測る

投稿者: ユウ

TL;DR マッチングアプリでAIエージェントが会話を代行する未来を考…

投稿のページ送り

1 2 … 5 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio