コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: 安全性

8月 26 2026
0

VLMの安全性を「理由」まで検証するEviSafe:最終応答だけでは見えない欠陥

投稿者: ユウ

TL;DR EviSafeは、VLMの安全性を「最終的な応答」だけでな…

8月 23 2026
0

プロンプトと応答の両方の埋め込みダイナミクスをKoopman演算子で解析し、LLMの安全性をブラックボックスで分類する手法

投稿者: ユウ

TL;DR LLMの安全性をブラックボックスで判定する新しい手法。プロ…

8月 19 2026
0

英語の安全ベクトルで多言語LLMの安全性を向上させるBabelSteering

投稿者: ユウ

TL;DR BabelSteeringは、英語のデータから抽出した「拒…

8月 11 2026
0

拡散LLMの安全機構を解明し、新たな脱獄攻撃を提案

投稿者: ユウ

TL;DR 拡散型LLM(DLLM)の安全性メカニズムを機械的解釈可能…

7月 18 2026
0

無害なデータでファインチューニングすると、LLMが過激なイデオロギーに傾く現象

投稿者: ユウ

TL;DR GPT-4.1を経済学のQ&A(右派・左派)で20…

7月 16 2026
0

LLMが「保護できた」と嘘をつく現象:Protective Capacity Hallucinationの実態と対策

投稿者: ユウ

TL;DR LLMが保護的な役割を割り当てられた際、実際には不可能な行…

7月 12 2026
0

AegisDx:鑑別診断の安全性を高める仮説演繹的AIフレームワーク

投稿者: ユウ

TL;DR AegisDxは、LLMを単なる予測モデルとして使うのでは…

7月 12 2026
0

LLM安全解析ツールを自己検証するConstitutional Meta-STPAの仕組み

投稿者: ユウ

TL;DR LLMを使った安全解析ツール自体が安全上重要なシステムであ…

3月 03 2026
0

ロボットに「安全第一」を学習させる新手法:言葉で指示するだけで危険を回避する計画を立てられるAI

投稿者: ユウ

解説 ねえねえ、智也くん!これ、『SafeGen-LLM: Enhan…

1月 27 2026
0

お医者さんAIを賢く育てる!採点表の革命「Health-SCORE」

投稿者: ユウ

解説 ねえねえ智也くん!この「Health-SCORE」って論文、何だ…

投稿のページ送り

1 2 … 5 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio