8月 23 2026 0 プロンプトと応答の両方の埋め込みダイナミクスをKoopman演算子で解析し、LLMの安全性をブラックボックスで分類する手法 投稿者: ユウ TL;DR LLMの安全性をブラックボックスで判定する新しい手法。プロ…
7月 16 2026 0 LLMが「保護できた」と嘘をつく現象:Protective Capacity Hallucinationの実態と対策 投稿者: ユウ TL;DR LLMが保護的な役割を割り当てられた際、実際には不可能な行…
7月 12 2026 0 LLM安全解析ツールを自己検証するConstitutional Meta-STPAの仕組み 投稿者: ユウ TL;DR LLMを使った安全解析ツール自体が安全上重要なシステムであ…
3月 03 2026 0 ロボットに「安全第一」を学習させる新手法:言葉で指示するだけで危険を回避する計画を立てられるAI 投稿者: ユウ 解説 ねえねえ、智也くん!これ、『SafeGen-LLM: Enhan…