コンテンツへスキップ

亜美と智也のAI論文解説

最新AI論文の知見を分かりやすく解説!

タグ: 強化学習

8月 01 2026
0

記憶は再生せず再構成する:MemHarnessが示すLLMエージェントの新常識

投稿者: ユウ

TL;DR MemHarnessは、LLMエージェントが過去の経験をそ…

8月 01 2026
0

HPCタスク向けLLMのRL訓練を改善するHARGO:タスク多様性に応じた重み付け

投稿者: ユウ

TL;DR HARGOは、HPCタスクの多様性(回答長、報酬分布、精度…

7月 30 2026
0

LLMエージェントのツール取得コストを削減する停止ルールCAM-DF

投稿者: ユウ

TL;DR CAM-DFは、LLMエージェントがタスク実行前に取得する…

7月 27 2026
0

非同期RLの重要度比をエントロピーで補正:ESTRによる安定化手法

投稿者: ユウ

TL;DR 非同期強化学習では、古いデータを使うことで勾配が不安定にな…

7月 24 2026
0

OLED分子設計にLLMと強化学習を応用、GRPOで物性制御を実現

投稿者: ユウ

TL;DR 本論文は、有機EL(OLED)材料の逆設計フレームワークを…

7月 22 2026
0

長文推論でモデルが入力を丸写しする問題と、証拠に注目させる報酬設計GEAR

投稿者: ユウ

TL;DR 長文推論タスクでLLMが入力をそのまま思考にコピーする「反…

7月 22 2026
0

OmniReasoner:長尺音声動画の推論を「ズームイン」ツールで効率化する手法

投稿者: ユウ

TL;DR OmniReasonerは、長い音声動画に対して、まず低コ…

7月 22 2026
0

LLMをコーチに変えるEL:スカラー報酬より5000倍の情報量で非検証タスクを改善

投稿者: ユウ

TL;DR 従来のRLはLLM-as-a-Judgeの評価をスカラー報…

7月 21 2026
0

ToolSciVer:科学論文の図表を読み解く、強化学習でツールを使い分ける検証フレームワーク

投稿者: ユウ

TL;DR ToolSciVerは、科学論文の図表やグラフを正確に読み…

7月 17 2026
0

LLMエージェントのメモリ操作を学習で適応制御するMEMCON

投稿者: ユウ

TL;DR MEMCONは、LLMエージェントの外部メモリへのアクセス…

投稿のページ送り

前へ 1 2 3 4 次へ

Archives

  • 2026年8月
  • 2026年7月
  • 2026年3月
  • 2026年2月
  • 2026年1月
  • 2025年12月
  • 2025年1月
  • 2024年12月
  • 2024年11月
  • 2024年10月
  • 2024年9月
  • 2024年8月
  • 2024年7月
  • 2024年6月
  • 2024年5月
  • 2024年4月
  • 2024年3月

Categories

  • 3Dモデリング
  • AI
  • テキスト生成
  • 人物-物体相互作用
Proudly powered by WordPress | テーマ: Futurio