8月 18 2026 0 AI-RANハンドオーバー時のLLM推論を止めないKVキャッシュ先行移行フレームワーク 投稿者: ユウ TL;DR Pallasは、AI-RAN環境でユーザーが基地局間を移動…
8月 15 2026 0 LLM推論サービスの価格とデフォルト設定の最適化:Stackelbergゲームによる分析 投稿者: ユウ TL;DR LLM推論サービスにおいて、プロバイダがトークン単価とデフ…
8月 10 2026 0 エッジLLM推論の新フレームワークBALANCE:ADとSDを同時実行して収容ユーザー数を最大化 投稿者: ユウ TL;DR エッジサーバーでLLMを動かす際、逐次生成(AD)はメモリ…