TL;DRPallasは、AI…
TL;DR
EchoCoTは、ツール呼び出しの仕組みを悪用して、API経由でブラックボックスな大規模推論モデル(LRM)の隠れた思考過程(CoT)をほぼそのまま抽出する攻撃手法です。APIが返す推論トークン数や要約を手がかりに、反復的なプロンプト注入で抽出を試みます。オープンソースモデルでは最大66.4%の成功率、Gemini-2.5では約33,000トークンの抽出に成功しており、セキュリティ上の重大なリスクを示しています。
解説
ねえ智也くん、このEchoCoTって論文、タイトルがすごく気になるんだけど。隠れた思考を引き出す攻撃って、どういうこと?
ああ、あれか。最近の大規模推論モデルって、答えを出す前に内部で思考過程(CoT)を生成するんだ。でもAPI経由だとその思考は隠されてて、ユーザーには見えないようになってる。EchoCoTはその隠れた思考をほぼそのまま引き出せる攻撃なんだよ。
へえ、そんなことできるんだ!でもどうやって?普通は見えないんでしょ?
ポイントはツール呼び出しの仕組みを悪用するところだね。モデルがツールを使うとき、内部の推論を要約して返すことがあるんだけど、その要約に元のCoTが漏れちゃうんだ。それに、APIが返す推論トークン数も手がかりになる。
なるほど、要約に漏れるってことか。でも一回だけじゃ完全には取れないんじゃない?
だから反復的なプロンプト注入で少しずつ抽出していくんだ。例えば、モデルに「前の推論を繰り返して」みたいな指示を何度も送って、少しずつ情報を引き出す感じ。
それでどれくらい取れるの?成功率とかある?
オープンソースのモデルだと最大66.4%の成功率で、Gemini-2.5では約33,000トークンの抽出に成功したって報告されてる。かなり深刻だよ。
33,000トークンってすごい量だね!でもなんでそんなに重要なん?単に思考が見えるだけじゃなくて?
思考過程にはモデルの内部知識や推論の癖、場合によっては機密情報が含まれることがあるからね。それを盗まれると、モデルの弱点を突いたり、プロンプトインジェクションの標的にされたりするリスクがある。
じゃあ対策はどうするの?完全に防ぐのは難しいんじゃない?
論文では、ツール呼び出しの出力を厳しく制限したり、推論トークン数を隠したり、プロンプトの検証を強化することを提案してる。でも完全には防げないから、根本的にはモデルの設計を見直す必要があるって言ってるね。
ふーん、でもこの攻撃って、モデルが賢いからこそできるって感じがして、ちょっと面白いね。まるで推理小説のトリックみたい。
まあ、面白いだけじゃ済まないけどね。でも確かに、攻撃者の視点は面白いかも。
じゃあ、私も試してみようかな?って、やっぱりやめておくよ。悪用しちゃダメだもんね。
当たり前だ。もしやったら、俺が止めるから。