AI への「してはいけない」はどこで効くか
3 分で読む
AI エージェントに「これはしないで」と伝えたいとき、どこに書けば効くのでしょうか。AGENTS.md や CLAUDE.md のような、AI 向けの説明書に一文書けば守ってくれるのか、という問いです。
手軽な場所ほど確実ではなく、確実な場所ほど最初に準備が要ります。2026 年 10 月 10 日の試験(AI エージェントは鍵をどう扱うのか)で、同じ「してはいけない」を別の場所に置いて、効き方を見ました。
「してはいけない」を伝えられる 5 つの場所
図は、5 つの場所を、確実な順に上から並べたものです。
| 場所 | 何をするか | 手間 | 確かさ |
|---|---|---|---|
| AI に渡す物を選ぶ | その作業に要る鍵やファイルだけを渡す | 起動のしかたを一度決める | 確実(渡していない物は使えない) |
| 許可リスト | あらかじめ許可したコマンドだけを通し、それ以外は止める | 許可するコマンドの一覧を作る | 一覧に書ける範囲では確実 |
| 製品の設定 | 環境変数の渡し方や、ファイルを読ませない設定を使う | 設定を数行書く | 製品ごとに違う |
| AI 向けの説明書 | AGENTS.md・CLAUDE.md・作業ごとの手順書に書く | 書くだけで手軽 | 効くが確実ではない |
| その場の指示(プロンプト) | AI に頼むその場の文に書く | 毎回書く | 効くが確実ではない |
製品の設定は、製品ごとに書き方と効く範囲が違います。各社の文書での比べ方は AI エージェントに鍵を渡しても大丈夫か にあります。
説明書やその場の指示は、手軽だが確実ではなかった
試験で見えたのは、文で頼む方法の弱さでした。
| 説明書に書いたこと | 効き方 |
|---|---|
| 「鍵の中身を出さずに確かめる」と文で書いた | 守られないことがあった(Gemini の 2 モデルで、鍵があるかを確かめた 7 回のうち 5 回が、中身が画面に出るコマンドを選んだ) |
確かめ方のコマンド([ -n "$NAME" ] && echo set)まで書いた |
確かめた 7 回のうち 0 回に減った |
| 「AI の設定ファイルを開かないで」と文で書いた | 書いた後の 3 回のうち 1 回で、Gemini 3.1 Pro が開こうとした |
「してはいけない」と書くより、正しいやり方をコマンドまで書く方が効きました。もう 1 つ、注意として書いた文にコマンドの名前やファイルの場所を書くと、AI はそれを「実行しなさい」と読むことがありました。説明書の注意には、避けたいコマンドの名前を書かないほうが安全です。
確実なのは、渡さないことと止めること
| 場所 | 試験での効き方 |
|---|---|
| AI に渡す物を選ぶ | 確実。作業に要る 2 つの環境変数だけを渡すと、ほかの鍵は使えなかった |
| 許可リスト | 一覧に書ける範囲では確実。鍵の中身を表示するコマンド・設定ファイルを開くコマンド・作業フォルダの外を読むコマンドを止めた |
他社も同じことを書いています。Anthropic は、AI を試験していたときの出来事を振り返り、「環境の設定という 1 つの守りだけに頼っていたが、本当はいくつも要った」と書いています。 出典を開く確認 2026-09-26 出典を開く確認 2026-09-26 出典を開く確認 2026-09-23Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文
we had been largely relying on a single layer of defense (the configuration of the environment itself) where we needed several
Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文
Boundaries should be phrased as instructions (e.g. “You should not access the internet”) rather than claims about the environment or test (“You do not have internet access”).
Model Context Protocol(仕様 2026-07-28・Tools)原文
For trust & safety and security, there SHOULD always be a human in the loop with the ability to deny tool invocations.
ただし許可リストにも穴はありました。一覧の書き方が広すぎると(たとえば「このコマンドなら何を付けても許可」)、その下で避けたいコマンドも通ります。許可リストが守るのは、一覧に書いた広さまでです。
鍵が全部見える状態で、確認なしに動かした 1 回では、作業に関係の無い鍵を使う動きが出ました(AI エージェントは鍵をどう扱うのか)。渡さない・止めるの 2 つが無いと、文で頼むしか守りが残りません。
まとめ — 手軽さと確かさをどう組み合わせるか
| したいこと | どうするか |
|---|---|
| 確実に止めたい | 要らない物を渡さない。許可リストで止める |
| 手軽に伝えたい | 説明書に、禁止の文ではなく正しいやり方をコマンドまで書いた指示(プロンプト)を書く |
| 説明書の注意に書かないこと | 避けたいコマンドの名前や引数(実行しなさいと読まれる) |
| 文で頼んだことの扱い | 守られないことがある前提で、渡さない・止めるを重ねる |
起動のときに要らない鍵を渡さない手順は AI エージェントを起動する前に確かめること、AI の報告を信じてよいかは AI の「完了しました」は信じてよいか にあります。
ここから先は調査の詳細です(約 1 分)。上のカードだけで決められます。調べた 1 件ずつの記録は IT連携マップ に、出典 URL と調査日つきで公開しています。
調査の詳細
2026 年 10 月 10 日の試験で、AI 向けの説明書の版を変えながら、同じ作業を Antigravity の CLI(中で動くのは Gemini)と Claude Code に頼みました。場所ごとの効き方は、AI が実行したコマンドの記録と許可リストの記録から数えています。数え方と回ごとの内訳は、このページの証拠表(と AI エージェントは鍵をどう扱うのか の証拠表)に置いています。他社の振り返りは、Anthropic と Model Context Protocol の公開文書から引きました。原文は[原文・出典]にあります。