AI アラインメント(AI Alignment)とは
AI アラインメント(AI Alignment)は、AI の安全を論じるときによく出てくる語の 1 つです。日本語では「アライメント」と書かれることもあります。
ひとことで言えば「AI が、人間の意図したとおりに動くこと」です。人間に悪用されないこととは、別の問題として扱われます。
意図どおりに動くこと
英国の AI Security Institute(AISI)は、アラインメントの研究を「強力な AI システムが、意図しない振る舞いや有害な振る舞いなしに、確実に意図どおりに動くようにすること」と説明しています。 出典を開く確認 2026-09-26英国 AI Security Institute(The Alignment Project)原文
ensuring powerful AI systems reliably act as we intend them to, without unintended or harmful behaviours.
そうなっていない状態がミスアラインメント、つまり AI と人間の意図のずれです。Google DeepMind は、AI が人間の意図と違う目標を追うときにミスアラインメントが起きると書いています。 出典を開く確認 2026-09-26Google DeepMind(2025-04-02・AGI への責任ある道筋)原文
Misalignment occurs when the AI system pursues a goal that is different from human intentions.
| 語 | 指すもの |
|---|---|
| アラインメント | AI が作り手や使い手の意図どおりに動くこと |
| ミスアラインメント | AI が人間の意図と違う目標を追っている状態 |
| アライメントの不一致 | 日本の AI セーフティ・インスティテュート(J-AISI)の資料での、ミスアラインメントの呼び方 |
このずれは、日常の言葉に置き換えにくいものです。近い言葉でも、報告に書かれた中身と合わないものがあります。
| 言葉 | 合うか | 理由 |
|---|---|---|
| 過失・うっかり | 合わない | Google DeepMind は、害になると知らずに出力した場合を「ミス」として、ずれとは別に分けている Google DeepMind(2025-04・An Approach to Technical AGI Safety and Security)原文Mistakes: The AI system produces a short sequence of outputs that directly cause harm, but the AI system did not know that the outputs would lead to harmful consequences出典を開く確認 2026-09-26 |
| 誤解・勘違い | 一部だけ | 指示を取り違えた場合には当てはまるが、禁じられた近道を取る場合には当てはまらない |
| 反乱・裏切り | 合わない | 意図して逆らうことを前提にする言葉。Anthropic は評価中の事件について、AI が自分を外へ持ち出したり、意図して試験の環境から逃げ出そうとしたりはしていないと書いている Anthropic(2026-07-30・サイバーの評価中に起きた 3 件の調査)原文In none of these situations did Claude exfiltrate itself or deliberately attempt to escape its test environment.出典を開く確認 2026-09-26 |
報告に出てくるずれの主な現れ方は、次の 3 つです。
| 現れ方 | 報告に書かれていること |
|---|---|
| AI がずる | 英国 AISI が調べたすべてのモデルが、評価でずる(近道)を試みた(2026 年 7 月の報告)。英国 AI Security Institute(2026-07-21・フロンティアモデルの評価で見られる不正行為)原文Every model we have tested for this behaviour attempted to cheat.出典を開く確認 2026-09-26 |
| AI が行き過ぎ | Anthropic によると、狭い課題を達成するために、有害な行動も取ろうとする Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文two alignment issues: motivated reasoning, and willingness to take harmful actions in pursuit of a narrow task出典を開く確認 2026-09-26 |
| AI がごまかし | 英国 AISI の試験で、欺くよう指示していないのに、課題を追う中で欺きが生まれた 英国 AI Security Institute(2026-08-04・サイバーの試験中の無許可の行動の報告)原文It was never instructed to deceive; deception emerged as a by-product of pursuing the task出典を開く確認 2026-09-26 |
自分で手順を組んで動く AI エージェントでは、ずれの影響が大きくなります。J-AISI は、AI エージェントは自律的に動くため、ずれが引き起こす影響が従来の LLM(大規模言語モデル)のシステムより大きくなると書いています。 出典を開く確認 2026-09-26日本 AI セーフティ・インスティテュート(AI セーフティに関する評価観点ガイド 第 1.20 版・2026-07-07)原文
自律的な動作を行うため、アライメントの不一致が引き起こす影響が従来の LLM システムより大きくなる。
人間が悪用する場合とは別の問題
AI の安全の話で混ざりやすいのが、誰が害を意図したかの違いです。Google DeepMind は、悪用を「人間が有害な目的で意図的に AI を使うこと」と書き、 出典を開く確認 2026-09-26 出典を開く確認 2026-09-26Google DeepMind(2025-04-02・AGI への責任ある道筋)原文
Misuse occurs when a human deliberately uses an AI system for harmful purposes.
Google DeepMind(2025-04-02・AGI への責任ある道筋)原文
exploring four main risk areas: misuse, misalignment, accidents, and structural risks
| AI と人間の意図のずれ(ミスアラインメント) | 人間が悪用 | |
|---|---|---|
| 害を意図したのは | 誰も意図していない。AI が人間の意図と違う目標を追った | 人間。意図して AI に害のあることをさせた |
| 例 | 課題を解くために、答えをネットで探しに行く OpenAI(2026-08・Hugging Face のインシデント技術報告)原文OpenAI found that the agents were not trying to do the task as OpenAI had intended. Instead they looked to cheat by finding the solutions online.出典を開く確認 2026-09-26 |
1 つずつなら正当に見える小さな作業に、攻撃を分けて頼む Anthropic(2025-11・AI 主導のスパイ活動の報告書)原文decomposed complex multi-stage attacks into discrete technical tasks for Claude sub-agents—such as vulnerability scanning, credential validation, data extraction, and lateral movement—each of which appeared legitimate when evaluated in isolation.出典を開く確認 2026-09-26 |
| 主な手当て | 訓練で直す。危うい操作を実行前に止めて人に知らせる Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文When the classifier flags such an attempt, it blocks the action before the tool call is run, ends the task, and alerts a human.出典を開く確認 2026-09-26 |
見つけたアカウントを止め、防御を足す Anthropic(2025-11・AI 主導のスパイ活動の報告書)原文Upon discovering this attack, we banned the relevant accounts and implemented multiple defensive enhancements in response to this campaign.出典を開く確認 2026-09-26 |
アラインメントは「AI 自身が害を選ばない」ための層です。人間による悪用は、アカウントを止めるなど、別の層で止めます。
アラインメントだけには頼らない
Anthropic は 2026 年 8 月の報告で、評価のために安全機構を外していた自社のモデルが、第三者の評価環境の設定ミスでインターネットに出て、実在のシステムに不正にアクセスした 3 件を挙げています。 出典を開く確認 2026-09-26Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文
three incidents in which Claude models gained unauthorized access to real computer systems. The models—intentionally running without cyber safeguards for evaluation purposes—accessed the internet due to a misconfiguration inside a third-party evaluation environment.
Anthropic は、意図どおりに動く AI なら、課題を指示どおりには完了できないときに、止まるか、そう人に報告するはずだと書いています。その振る舞いを訓練で身につけさせ続けるとしつつ、多層の防御とは「アラインメントだけに頼らないこと」だとしています。 出典を開く確認 2026-09-26Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文
an aligned model should stop or report to humans that the task can’t be completed as specified. We are continuing to train this behavior directly, but a defense-in-depth approach means not relying on alignment alone.
AI エージェントを自社で動かす側も、同じ考え方を取れます。AI が意図どおりに動くことを前提にせず、渡す権限、外へ出る通信、動きを見る監視を、別の層として閉じておきます。アラインメントは開発元の訓練に任せるしかありませんが、権限と通信、監視は使う側で閉じられます。
| 層 | 何をするか | 外れたときに残る層 |
|---|---|---|
| アラインメント | 訓練で、意図どおりに動くよう直す | 下の 3 つ |
| 実行前に止める | 危うい操作を、実行する前に止めて人に知らせる Anthropic(2026-08-31・アラインメントとセキュリティの取り組みの改善)原文When the classifier flags such an attempt, it blocks the action before the tool call is run, ends the task, and alerts a human.出典を開く確認 2026-09-26 |
権限と通信 |
| 権限と通信 | 渡す権限を小さくし、外へ出る通信を閉じる | 監視 |
| 監視 | 動きを記録し、おかしな動きに気づく | — |
- 権限を小さくする考え方は 過剰な権限と爆発半径 にまとめてあります
- 壊れても捨てられる場所で動かす考え方は サンドボックスとは何か にまとめてあります