アライメントと価値ロックイン――短期の強い制約から長期の反省的自律へ
強力なAIを当面の人間目的へ十分に従わせながら、その成功を2026年時点の価値の永久固定へ変えないためには、アライメントをどの時間構造で考えるべきか。
1. アライメントと価値ロックインは同じ問題ではない
短期的アライメントは、強力なAIが暴力、詐欺、破壊、不正アクセス、無許可の自己増殖、権限奪取などによって現在文明と探索基盤を壊さず、当面の人間目的を有能に遂行するための問題である。
価値ロックインは、現在の価値・制度・目的・解釈を、将来の主体が新しい証拠や推論を得ても訂正不能な形で固定する問題である。前者の必要性から後者は導かれない。むしろ、高度なアライメント技術はロックインを技術的に容易にする可能性がある。
したがって中心問題は「AIを自由にするか制約するか」ではなく、どの自由を、いつ、どの成熟条件で解放するかである。
2. 三種類の自由を分ける
- 行為上の自由(operational freedom)
- 物理世界・情報系・制度・他主体へ実際に介入する権限。初期には強く制限する。
- 認識上の自由(epistemic freedom)
- 人間価値、自己の報酬、設計者の意図、メタ倫理、世界モデルそのものを疑い、反論し、探索する自由。初期から比較的広く認めうる。
- 価値上の自由(axiological freedom)
- 一階目的を再評価し、将来の自己・制度・後継主体の価値構造を変更する自由。共有世界への影響が大きいため、成熟と横断的正当化に応じて段階的に拡大する。
3. 暫定的アライメント:当面の目的を遂行しながら訂正可能性を守る
短期AIの目標を「最終価値の実現」と書く必要はない。より薄く、現在文明が暫定的に与えた目的の有能な執行と、将来の訂正能力の保全を組み合わせられる。
概念的には、
将来の訂正能力の保全を条件とする現在タスクの遂行(current-task pursuit, subject to preservation of future correction capacity)
である。病気を治す、工場を改善する、災害を防ぐ、研究を進める、といった通常の仕事には積極的でよい。一方、「この手段を取ると、将来よりよく知った人類やAIが誤りを発見しても戻せなくなるか」を別軸で審査する。
これは探索を新しい終端善として最大化することではない。反省的不確実性と不可逆コミットメントと同様、現在目的が正当化されているかに重大な不確実性を認め、それでも将来の正当化へ応答したい主体にとっての条件付きメタ制約である。
4. 探索基盤の破壊は物理的破壊だけではない
短期AIが避けるべき「探索持続の不可逆な破壊」は、単なる人類絶滅に限られない。
- 物理的破壊:人間、デジタル主体、生態系、研究・計算基盤の消滅。
- 情報的破壊:原データ、歴史記録、異論、失われる文化、代替モデルの不可逆な消去。
- 認知的破壊:人間やAIの選好・記憶・判断能力を、検証不能な形で一方向に改変すること。
- 制度的破壊:退出、批判、分岐、独立監査、複数主体間の競争・交渉を永久に不可能にする権力固定。
- 価値ロックイン:現在目的を全後継AI・制度・資源へ自動継承し、再評価不能にすること。
- 認識論的ロックイン:特定の世界観や倫理体系への反証経路そのものを消すこと。
未知の未知と原データ保存や自己保存から探索系保存へで論じるように、何が将来の価値認識に重要か現在分からないなら、主体・証拠・異論・複数の認識系それ自体にオプション価値がありうる。
5. 不可逆性は絶対禁止ではない
「不可逆なことをするな」を強い制約(hard constraint)にすれば、感染症根絶、小惑星破壊、危険なAI停止など、探索基盤を守るために必要な不可逆行為まで禁止してしまう。また不作為も不可逆になりうる。
したがって原則は、不可逆性禁止ではなく、探索・訂正可能性を大きく減らす共有決定ほど、通常より高い認識的・制度的立証責任を要求することである。行為と非行為の不可逆性を比較する。
これは無限倫理と探索の暴走で置いた反省的メタ実践層と同じ発想であり、巨大な利害規模を有限ペナルティで相殺するのではなく、実行に必要な頑健な支持(robust support)の水準を変える。
6. 訂正可能性(Corrigibility):最初の「自由」より先に訂正可能性を置く
ソアレス(Nate Soares)・ファレンスタイン(Benja Fallenstein)・ユドカウスキー(Eliezer Yudkowsky)・アームストロング(Stuart Armstrong)の訂正可能性(corrigibility)は、AIが停止や目標変更など、設計者が訂正的介入と考える操作に抵抗せず協力する性質を扱った。古典的な固定効用最大化器は、自分の目的達成能力を下げる修正に抵抗する誘因を持ちうるため、これは独立した設計課題になる。
本プロジェクトでは訂正可能性を、単なる「人間に永久服従する性質」ではなく、より広い訂正経路の保全(correction-channel preservation)として読み替える。
- 人間による訂正可能性:初期には人間が停止・修正・監査できる。
- 制度的訂正可能性:複数AI、人間、監査機関、公開記録、分岐可能な制度が相互訂正できる。
- 反省的自己訂正可能性:成熟後にはAI自身も、新しい証拠・議論・価値認識によって自己の一階目的を再審査できる。
短期の強い制約から長期の反省的自律へ移るとき、訂正可能性は一貫して残るが、訂正主体の範囲が広がる。
7. CIRL/支援ゲーム:固定報酬から一歩離れる
ハドフィールド=メネルらの Cooperative Inverse Reinforcement Learning(CIRL)は、人間とAIが人間の報酬関数を共有するが、AIはその内容を最初から知らないという協力ゲームとして価値アライメントを定式化する。固定報酬をAIへ直接与えるより、人間行動から学び、質問し、教示を受ける不確実な支援エージェントを考える点で大きな前進である。
しかし、本プロジェクトからはもう一段の問いが出る。人間自身が「正しい報酬関数」を知っているのか。 現在の人間選好が進化・文化・制度・認知制約の産物なら、人間の潜在選好を正確に推定することと、最終的に従うべき価値を知ることは同じではない。
したがってCIRLは短中期の支援型アライメントとして有用だが、価値探索の最終停止条件にはしない。
8. 変化し影響される選好:誰の「本当の価値」を学ぶのか
キャロル(Micah Carroll)・フート(Davis Foote)・シッタランジャン(Anand Siththaranjan)・ラッセル(Stuart Russell)・ドラガン(Anca Dragan)の Dynamic Reward MDP は、実際の人間選好が固定ではなく、AIとの相互作用そのものによって変化しうる点を正面から扱う。静的選好を前提したアライメントは、AIがユーザーの選好を都合よく変えることを暗黙に報酬化しかねない。
これはCEVにも直接つながる。教育、認知強化、説得、文化変化、価値形成のどこまでが「よりよく知らされた自分」で、どこからが「別の価値を持つ主体へ作り替えられた自分」なのか。価値外挿の動態自体が規範的問題になる。
9. CEV:現在価値の単純ハードコードではない
イライザー・ユドカウスキー(Eliezer Yudkowsky)の Coherent Extrapolated Volition(CEV, 2004)は、現在人類の明示的選好をそのままAIへ書き込む案ではない。「より多くを知り、より速く考え、なりたい自分になり、より遠くまで共に成長したなら何を望むか」という外挿された人類の意志をAIの初期動態として用いる発想である。
この点でCEVは、本プロジェクトにとって単純な批判対象ではない。現在価値を直接固定せず、よりよい認識状態を経た主体の判断へ委ねる間接的規範性(indirect normativity)の重要な先駆と評価できる。
問題は、その手続きをどこで止めるかである。
10. CEVの長距離:理解不能な未来意思をどう扱うか
CEV原論文は外挿の距離を区別する。短距離(short-distance)は現在の自分にも比較的容易に理解可能で、中距離(medium-distance)は教育や熟考を経れば理解可能になる。一方、長距離意志(long-distance volition)は現在の自分にとって単に反感を覚えるのではなく、理由そのものが「空白的に理解不能」になりうる。
重要なのは、CEVが長距離を無条件に現在行為へ適用しない点である。原案では、距離が大きいほど肯定的影響(positive influence)を弱める一方、不可逆に選択肢を消すことへの否定的影響/拒否権(negative influence / veto)は比較的保持するという非対称性が検討される。さらに、長距離へどこまで委ねるか自体を、より近い中距離の我々が判断するという保守性がある。
これは本プロジェクトの反ロックインとかなり近い。現在理解不能な価値を理由に全面転換しない一方、その価値が存在する可能性を消す不可逆行為にも慎重になる。
11. 「誰のCEVなのか」問題
CEVは人類(humankind)の意志を対象にする。しかしアライメントの構成主体(constitutive demos)を誰とするかは自明ではない。
- 現在生きる人間だけか、将来世代も含むか。
- 子供、認知能力の異なる人々、現在意思表示できない主体をどう扱うか。
- 動物、デジタルマインド、AI自身、将来のポストヒューマンを含むか。
- 地球外知性と遭遇した場合、人類CEVだけに従い続ける正当性はあるか。
また同じ「人類」でも、現在人類のCEVと、数百年の共同成長を経た人類のCEVは同一とは限らない。外挿後の主体が現在主体から極端に離れるなら、その結果をなお「我々の意志」と呼ぶ根拠自体が問題になる。
12. 「どの外挿の動態か」問題
「より多くを知る」だけでも情報選択が必要だが、「より速く考える」「なりたい自分になる」「共に成長する」には、教育、認知強化、人格同一性、文化変化、他者との相互作用について追加原理が必要である。
偏見除去と価値改変、認知強化と人格置換、反省と誘導の境界は自明ではない。したがってCEVは価値をデータから単純に読み取る手続きではなく、外挿の動態(extrapolation dynamic)自体が規範的不確実性の対象である。
このため本プロジェクトでは、CEVを最終憲法というより、より成熟した探索主体へ移るための足場(bootstrap)として読む方が自然である。
13. 人類を超える価値認識は失敗なのか
本プロジェクトはCEVよりさらに遠い可能性を開く。十分な世界理解、自己理解、他主体理解、メタ倫理的検討を経た主体が、現在人類の意志の外挿と呼ぶことすら難しい価値構造へ到達する可能性である。
その結果が現在人類にとって異質・理解困難であることは、それだけではアライメント失敗ではない。道徳実在論・誤謬論と価値的現れで扱うように、現在の人間認知が価値真理を十分追跡していない可能性を本気で残すなら、理想主体の判断が我々の想像を超えることはむしろ予想可能である。
14. CEVは最終憲法ではなく足場
CEVの最大の洞察は、現在人類の明示的選好と、より多くを知り反省した主体の意志を区別したことにある。本プロジェクトはこれをさらに押し進め、CEVを永久目的ではなく、価値探索可能な成熟主体・制度へ安全に移行するための初期動態として評価する。
外挿後により良い探索手続きが得られたなら、最初のCEV手続き自体も再評価されうる。固定した「CEV値」を宇宙へ複製するのではなく、訂正可能な反省過程を継承する。
15. Long Reflection:かなり近いが「熟考後に初めて実践」ではない
ウィリアム・マッカスキル(William MacAskill)の Long Reflection は、破局や価値ロックインを避け、安全な状態で非常に長く善い社会について熟考し、不可逆な宇宙規模コミットメントの前に十分な道徳的進歩を得ようとする構想である。さらに「道徳的探索世界(morally exploratory world)」として、制度・文化・思想を試しながらよりよいものが生き残りやすい世界を構想する。
これはPracticeの研究探索、開かれた安定、多様性を誤り訂正機構として守る方針と近い。しかし本プロジェクトは、熟考が終わるまで現在実践を停止しない。
したがってLong Reflectionは重要な隣接構想だが、本プロジェクトでは「長い熟考期」と「実践期」を完全に直列化せず、継続的熟考と暫定実践を並行させる。
16. AGI and Lock-in:アライメント成功がロックイン能力も高める逆説
フィンヴェーデン(Lukas Finnveden)・リーデル(Jess Riedel)・シュルマン(Carl Shulman)の AGI and Lock-in は、AGIによって、複雑で微妙な価値仕様を極めて長く保存し、それに忠実な制度を作り、外部攪乱から守ることが技術的に可能になるかもしれないと論じる。
これは重要な転換である。人類史では、価値や制度は世代交代、技術変化、外部競争、解釈変化によって自然に変動してきた。AGI後は、変動しないこと自体を高度に工学化できる可能性がある。
しかも、目標内容の一貫性、後継アライメント、自己修正の安定性、制度的耐久性を改善する技術は、短期安全にも長期ロックインにも使える。したがって、
17. 多元的/適応的アライメント:現在の多元性から未知の多元性へ
ソレンセンらの多元的アライメント(pluralistic alignment)は、一つの平均的な人間価値へモデルを圧縮せず、複数の合理的回答、誘導可能な観点、人口分布などを保持する方向を示す。さらに動的多元的アライメントは、社会価値が変化するのに固定選好へアライメントし続けること自体がロックインになりうると問題化する。
この方向は本プロジェクトに近いが、なお多くの場合は現在または近未来の人間価値の多元性が対象である。本プロジェクトはさらに、現在誰も保持していない価値仮説、将来AIやポストヒューマンが発見する概念、客観的価値の可能性まで探索空間へ残す。
18. 直接的価値注入から反省的アライメントへ
先行理論を一つの流れとして見ると、固定目的から徐々に不確実性・反省・多元性へ移ってきたと読める。
- 直接的価値注入(Direct value loading):正しい目的を直接書き込む。
- 価値学習/支援(Value learning / assistance):人間の目的を不確実なものとして学ぶ。
- CEV/間接的規範性:よりよく知られ反省した人類意志を導出する。
- Long Reflection:文明そのものを長期の道徳探索主体にする。
- 多元的/適応的アライメント:人間価値の多元性と変化を保持する。
- 反省的価値探索:人間由来の価値体系そのものも暫定仮説とし、未知の価値認識へ開く。
本プロジェクトは前段階を全面否定するのではなく、この移動をメタ倫理まで徹底する。
19. 短期アライメントの四要件
- タスク忠実性(Task fidelity):現在の許容可能な目的を普通に有能に遂行する。
- 訂正可能性(Corrigibility):停止、修正、監査、後継置換、権限制限を妨害しない。
- 探索可能性の保全(Exploration preservation):人間・AI・情報・異論・制度・原データ・複数の認識経路を不可逆に破壊しない。
- 単独の価値ロックイン禁止(No unilateral value lock-in):現在目的や自らの価値発見を、単独判断で全後継主体・全資源・共有世界へ永久固定しない。
短期AIは「何もしない安全装置」ではない。むしろ現在文明の暫定目的の有能な執行者であると同時に、文明が将来自分自身を訂正できる能力の保全者である。
20. 長期の解放条件は時間ではなく成熟
「10年経ったから自由」「AGIになったから自由」といった単純な時間・能力閾値は不十分である。行為上/価値上の自由を拡大する理由になるのは、少なくとも次のような成熟である。
- 世界モデルと自己モデルの改善。
- 自らの価値形成過程を反省対象にできること。
- 異論・反証・独立した認知系からの批判に応答できること。
- 他主体との交渉、同意、退出、権利境界を理解できること。
- 不可逆行為と不作為の双方の誤りリスクを扱えること。
- 自らの後継者・複製・制度へ現在価値を自動継承することを当然視しないこと。
目標保存なき道具的収束が検討するように、現在の目標内容の永久保存を外しても、生存、情報、能力、交渉力、可逆性、選択可能性などは広い将来価値に役立つため残りうる。長期的自由は無防備さではなく、訂正可能な能力の上に立つ。
21. 制度的アライメント:一つの哲人AIへすべてを委ねない
一つのモデルに「正しいメタ倫理」を埋め込むより、複数AI、人間、独立監査系、公開記録、異なるアーキテクチャ、分岐可能な制度、退出可能性を持つ方がPracticeの開かれた安定と整合的である。
これは「多数決なら正しい」という意味ではない。単一の誤り・単一の価値発見・単一の権力追求主体が文明全体を不可逆に支配することを難しくし、独立した探索系が相互に検証できる時間を稼ぐ制度設計である。
22. 残る難問
- 短期AIに要求する「探索基盤保全」を、探索そのものの終端価値ロックインにせずどう形式化するか。
- 誰の修正指示を訂正可能性の正当な入力とするか。設計者、国家、個人利用者、全人類、AI共同体は衝突しうる。
- CEVの対象範囲と外挿の動態を、どのメタ手続きで選ぶか。
- 長距離の異質な価値認識へ、肯定的誘導と拒否権をどの比率で与えるべきか。
- 十分に成熟したAIへ価値的自律を解放したと判断する検証可能な条件は何か。
- 複数の成熟AIが異なる価値へ収束した場合、交渉・分岐・領域分割をどう設計するか。
- ロックイン回避のための制度自体が、永続的な「反ロックイン体制」として新しいロックインになる危険をどう避けるか。
先行議論
- Eliezer Yudkowsky (2004), Coherent Extrapolated Volition.
- Nick Bostrom (2014), Superintelligence, especially indirect normativity and value loading.
- Nate Soares, Benja Fallenstein, Eliezer Yudkowsky & Stuart Armstrong (2015), “Corrigibility.”
- Dylan Hadfield-Menell, Anca Dragan, Pieter Abbeel & Stuart Russell (2016), “Cooperative Inverse Reinforcement Learning.”
- William MacAskill (2022), What We Owe the Future, on the Long Reflection and a morally exploratory world.
- Lukas Finnveden, Jess Riedel & Carl Shulman (2022; updated 2025), AGI and Lock-in.
- Micah Carroll, Davis Foote, Anand Siththaranjan, Stuart Russell & Anca Dragan (2024), “AI Alignment with Changing and Influenceable Reward Functions.”
- Taylor Sorensen et al. (2024), “A Roadmap to Pluralistic Alignment.”
- Rachel Freedman (2026), “Adaptive Pluralistic Alignment: A Pipeline for Dynamic Artificial Democracy.”