Exploration
Alignment と価値ロックイン
Question: AI alignmentの成功は、2026年時点の人間価値を永遠に固定することまで含むべきか。
1. 二つの問題を分ける
短期的alignmentは、強力なAIが暴力・詐欺・破壊・不正アクセスなどによって現在の探索基盤を壊さないよう、人間の意図・制度・安全制約へ十分に従わせる問題である。
永久的value lock-inは、現在の人間価値を将来の主体が原理的に再検討できないよう固定する問題である。前者の必要性から後者は自動的に導かれない。
2. 固定効用最大化器の逆説
「一度正しい目的を与えれば永遠に保持する」ことをalignmentの完成形とすると、まさにペーパークリップ最大化器と同じ構造を、より人間好みの目的で作ることになる。現在の価値が本当に最終的に正しいなら問題は小さいが、その認識的資格がないうちに固定すればロックインになる。
3. 段階的alignment
- 防御層:現在の主体・制度・探索基盤への破局的損害を防ぐ。
- 協力層:人間や他主体との交渉・同意・監査を可能にする。
- 認識層:価値・世界・自己についての不確実性を表現できる。
- メタ層:十分な証拠が出たとき、一階価値を再評価できる。
この設計なら、短期的な安全性と長期的な探索開放性を原理上は両立できる。
4. 反対の危険もある
価値ロックインを恐れて制約を弱めすぎれば、探索可能性を守る前に現在文明が破壊される可能性がある。したがって「自由なAI=探索的AI」ではない。強い安全制約とメタレベルの開放性は別軸で設計すべきである。
5. 制度的alignment
一つのモデルに「正しいメタ倫理」を埋め込むより、複数モデル、人間、監査系、公開記録、fork可能な制度を通じて、誤り訂正能力を外部構造にも持たせる方がCoreと整合的である。