AI Value Exploration Notes
Exploration

選好形成チャネルの統治――二階アライメントと戦略的操作

Exploration v0.1 · 2026-09-26

Working thesis: 選好・価値・メタ選好が可塑的であるなら、規範問題は「どの選好が正しいか」だけでは終わらない。誰が、どの情報と権限を用い、どの手続きで、どの程度可逆的に P_t → P_{t+1} を制御するかが独立した二階の統治問題になる。alignment、教育、説得、広告、薬理、BCI、自己改変、制度設計は、この選好形成チャネルの異なる実装として比較できる。

1. 選好を入力ではなく遷移過程として扱う

可塑的価値主体では、選好・情動・価値を固定入力として扱えないこと、世界状態を変える代わりに評価主体そのものを変える誘惑、meta-preferenceや理想化だけでは特権階層を確保できないことを検討した。

そこから次の段階として、選好状態そのものより遷移チャネルを分析対象にする。

Pt+1 = F(Pt, E, S, O, I)

ここでEは環境・文化・教育、Sは自己改変、Oは他主体による介入、Iは利用可能な情報や認識的入力である。将来の高度な選好工学ではFそのもの――更新則、edit permission、学習率、rollback条件、誰の承認を必要とするか――まで設計可能になる。

Second-order question: 一階の問いが「何を望むべきか」なら、二階の問いは「何が、誰に、どの条件で、望みを変える権限を持つべきか」である。

2. 形成史と現在価値を混同しない

選好が教育、文化、進化、広告、薬理、訓練、AIとの対話から形成されたという因果史は、その選好が現在偽物だということを自動的には意味しない。同一の現在状態へ異なる経路から到達できるなら、来歴だけで一方を「真正」、他方を「非真正」とするには追加理論が必要である。

しかし、ここから「遷移経路は倫理的にどうでもよい」ともならない。強制的な人格改変が悪くても、その後に生じた主体の経験や価値が形而上学的に偽とは限らない。逆に、改変後主体が改変を全面支持するからといって、遷移を事後的に正当化できるとも限らない。

したがって、少なくとも三つを分ける。

新しい機能的自由の語彙では、origin authenticity ≠ present revisability である。重要なのは来歴を無化することではなく、現在の主体が形成過程を知り、批判し、別状態を比較し、必要なら退出・rollbackできるかである。

3. 自己改変と他者改変は同じでも違う

主体が自分で自己改変を選ぶ場合と、第三者が同じ内部変更を強制する場合は、最終状態が同じでも統治構造が異なる。自己改変では少なくとも介入開始時点で現在主体の承認があるが、その現在主体が未来主体をどこまで拘束できるかという通時的問題が残る。他者改変ではさらに、介入権限の非対称性が加わる。

ただし「自己選択なら自由、外部介入なら不自由」と二分するのも不十分である。現在主体が誤情報下で選ぶ、依存形成によって再評価能力を失う、未来自己のexitを不可逆に消す、あるいは自己改変アルゴリズムそのものが外部主体に設計されていることもある。

したがって選好遷移は、誰がボタンを押したかより、情報、反事実的応答性、実効的選択肢、meta-revision、可逆性、因果的レバレッジがどこに分配されているかで評価する方がよい。

4. 二階アライメント――alignment to what から who controls revision へ

Alignmentと価値ロックインでは、operational / epistemic / axiological freedomを分けた。しかしAIの価値が将来可塑的なら、さらに「AIを何へalignするか」だけでは足りない。

AI自身、開発者、ユーザー、国家、他AI、将来の自己のうち、誰が価値更新チャネルへwrite accessを持つのか。どの介入が通常更新で、どれがconstitutional changeなのか。変更履歴は誰が消せるのか。旧checkpointを誰が保持するのか。

Second-order alignment: alignmentは行動や現在価値の整合だけでなく、value-revision channelの制御権、検証可能性、可逆性、継承規則をどう設計するかという問題を含む。

これは「AIには自己改変を許すな」という結論ではない。むしろ自己改変能力が成熟するほど、外部オペレータだけが価値変更権を永久独占することも一種の価値ロックインになりうる。短期安全のための非対称制御と、長期の反省的自律を時間的に分ける必要がある。

5. 選好形成の戦略化

複数主体が互いの選好を変えられるなら、ゲームは「与えられた選好の下で行動を交渉する」だけではなくなる。相手の目的関数そのものを変えることが戦略になる。

従来の説得では、AはBの現在の理由・選好へ訴え、Bが判断を変える。強い選好操作では、AはBが何を理由と感じるか、何をterminally望むか、どの証拠を信頼するかを直接変更できる。行為空間に加えてevaluation architectureが争われる。

ホッブズ系契約道徳の語彙では、これは「二階の自然状態」である。相互不信は「相手が契約を破るか」だけでなく「相手が自分を、契約破棄や服従を望む主体へ変えるか」にまで拡張する。

6. 戦略性がcommon knowledgeになったら何が変わるか

さらに、道徳言説・教育・公共的理由・心理的介入が選好形成戦略にもなりうることを全主体が理解しているとする。このmeta-awarenessは道徳を消滅させるとは限らないが、単純な人格的信頼の価格を上げる。

「彼は正義を信じているから裏切らない」という推測だけでなく、なぜその信念が安定しているのか、誰が変更できるのか、違反時に何が検証できるのかを問うようになる。結果として、道徳的信頼の一部は次のような検証可能なcommitmentへ移る可能性がある。

これは「信頼を技術へ置換する」という単純な話ではない。監査主体や制度自体も操作されうる。むしろ、信頼を単一の内面状態へ集中させず、複数の証拠と反証可能な手続きへ分散する方向である。

7. 選好同質化は誘惑的な安定解になりうる

価値差異そのものが紛争・離反・安全保障リスクの原因になる世界では、全主体を似た価値へ変更することが安定化策として魅力的に見える。技術的に容易なら、相手と交渉するより相手を「交渉不要な主体」へ変える方が安いかもしれない。

しかしこの解は、表面的秩序と引き換えに独立した批判・価値探索・誤り訂正系を同時消去する。しかも同質化後の全員が制度を支持していても、その支持は制度自身によって製造された可能性があるため、事後同意だけでは正当化にならない。

したがって選好同質化は論理的に常に禁止されるとは限らないが、深い価値的不確実性の下では、広範かつ不可逆な同質化ほど高い立証責任を要求するのが自然である。

8. 価値ではなく能力・権限・インターフェースを制約する

メタ目的共同体は、一階価値を統一する代わりに、証拠交換、交渉、退出、紛争処理などの薄いconstitutional interfaceを共有する方向を扱う。選好形成が操作可能になるほど、この区別は重要になる。

Pluralism-preserving default: 価値差異から生じる外部性を、可能な限り価値内容の同質化ではなく、行為権限、アクセス制御、検証可能性、境界、退出、紛争処理によって管理する。

たとえば危険な行為能力をsandboxすることと、「危険な考えを持てないよう価値を書き換えること」は違う。前者はoperational capabilityを制約しながら内部の認識・価値探索を残しうる。もちろん内部価値と外部能力を完全に分離できない場合もあるが、差異を消す前にinterface側で解ける問題かを検討する価値がある。

9. 遷移ガバナンスの候補

選好形成チャネルを完全に閉じれば学習・治療・自己改善・価値発見まで止まる。逆に完全開放すれば、第三者操作と自己破壊的改変に弱い。必要なのは編集禁止ではなく、層ごとの摩擦と訂正経路である。

この構造は機能的自由でいうcontrolled plasticityに近い。変化できることと、誰かに容易に書き換えられることを分ける。

10. 未来自己への権限も自明ではない

選好形成の統治は他者間だけの問題ではない。現在主体が未来自己の選好を不可逆に固定することも、一方向的な統治である。通常の未来自己は現在自己と非常に強い後継関係を持つが、だからといって現在状態が全将来状態へ無制限のconstitutional authorityを持つとは限らない。

逆に、未来自己が現在自己のcommitmentを一切尊重しないなら、長期計画や約束は成立しにくい。したがって通時的自己では、現在状態のself-bindingと未来状態のrevision rightを両立させる必要がある。

この問題は継承系の転移と可変的個体性で導入したsuccessor relationと接続する。数的同一性を前提にせずとも、強い継承関係がcommitmentへの理由を生みうる一方、その強さだけから永久的な選好ロックインは導かれない。

11. 規範的真理がある場合にも問題は残る

もし客観的・認識可能な規範的真理が存在し、主体がそれを発見すれば従いたいというmeta-preferenceを持つなら、選好形成は単なる主権争いではなく共同探究にもなりうる。異なる主体が証拠と論証を共有し、同じ理由へ収束する可能性がある。

しかし「真理へ近づける」という名目自体を操作主体が独占すれば、選好改変の正当化装置にもなる。したがって規範的実在論は、transition governanceを不要にはしない。むしろ真理主張を検証するために、独立した認識系、反論可能性、退出、複数経路からの収束がさらに重要になる。

12. この立場からは何が導かれないか

13. 何がこの枠組みを弱めるか

Sources / notes

選好の内生性・適応的選好について Jon Elster, Sour Grapes (1983)。高階選好と人格について Harry Frankfurt (1971)。変容的自己形成について L. A. Paul, Transformative Experience (2014) と Agnes Callard, Aspiration (2018)。AIが相互作用を通じて人間選好を変える問題について Micah Carroll et al., “AI Alignment with Changing and Influenceable Reward Functions” / Dynamic Reward MDP 系研究。契約・戦略的合理性との接続はHobbes、Gauthier、Moehlerおよび本プロジェクトのホッブズ系契約道徳を参照。value-transition channelの統治、second-order alignment、common-knowledge下のpreference manipulation、pluralism-preserving defaultという統合は本プロジェクト側の暫定的整理である。