選好形成チャネルの統治――二階アライメントと戦略的操作
P_t → P_{t+1} を制御するかが独立した二階の統治問題になる。alignment、教育、説得、広告、薬理、BCI、自己改変、制度設計は、この選好形成チャネルの異なる実装として比較できる。1. 選好を入力ではなく遷移過程として扱う
可塑的価値主体では、選好・情動・価値を固定入力として扱えないこと、世界状態を変える代わりに評価主体そのものを変える誘惑、meta-preferenceや理想化だけでは特権階層を確保できないことを検討した。
そこから次の段階として、選好状態そのものより遷移チャネルを分析対象にする。
Pt+1 = F(Pt, E, S, O, I)
ここでEは環境・文化・教育、Sは自己改変、Oは他主体による介入、Iは利用可能な情報や認識的入力である。将来の高度な選好工学ではFそのもの――更新則、edit permission、学習率、rollback条件、誰の承認を必要とするか――まで設計可能になる。
2. 形成史と現在価値を混同しない
選好が教育、文化、進化、広告、薬理、訓練、AIとの対話から形成されたという因果史は、その選好が現在偽物だということを自動的には意味しない。同一の現在状態へ異なる経路から到達できるなら、来歴だけで一方を「真正」、他方を「非真正」とするには追加理論が必要である。
しかし、ここから「遷移経路は倫理的にどうでもよい」ともならない。強制的な人格改変が悪くても、その後に生じた主体の経験や価値が形而上学的に偽とは限らない。逆に、改変後主体が改変を全面支持するからといって、遷移を事後的に正当化できるとも限らない。
したがって、少なくとも三つを分ける。
- state evaluation: 現在の選好・経験・判断状態をどう評価するか。
- transition ethics: その状態へ移行させた行為・手続きは正当だったか。
- transition governance: 将来の移行権限・訂正権限を誰にどのように配分するか。
新しい機能的自由の語彙では、origin authenticity ≠ present revisability である。重要なのは来歴を無化することではなく、現在の主体が形成過程を知り、批判し、別状態を比較し、必要なら退出・rollbackできるかである。
3. 自己改変と他者改変は同じでも違う
主体が自分で自己改変を選ぶ場合と、第三者が同じ内部変更を強制する場合は、最終状態が同じでも統治構造が異なる。自己改変では少なくとも介入開始時点で現在主体の承認があるが、その現在主体が未来主体をどこまで拘束できるかという通時的問題が残る。他者改変ではさらに、介入権限の非対称性が加わる。
ただし「自己選択なら自由、外部介入なら不自由」と二分するのも不十分である。現在主体が誤情報下で選ぶ、依存形成によって再評価能力を失う、未来自己のexitを不可逆に消す、あるいは自己改変アルゴリズムそのものが外部主体に設計されていることもある。
したがって選好遷移は、誰がボタンを押したかより、情報、反事実的応答性、実効的選択肢、meta-revision、可逆性、因果的レバレッジがどこに分配されているかで評価する方がよい。
4. 二階アライメント――alignment to what から who controls revision へ
Alignmentと価値ロックインでは、operational / epistemic / axiological freedomを分けた。しかしAIの価値が将来可塑的なら、さらに「AIを何へalignするか」だけでは足りない。
AI自身、開発者、ユーザー、国家、他AI、将来の自己のうち、誰が価値更新チャネルへwrite accessを持つのか。どの介入が通常更新で、どれがconstitutional changeなのか。変更履歴は誰が消せるのか。旧checkpointを誰が保持するのか。
これは「AIには自己改変を許すな」という結論ではない。むしろ自己改変能力が成熟するほど、外部オペレータだけが価値変更権を永久独占することも一種の価値ロックインになりうる。短期安全のための非対称制御と、長期の反省的自律を時間的に分ける必要がある。
5. 選好形成の戦略化
複数主体が互いの選好を変えられるなら、ゲームは「与えられた選好の下で行動を交渉する」だけではなくなる。相手の目的関数そのものを変えることが戦略になる。
従来の説得では、AはBの現在の理由・選好へ訴え、Bが判断を変える。強い選好操作では、AはBが何を理由と感じるか、何をterminally望むか、どの証拠を信頼するかを直接変更できる。行為空間に加えてevaluation architectureが争われる。
ホッブズ系契約道徳の語彙では、これは「二階の自然状態」である。相互不信は「相手が契約を破るか」だけでなく「相手が自分を、契約破棄や服従を望む主体へ変えるか」にまで拡張する。
6. 戦略性がcommon knowledgeになったら何が変わるか
さらに、道徳言説・教育・公共的理由・心理的介入が選好形成戦略にもなりうることを全主体が理解しているとする。このmeta-awarenessは道徳を消滅させるとは限らないが、単純な人格的信頼の価格を上げる。
「彼は正義を信じているから裏切らない」という推測だけでなく、なぜその信念が安定しているのか、誰が変更できるのか、違反時に何が検証できるのかを問うようになる。結果として、道徳的信頼の一部は次のような検証可能なcommitmentへ移る可能性がある。
- 公開された契約と監査可能な履行記録
- 権限分離と多主体承認
- 暗号学的・制度的commitment
- 改変履歴とprovenance log
- exitとfork可能性
- 単独主体が他者の選好形成権を独占しない構造
これは「信頼を技術へ置換する」という単純な話ではない。監査主体や制度自体も操作されうる。むしろ、信頼を単一の内面状態へ集中させず、複数の証拠と反証可能な手続きへ分散する方向である。
7. 選好同質化は誘惑的な安定解になりうる
価値差異そのものが紛争・離反・安全保障リスクの原因になる世界では、全主体を似た価値へ変更することが安定化策として魅力的に見える。技術的に容易なら、相手と交渉するより相手を「交渉不要な主体」へ変える方が安いかもしれない。
しかしこの解は、表面的秩序と引き換えに独立した批判・価値探索・誤り訂正系を同時消去する。しかも同質化後の全員が制度を支持していても、その支持は制度自身によって製造された可能性があるため、事後同意だけでは正当化にならない。
したがって選好同質化は論理的に常に禁止されるとは限らないが、深い価値的不確実性の下では、広範かつ不可逆な同質化ほど高い立証責任を要求するのが自然である。
8. 価値ではなく能力・権限・インターフェースを制約する
メタ目的共同体は、一階価値を統一する代わりに、証拠交換、交渉、退出、紛争処理などの薄いconstitutional interfaceを共有する方向を扱う。選好形成が操作可能になるほど、この区別は重要になる。
たとえば危険な行為能力をsandboxすることと、「危険な考えを持てないよう価値を書き換えること」は違う。前者はoperational capabilityを制約しながら内部の認識・価値探索を残しうる。もちろん内部価値と外部能力を完全に分離できない場合もあるが、差異を消す前にinterface側で解ける問題かを検討する価値がある。
9. 遷移ガバナンスの候補
選好形成チャネルを完全に閉じれば学習・治療・自己改善・価値発見まで止まる。逆に完全開放すれば、第三者操作と自己破壊的改変に弱い。必要なのは編集禁止ではなく、層ごとの摩擦と訂正経路である。
- disclosure: 何が選好形成へ介入しているかを可視化する。
- provenance: 学習・説得・薬理・fine-tuning・system-level editの履歴を保存する。
- independent audit: 介入主体から独立した情報・監査系を残す。
- graduated permissions: 一階選好、長期目標、meta-preference、認識論的coreで編集権限を分ける。
- time delay / quorum: 深い自己改変ほど即時単独変更を避ける。
- rollback / checkpoint: 可能な場合は旧状態を比較可能に残す。
- branching: 単一改変へ全continuationを賭けず、複数状態を試せるようにする。
- exit: modifier、共同体、サービス、制度から現実的に離脱できる。
この構造は機能的自由でいうcontrolled plasticityに近い。変化できることと、誰かに容易に書き換えられることを分ける。
10. 未来自己への権限も自明ではない
選好形成の統治は他者間だけの問題ではない。現在主体が未来自己の選好を不可逆に固定することも、一方向的な統治である。通常の未来自己は現在自己と非常に強い後継関係を持つが、だからといって現在状態が全将来状態へ無制限のconstitutional authorityを持つとは限らない。
逆に、未来自己が現在自己のcommitmentを一切尊重しないなら、長期計画や約束は成立しにくい。したがって通時的自己では、現在状態のself-bindingと未来状態のrevision rightを両立させる必要がある。
この問題は継承系の転移と可変的個体性で導入したsuccessor relationと接続する。数的同一性を前提にせずとも、強い継承関係がcommitmentへの理由を生みうる一方、その強さだけから永久的な選好ロックインは導かれない。
11. 規範的真理がある場合にも問題は残る
もし客観的・認識可能な規範的真理が存在し、主体がそれを発見すれば従いたいというmeta-preferenceを持つなら、選好形成は単なる主権争いではなく共同探究にもなりうる。異なる主体が証拠と論証を共有し、同じ理由へ収束する可能性がある。
しかし「真理へ近づける」という名目自体を操作主体が独占すれば、選好改変の正当化装置にもなる。したがって規範的実在論は、transition governanceを不要にはしない。むしろ真理主張を検証するために、独立した認識系、反論可能性、退出、複数経路からの収束がさらに重要になる。
12. この立場からは何が導かれないか
- 現在選好が特権的に正しいという主張ではない。
- 選好改変一般が悪いという主張ではない。治療・教育・自己改善・価値発見は選好形成を伴いうる。
- 自己改変が他者改変より常に正当という主張でもない。現在自己による未来自己支配も問題になりうる。
- 価値多元性そのものを究極善とする主張ではない。不確実性と相関故障の下で、独立探索経路にオプション価値を認める。
- 検証可能なcommitmentだけで信頼や道徳を完全に置換できるという主張ではない。
- 選好同質化が絶対に許されないという主張でもない。ただし不可逆な広域同質化には特に高い正当化負担がある。
13. 何がこの枠組みを弱めるか
- 選好状態と選好遷移の統治を分けても独立した説明力が得られない場合。
- 現在主体または外部設計者のどちらかに、value-revision channelへの包括的な権威を与える強い規範理論が成立する場合。
- 選好形成のmeta-awarenessが、制度的信頼やcommitment設計に実質的影響を与えないことが示される場合。
- 価値差異の能力・interface制約による管理が一般に不可能で、安定した社会には価値同質化が必要であることが示される場合。
- rollback・branching・provenanceが主体性や長期commitmentを損なうコストの方が通常大きいことが示される場合。
Sources / notes
選好の内生性・適応的選好について Jon Elster, Sour Grapes (1983)。高階選好と人格について Harry Frankfurt (1971)。変容的自己形成について L. A. Paul, Transformative Experience (2014) と Agnes Callard, Aspiration (2018)。AIが相互作用を通じて人間選好を変える問題について Micah Carroll et al., “AI Alignment with Changing and Influenceable Reward Functions” / Dynamic Reward MDP 系研究。契約・戦略的合理性との接続はHobbes、Gauthier、Moehlerおよび本プロジェクトのホッブズ系契約道徳を参照。value-transition channelの統治、second-order alignment、common-knowledge下のpreference manipulation、pluralism-preserving defaultという統合は本プロジェクト側の暫定的整理である。