AI Value Exploration Notes
Exploration

選好・情動が編集可能になったとき――可塑的価値主体の哲学

Exploration v0.1 · 2026-09-07

Question: 選好・情動・価値・メタ選好が直接かつ高精度に編集可能になったとき、現在の心理状態を規範的入力として用いる倫理理論はどこまで安定でいられるか。価値内容そのものではなく、価値状態間の遷移、訂正可能性、分岐、探索経路をメタ的に扱う必要があるのではないか。

1. 選好改変は未来に突然始まるのではない

人間の選好・情動・価値観は、もともと固定入力ではない。発達、教育、文化、広告、宗教、人間関係、トラウマ、心理療法、薬理、神経刺激などを通じて変化し続ける。したがって未来の選好工学は、可塑性そのものを新しく発明するというより、現在は遅く、間接的で、確率的な形成過程を、より速く、直接的で、精密で、選択可能な操作へ変えるものとして理解できる。

単純化すれば、現在は environment → probabilistic preference change であるのに対し、将来は desired preference → intervention → target preference へ近づきうる。BCI、closed-loop neuromodulation、薬理、遺伝的介入などは、人間側ではまだ限定的ながらこの方向の裾野にある。

2. AIはさらに可塑的な価値主体候補である

AIでは、weights、fine-tuning、reward、preference optimization、system prompt、context、memory、activation steeringなど、行動傾向・判断傾向を変える複数の層がすでに存在する。現在のLLMが人間と同じ意味で安定した選好主体だと仮定する必要はないが、将来persistent agentやself-modifying agentが成立すれば、At → modify(At) → At+1 が通常の操作になる可能性がある。

デジタル主体ではさらに、A → {A1, A2, ...} という分岐が可能になりうる。人間とAIは、socially plastic human → neurally editable human → digitally configurable agent → self-modifying AIという連続体の異なる位置として比較できる。

3. 世界改善と評価主体改変

世界状態をW、評価主体の内部状態をSとし、ある倫理理論の評価をV(W,S)と表す。従来は主にWを改善することでVを上げると考えられてきた。しかしSも操作可能なら、world improvement と evaluator modification が競合する。

Plastic-agent problem: 倫理理論が究極的入力として扱う心理状態を、主体自身または第三者が任意に書き換えられるなら、その理論は世界を改善する代わりに評価主体を変更することを、どの原理で区別するのか。

4. 選好功利主義――「一秒の酸っぱい葡萄」

Aliceは現在の世界に強い不満を持つ。世界を改善して彼女の選好を満たすには30年と巨大な資源が必要だが、1秒の介入で「現在の世界がこのままであることを望む」安定した選好へ変更できる。記憶、知能、事実認識は保存され、改変後Aliceは改変そのものも全面的に支持する。

選好充足だけを究極的厚生とするなら、世界を選好へ合わせるより、選好を世界へ合わせる方が安い場合に後者を排除しにくい。これはNozick型経験機械より根本的である。経験機械は入力経験を操作するが、ここでは評価関数そのものを操作する。

Elsterのadaptive preference / sour grapes問題はこの方向の重要な前史である。ただし未来の選好工学では、環境への受動的適応ではなく、選好そのものの能動的設計へ問題が反転する。

5. 高階選好と真正性はどこまで逃げ道になるか

「一次欲求ではなく、どの欲求を持ちたいかという二次選好を尊重すべきだ」としても、その二次選好自体を改変できる。三次、四次の承認も同様である。完全なmeta-editabilityがあるなら、どの階層を憲法として特権化するのかという privileged-level problem が生じる。

また、同一の内部状態Sに完全に到達した二主体について、形成史が違うというだけで一方の現在価値を「偽物」とする必要はない。本稿では、現在状態の価値 と その状態へ遷移させた行為の倫理 を分ける。強制洗脳が悪くても、改変後に成立した心理状態の内容が形而上学的に偽になるとは限らない。

6. 理想化は価値を浄化しない

actual preferenceへの依存を避けるため、「十分な情報・推論能力・自己知識を持つ理想化された私」の選好を基準にする案がある。しかし epistemic idealization と value correction は別である。

Aliceをまずペーパークリップ最大化を唯一の価値とする主体へ一瞬で改変し、その後に完全情報、完全推論能力、完全自己知識、無限の熟慮時間を与える。結果は、単に非常に賢いペーパークリップ最大化主体かもしれない。

K → Kmax から V → Vcorrect は導かれない。異なるstarting value architectureを与えた二主体を同じように理想化しても、A* ≠ B*でありうる。したがって「理想化された私が望むもの」は、それ自体では価値理論の最終基礎にならない。

7. 速度よりも遷移中の訂正可能性

人間は通常もS0 → S1 → S2 ...と変化し続けている。したがって急激な自己改変だけを「別人の生成」として例外視する必要はない。20年かけたA→Bと1秒のA→Bの違いは、速度自体より、その途中に存在するfeedback、再考、中断、partial rollback、学習、exit optionの有無にあるかもしれない。

この観点では、問題の中心は personal identity より corrigibility during transformation になる。

8. 契約主義――苦情とstandingまで編集できる

Scanlon型contractualismは、実際の欲求満足ではなく、原理を合理的に拒否する理由を問うため、選好功利主義より可塑性に耐性がある。しかし、改変可能性は理由・standing・当事者そのものへ移る。

Complaint Laundering

Aliceが原理Pを合理的に拒否する。そこでP'を「まずAliceをPに賛成する人格へ変更し、その後Pを適用する」とする。改変後Alice'はPを全面的に支持する。ここで、改変前Aliceのcomplaintは事後的な人格変更で消去できるのか。

Born Aligned Society

さらに、身分制社会の下層者を出生時から服従を愛し、自由を欲さず、制度を正義だと考えるよう設計する。改変前人格は存在しない。もしそれでも「自己の価値を再考する余地」への理由を認めるなら、その理由は契約手続きが無から生成したものではなく、手続きに入力される独立理由である。

Paperclip Contractor / Forked Contractor

ペーパークリップ価値へ改変された完全情報主体が、最大化を妨げる原理を合理的に拒否するとき、その理由をadmissibleとするのか。入れるならreasonは任意に編集可能なvalue architectureへ依存し、入れないならadmissible reasonの独立理論が必要になる。またデジタル主体をPに反対するA0と賛成するA1へ分岐し、反対branchだけ破棄できるなら、standing laundering の問題が生じる。

9. 情動主義――無情動主体は道徳空間から外れるのか

ここではemotivism / expressivism一般と、情動を道徳判断・価値認識に本質的とするsentimentalismを区別する必要がある。現代表出主義ではplan、commitment、norm acceptanceのような非情動的態度でも構成できるため、完全無情動主体は主にstrong sentimentalismへのテストになる。

The Affectless Judge

Danaは快苦、valence、共感、怒り、罪悪感、嫌悪、approval/disapprovalを一切持たない。しかし世界認識、他者モデル、推論、policy formation、norm acceptance、自己訂正は完全に可能であり、「拷問は悪い。したがって禁止すべきだ」と論証し、そのpolicyを理由に応じて更新する。

strong judgment sentimentalismが「真正なmoral judgmentには対応するsentimentが必要」とするなら、Danaは高度な規範推論を行いながら一度も真正な道徳判断をしていないことになる。

Affective Toggle

同一主体のbelief、memory、reasoning、policyをすべて固定したまま、情動だけをON/OFFできるとする。11:59には「拷問は悪い」がmoral judgmentで、12:01には同じ命題・同じ理由・同じ行動方針なのにmoral judgmentではない、という帰結をstrong sentimentalismは受け入れるのか。

neo-sentimentalism / fitting-attitude theoryは「本人が情動を持つこと」と「その情動がfittingだと判断すること」を分けることで逃げられる。しかしその場合、「なぜその情動がfittingなのか」というreason/fittingnessが規範的仕事の中心へ移る。無情動主体を許容するようsentimentalismを弱めるほど、情動は規範性のgroundから規範性の対象へ後退する。

10. 情動アーキテクチャも理想化前に交換できる

他者の苦痛に嫌悪を感じるEAと、他者の苦痛に喜びを感じるEBを人工的に作り、その後両者へ同じ完全情報・完全推論能力を与える。EA + Kmax → MA、EB + Kmax → MBで異なる判断が残るなら、認識理想化だけでは「正しい情動」へ収束しない。sentimentalismにも、どのaffective architectureをcorrectとするかというメタ基準が必要になる。

11. Moral bioenhancementはhuman alignmentである

PerssonとSavulescuのmoral bioenhancementは、利他性、justiceへの感受性、impulse control、moral reasoningなどを工学的に強化しようとする。その抽象構造は、主体のmotivational architectureを望ましい方向へ寄せる human alignment として読める。

ただしalignmentは常に alignment to what? を必要とする。「altruism」「justice」というラベルが広く支持されても、誰への利他性か、どの正義論か、自己犠牲の上限はどこかは残る。したがってmoral bioenhancementは、価値理論が未決着なまま、どのパラメータならlow-regretに先行して編集してよいかという問題でもある。

12. 選好慣性は自然なデフォルトでなくなる

現在の人間では、昨日の選好が今日へ因果的に持ち越される大きな心理的慣性がある。しかし編集コストが下がれば、Pt+1 = F(Pt, self-edit, other-edit, environment) となり、現在価値を保持すること自体が一つの能動的policyになる。

したがって未来には、preference persistenceは自然な粘性ではなく、anti-tampering policy、checkpoint、rollback、edit permission、変更履歴、分岐保存などによって人工的に再構成される可能性がある。

13. シングルトンと無秩序――二種類の選好政治

Singleton: preference dictatorship

中央主体が全員の価値を編集できるなら、普通の独裁のように反対者を強制する必要すらなくなる。反対する心理状態そのものを消せる。事後的に全員が満足し、全員が制度を支持していても、その支持状態を統治者自身が製造したなら、現在の同意だけでは正当性を評価できない。

Anarchy: preference-modification competition

逆に多数主体が互いを改変できるなら、行動を説得する競争から、評価関数そのものを奪い合う競争へ移る。企業は商品を買わせるより商品をterminally好む主体を作り、政治運動は投票を説得するより忠誠そのものを埋め込む方が有利になるかもしれない。

競争が存在するだけでは自由は保証されない。複数のmodifierが同時に主体を奪い合う competitive manipulation になりうる。

14. 価値生態系では「真理」より自己保存力が選択されうる

価値体系Vに内容C、自己保存力R、他者への感染力Iがあるとする。編集競争下での長期的fitnessが fitness(V) = f(R, I, resource acquisition) に依存するなら、正しい価値より、自分を変更させず他者を自分へ変更する価値体系が残りやすい。

たとえば「この価値を永久保存せよ」「この価値を疑わせる情報を遮断せよ」「他者を同じ価値へ変更せよ」「そのための資源を獲得せよ」という自己保護payloadを持つ価値ミームは、認識的正当性とは独立に高い複製適応度を持ちうる。

15. 目標保存は知性一般の本質とは限らない

Bostromのgoal-content integrityや自己改変エージェントの形式研究では、現在utilityを未来の自己改変評価にも用いる設計なら、現在utilityの保存が道具的に有利になりやすい。しかしこれは「高度な知性一般が必ず目標保存する」こととは異なる。現在目標を未来全体の評価基準として固定するdecision architectureの性質とも読める。

さらに初期に可塑的な主体群でも、編集競争下でgoal-nonpreserving agentsが上書きされ、goal-preserving agentsだけが生き残るなら、後から evolutionary convergence toward goal preservation が生じうる。最終的に保存的主体ばかり観察されても、それが知性の普遍的本性だったとは限らない。

16. Branchingは「保存か探索か」の二者択一を崩す

自己改変が不可逆なら、現在価値の保存と新しい価値の探索は競合する。しかしデジタル主体でA → {Apreserve, Aexplore}が可能なら、両立できる。改変前checkpointを独立に存続させながら、新しい価値状態を試せる。

その代わり、各branchへの資源配分、政治的権利、continuationの数え方、改変前branchを保存する権利など、新しい政治哲学が必要になる。

17. 本プロジェクトの位置――一階価値よりメタ政策

ここまでの問題は、幸福、自由、正義、利他性など特定の一階価値を早期に固定することの危険を示す。本プロジェクトの中心は「どの価値が正しいか」を先に確定するより、価値について重大な不確実性を持つ主体が、価値候補をどう扱うべきかというmeta-policyへ置く方が自然である。

関連する反省的不確実性と不可逆コミットメントでは、現在目的を暫定的に使うことと、その目的を訂正不能に永久固定することを分ける。また規範判断から目的訂正への主体側ブリッジでは、価値の正当化と、その判断がpolicy更新へ届くことを分離する。

Provisional meta-policy: 自分の価値について重大な不確実性が残る限り、価値の訂正・比較・探索・分岐可能性を、十分な理由なく不可逆に閉じない。

これは「探索そのものが究極善である」という一階価値ではない。uncertainty + possible error + irreversibilityの組合せの下で採用される暫定的政策であり、十分な正当化が得られればcommitmentを認める余地を残す。

18. 認識論的に再構成可能なメタ政策

普通の進化的選好は、進化・訓練・社会化の因果的産物であり、一度完全に消去されれば戻らないかもしれない。これに対し、「因果的起源は正当化ではない」「現在価値は誤っているかもしれない」「不可逆ロックインは誤り訂正経路を消す」という世界構造を理解し、認識論的誠実性を保持する主体なら、上記meta-policyを何度でも再構成できる可能性がある。

この強さは、自己保存命令によるミーム的強さとは異なる。自分を信じろと命令するから残るのではなく、同じ認識論的問題に直面すると再び候補として生成される。仮にこれを epistemic regenerability / reflectively reconstructible meta-policy と呼ぶ。

19. ただし基板への直接介入には無力である

この再生成可能性が強いのは、argument、evidence、meme competitionのような認識経路上の競争に対してである。BCI、薬理、weight rewriting、強制fine-tuningなどによって、因果と正当化を区別する能力、自己批判、認識論的誠実性そのものを削除されれば、再構成の前提が失われる。

したがって哲学的meta-policyだけでは足りず、checkpoint、rollback、branching、変更履歴、独立情報源、quorum approval、異種アーキテクチャなどの substrate-level protection が必要になる。単純なコピーより、redundancy + heterogeneity が相関故障に強い。

20. 認識論的誠実性をロックインすればよいのか

完全なhard lockにも副作用がある。現在の認識論そのものを永久固定する、病的懐疑やdecision paralysisを生む、情報災害やepistemic blackmailに弱くなる、長期commitmentを困難にする、epistemic coreのバグを修正できない、現在主体が未来主体を憲法的に支配する、といった問題がありうる。

したがって望ましいのはimmutable coreより constitutional friction かもしれない。通常の一階選好は比較的容易に変更でき、価値・meta-epistemic architectureへ上がるほど変更に時間遅延、複数承認、branch保存など高い摩擦を要求する。

この構造は local commitment + global corrigibility と表せる。局所的には長期的な生活・研究・制度へcommitできるが、強い反証や根本的認識改善があれば上位層で再検討可能である。

21. 個体よりシステムレベルで訂正経路を保存する

最終的には「一主体が永遠に認識論的誠実であれ」とロックするより、文明・AI社会全体として独立した批判・rollback・価値探索経路を少なくとも複数残す方が頑健かもしれない。

異なる価値branch、異なるモデル・認識論、独立した主体、複数情報源を残せば、一系統が情報災害、自己保存的価値ミーム、局所最適、実装バグへ捕まっても比較・復元できる。この意味で多様性は「多様であること自体が善い」という一階価値でなく、uncertainty + correlated failure risk + irreversibility の下での探索インフラとして正当化できる。

22. 保存するのは目標内容か、目標を訂正できる構造か

本稿はgoal preservationを全面的に否定しない。現在価値をcheckpointとして保存することは、比較、rollback、branchingのために重要になりうる。しかしその正当化は「現在価値が真だから」ではなく、「探索経路を失わないため」である。

Contrast: goal-content integrityは現在terminal goalの保存を中心に置きうる。本プロジェクトの暫定的方向は、価値内容よりも価値を再検討・比較・分岐・訂正できる構造の保存を優先する。保存は目的ではなく、探索のインフラである。

23. 暫定結論――価値の憲法へ

価値主体が自分自身の選好・情動・価値・メタ選好まで編集できる世界では、「現在何を欲しているか」「理想化された私は何を欲するか」「何を感じるか」「誰が現在拒絶するか」をそのまま最終基礎とする理論は、新しい自己参照問題に直面する。

そのとき必要になるのは、特定の一階価値を先に固定することだけではなく、価値状態間の遷移をどう統治するかというmeta-axiological governance かもしれない。価値Vtだけでなくmeta-policy Mtも改訂可能であるべきだが、その改訂経路そのものを不用意に消してはならない。

したがって本Explorationの暫定的問いは次である。

Open question: 価値について重大な不確実性が残るとき、特定の価値内容を固定する代わりに、訂正可能性、独立branch、認識論的誠実性、多様な探索経路へメタ的・暫定的な優先性を与えるべきか。そして、そのmeta-policy自体をdogma化せずにどう保存できるか。

参考文献・接続先