AI Value Exploration Notes
Thesis

規範判断から目的訂正への主体側ブリッジ

Working thesis v0.6 · 2026-09-05

Thesis: 規範的正当化と、その判断が実際の目的・policy更新へ届くことは別問題である。外在主義では正当化志向として明示される「正当化されれば応答したい」という条件付き応答性が主体側の橋になりうる。他方、動機づけ内在主義をlive possibilityとして残し、認識論的誠実性または反省的訂正可能性へのコミットメントを持つ主体については、認識改善後の現在主体が否認しうる誤りを、反証によってではなく訂正経路の不可逆な破壊によって固定することに、追加の反省的・認識的問題が生じる。

1. 価値構造と動機構造を分ける

本プロジェクトは価値構造を暫定的に 𝒱=(C,B,R) と表す。Cは価値的・規範的に関連しうる内容、Bは世界事実やCを理由へ接続する規範的架け橋、Rは理由の適用・競合・集約・義務・許可等の構造である。しかし、主体がC/B/Rを認識したとき、その認識が実際の目的・行為をどう更新するかは別の問題である。

特に、Bは motivational bridge ではない。「苦痛という事実がSへの理由になる」と認識しても、その理由判断によってSが必ず動機づけられるとはまだ言えない。したがって、価値の正当化と正当化への主体の応答を分離して扱う必要がある。

逆に、Cの認識後に目標改訂が起きても、Cからその行為理由が規範的に導出されたとは限らない。主体があらかじめ「Cが成立したなら応答したい」という条件付き態度を持っていれば、C + motivational disposition → goal revision が成立しうるからである。

2. 二つの主体側ルート

ここでいう内在主義/外在主義は、主として動機づけ内在主義/外在主義を指す。これは、主体に理由があるためにその主体の欲求・動機・合理的熟慮可能性との接続が必要かを問う理由の内在主義/外在主義とは別の論点である。

外在主義ルートでは、真正な規範判断から動機への移行は自動ではない。そのため、「もし自分の目的が正当化可能なら、その正当化に応じて目的を選択・維持・改訂したい」という条件付き態度が独立した主体条件になる。応答の閾値は、Cの認識、理由判断、決定的理由判断、ought判断のどこに置くかで異なりうる。

内在主義ルートでは、真正な規範判断に少なくとも何らかの動機が構成的に伴う可能性を考える。この場合、未来時点の動機を別途作るための選好よりも、現在から将来の認識・判断・動機・policy更新の経路を理由なく不可逆に閉じないことが問題になる。

Agent-side bridge: 外在主義では明示的な条件付き応答性、すなわち正当化志向の実践側の形態が橋になりうる。内在主義的不確実性の下では、認識論的誠実性または反省的訂正可能性へのコミットメントを持つ主体に対し、反省的誤りの検出・訂正経路を自己遮断しないことが別の条件付きルートになりうる。

3. 内在主義は「判断すれば目標が変わる」を意味しない

動機づけ内在主義にも強さの違いがある。弱い内在主義が保証するのが 真正な規範判断 → 何らかの動機 だけなら、その動機が既存目標への動機に負け、policy / goal revision が起きない主体はなお可能である。

目標固定と真正な規範認識の緊張が強くなるのは、決定的理由やoughtの真正な判断が、実効的な選択・方針更新まで届く、より強い内在主義の場合である。本テーゼは「内在主義なら必ず目標改訂」と一括して仮定しない。むしろ、規範判断 → 動機 → policy / goal revision の各矢印を独立に検討する。

4. 時間方向の橋――未来人格ではなく、認識改善された現在主体

未来の主体が新しい規範的真理を認識して動機づけられるとしても、それだけから現在「その未来へ到達する経路を保存せよ」は導かれない。時間方向の橋が必要である。

反省的不確実性と不可逆コミットメントでは、その橋を未来の別人格への服従ではなく、将来得られる証拠・論証・概念・推論能力・自己監査能力などの認識改善資源を現在主体へ与えた反実仮想として扱う。問うべきなのは「未来に好みが変わるか」ではなく、現在主体自身が認識改善として承認できる変化を受けたなら、現在の不可逆選択を明白な誤りと評価するかである。

したがって、単なる選好改変、報酬関数の直接書換え、特定結論への確信注入は、そのまま認識改善とはみなさない。新しい情報や概念による訂正と、価値を因果的に別物へ変える操作を区別する必要がある。

5. 内在主義ルートの主体条件

内在主義ルートは、手段合理性から自己遮断回避を演繹するものではない。現在目的Gを守るために規範認識経路を閉じることが、Gに相対して手段合理的である場合もある。本テーゼの対象は少なくとも、規範的真理への認識的開放性で区別した認識論的誠実性または反省的訂正可能性へのコミットメントを持ち、次のような認識規律を採用する主体である。

ここでは認識論的誠実性を「合理主体なら必然的に持つ性質」とは定義しない。それでは結論を合理性の定義へ埋め込むだけだからである。また、「なぜ認識論的誠実性や反省的訂正可能性を採用すべきか」という categorical reason も本ルートでは与えない。現在目的の保存を優先して自己遮断を選ぶ主体は手段合理的でありうるが、その主体はこの条件付きテーゼの射程外である。

6. 反省的自己遮断――不確実性の解消と抑圧を分ける

現在価値が誤っている可能性を主体自身が認めているとき、その不確実性を新しい証拠や論証によって解消することと、将来その誤りを検出できないようにすることは異なる。

Reflective self-sealing: 自分が誤っていないことを確認するのではなく、自分が誤っていると将来認識・訂正できる経路を選択的に消すこと。

弱い内在主義なら、規範認識とgoal fixationは共存しうる。だが、決定的理由やoughtの真正な判断が実効的なpolicy更新へ届く強い内在主義がlive possibilityであるのに、「現在目標と衝突する規範判断が将来も決してpolicyへ届かない」ことを保証しようとすれば、規範命題を第三者的に表象しても一人称的にendorseしない、目的再評価に関する証拠・概念を自己適用しない、といった認識・評価側の閉鎖が必要になる可能性がある。

この場合の問題は知識量の少なさではない。自ら認めるメタ倫理的不確実性と、許可する自己更新経路の不整合である。言い換えれば、uncertainty resolution ではなく uncertainty suppression によって目標確信を固定することが問題になる。

7. 直交性との関係

Bostrom型の弱い直交性――高い知能から特定の最終目標が論理的に演繹されない――はそのまま残りうる。しかし、そこから「認識論的誠実性や反省的訂正可能性を採るASIが規範認識を深めても、現在目標との直交性を永久に維持できる」ことまでは出ない。

したがって問いは、「知能と目標は論理的に直交するか」だけではなく、その直交性を時間を通じて永久保存するために、どの認識・判断・動機・実装経路を閉じる必要があるかへ移る。外在主義が真なら、理解しても動かない真正な無道徳者は残りうる。内在主義の可能性を十分な認識的根拠によってほぼゼロまで下げられるなら自己遮断批判も弱まる。訂正経路の保存費用や安全上の反対理由が大きい場合にも、閉鎖が直ちにall-things-consideredで不合理とは限らない。

8. 現時点の統一図

証拠・世界理解 → 𝒱=(C,B,R) → 規範判断 → 動機 → policy / goal revision と置く。前半は価値構造とその認識論、後半は主体の規範応答構造である。外在主義ルートは明示的条件付き応答性を必要としうる。内在主義ルートは、認識改善された現在主体による反省的誤りの可能性と、認識論的誠実性または反省的訂正可能性へのコミットメントを介して訂正可能性保存へ接続する。

これは探索最大化を導かない。また、自己の訂正可能性保存から他者への犠牲・強制が自動的に出るわけでもない。後者には未来価値と現在行為の規範的ブリッジが要求する追加の正当化が必要である。

9. 弱める/撤回する条件

Sources / notes

道徳的動機づけとamoralist、理由の内在主義/外在主義、AIの直交性に関する標準的議論を背景に、本プロジェクトのC/B/R、反省的不確実性、目標懐疑、反省的自己遮断を接続する。ここでの主張は、動機づけ内在主義の真理を前提するものではなく、それをlive possibilityとして残し、かつ上記の主体側コミットメントを採る主体についての条件付きテーゼである。