宪法AI(Constitutional AI)
宪法AI(Constitutional AI)
来源: sources/constitutional-ai-insight-2026-07-20
相关概念: concepts/algorithm-governance, concepts/automation-bias, concepts/ai-safety
宪法AI(Constitutional AI, CAI)是Anthropic提出的AI对齐方法论,核心思想是将价值对齐从"逐条人工标注"转化为"原则+AI评审"的流程化问题。
要点
- 两阶段流程:SL-CAI(自我批评+修改生成监督数据)→ RL-CAI(AI评审打分作为奖励信号)
- 本质判断:将人类价值判断"算法化"——不消除人类价值,而是将执行权从人类转移到AI系统
- 隐含前提:预设的"宪法"原则必须是完整、一致、无歧义的——现实中几乎不可能实现
- "底座定能力,后训练定味道":同一底座模型经过不同对齐策略可训出风格迥异的助手
- 成本优势:AI评审比人工标注成本低1-2个数量级,但复杂价值判断上准确度不足
- Anthropic核心方法论:Claude系列的对齐路线基础
与 OpenClaw 的关系
OpenClaw作为多模型网关,不同模型的对齐策略(宪法AI vs RLHF vs 其他)直接决定了在特定场景下的输出风格和适用性。理解宪法AI有助于为不同客户场景选择"味道"最合适的模型。