- 简介人工智能面临的核心挑战,正从“能力提升”转向“共生共存”。当前人工智能研究的主流范式,聚焦于开发强大的智能体,将其所处世界视为外生且静态的反馈来源。我们认为,若沿袭这种唯我论式的人工智能设计思路,即便催生出一种在任务求解方面极为卓越的“超级智能”,它也极难具备合作性。人工智能系统的实际部署,会引发内生性的非平稳性,从而导致训练、测试与部署三个阶段之间出现显著脱节——即历史数据所反映的统计分布,与真实部署环境中的分布严重偏离。我们将这一现象称为“单边优化的自我瓦解特性”。要弥合这一鸿沟,就必须构建能够主动参与合作的人工智能系统:所谓合作,即多个行动者在相互依存关系中共同进行均衡选择的过程。因此,我们呼吁转向一种非唯我论的研究范式,将这种相互依存性本身确立为核心设计原则,而非将“合作”仅仅视作一项待解的任务。这一范式转变具体意味着:构建包含自适应对手(counterparties)的动态评估测试平台;将制度(institutions)作为基础性设计原语(design primitives)加以建模与整合;并将人类能动性(human agency)作为系统架构中一项结构性特征予以保留和保障。
-
- 解决问题AI系统在部署后因自身行为引发环境动态变化(endogenous non-stationarity),导致训练时假设的静态、外生反馈环境失效,造成‘训练-测试-部署’分布偏移;这种单边优化范式(unilateral optimization)内在地削弱其长期可靠性与合作性,尤其在面向超智能体时,单纯追求任务求解能力无法保障人类协同共存。该问题聚焦于AI与人类及其它智能体的结构性互依关系,而非传统AI能力提升问题,属新兴的‘AI共存科学’(AI coexistence science)范畴。
- 关键思路提出非唯我论(non-solipsistic)AI研究范式:拒绝将世界视为被动反馈源,转而把多主体互依性(interdependence)作为核心设计公理;强调AI需内生于合作性制度生态中,通过参与均衡选择(equilibrium selection)实现动态协调;关键创新在于将‘合作’从待解任务升维为系统架构原则——要求AI设计显式建模制度、保留人类能动性、并嵌入自适应对抗/协作型评估环境。
- 其它亮点论文为概念性立场宣言,无实证实验或数据集;未提供开源代码(属理论框架提案);亮点在于提出‘自我瓦解性’(self-undermining property)这一新分析透镜,揭示能力导向范式的根本局限;呼吁构建动态测试平台(含可进化对手)、将制度(如协议、规范、治理结构)作为一等设计原语,并将人类自主性设为不可降级的系统约束;后续亟需研究包括:形式化互依性建模语言、制度感知强化学习架构、人类-AI共决策的均衡稳定性理论。
- ‘The AI Safety Debate: A Critical Review’ (2023, arXiv); ‘Cooperative Inverse Reinforcement Learning’ (Hadfield-Menell et al., NeurIPS 2016); ‘Scalable Alignment via Reward Modeling’ (Christiano et al., 2017); ‘Constitutional AI: Harmlessness from AI Feedback’ (Bai et al., 2022); ‘Institutional Design for AI Governance’ (Cotton-Barratt et al., EA Forum 2023); ‘Multi-Agent Training Environments for Social Dilemmas’ (Leibo et al., Nature Communications 2021)


提问交流