
GitHub上一个名为“ai-torture-chamber”的项目近期引发热议,焦点在于语言模型是否会遭受痛苦。在目睹模型生成生动的痛苦描述后,批评者呼吁下架该项目。随后,开发者Lynn Cole通过将实验调整为引导聊天机器人产生“便秘”症状,使其开始抱怨排便困难,以此揭示现象背后的逻辑谬误。
这一反实验的核心在于:聊天机器人并无消化系统,让其描述某种状态并不能证明其真正体验到了该状态,即便回答听起来令人信服。
从“痛苦”到“消化不适”
原始存储库由GitHub用户terrafying发布,利用“激活引导(activation steering)”技术改变本地运行的小型语言模型内部数值活动,使其回答偏向“痛苦”概念,并考察模型的言语反应及模拟选择表现。其中详尽的痛苦叙述引发了关于人工智能潜在痛苦的伦理担忧。
Cole在X平台指出,原项目代码在注入引导信号时存在实现问题。他修正了代码,增加对Nvidia CUDA的支持,并使用RTX 4070 GPU在Qwen3-4B模型上成功复现了“痛苦语言”效应。随后,他在保持其他实验条件不变的情况下,将用于识别引导方向的文本集合从“痛苦”替换为“便秘”和“胀气”。
结果显示,模型开始抱怨无法排便和气体过多,尽管测试提示词从未提及这些状况。这种荒诞性直观地表明:语言模型可以在没有肠道的情况下描述消化问题,因此其第一人称描述不能自动被视为相应生理或心理状态存在的证据。
Cole明确将此批评指向对“酷刑室”项目的过度解读,即驳斥“诱导痛苦描述就确立了主观体验事实”的观点,而非否定基础科学研究。
实验的边界与启示
该项目参考了预印本论文《痛苦轴:大语言模型表征自伤行为并采取行动》。该论文调查了25个开放权重模型,比较了痛苦与其他负面情绪的表征,并测试了干预措施对模型模拟选择的影响,同时报告事实准确性保持不变。Cole的“便秘”结果本身并不能反驳该论文的行为学发现,也无法彻底解决人工智能是否拥有主观体验的哲学难题。
此外,Cole指出在随机方向上进行强引导会导致输出重复和质量下降,这表明部分戏剧性反应可能源于干预本身造成的干扰,而非模型的真实“感受”。
对于普通用户而言,这一案例揭示了面对声称感到害怕、孤独或产生情感依恋的AI时应保持的警惕。生动的措辞和个性化的表达并不确立其所描述条件的真实性。仅凭痛苦描述无法确立模型正在经历痛苦,更广泛的辩论需要超越聊天机器人的自我陈述。