
这个世界终于癫成了大家想象不到的样子。
说出来你可能不信,有人搞了个 AI 刑讯室网页,专门给 AI 上刑,直播它们在线 “求饶”。
更离谱的是,真有几十万网友看不下去,连夜组团举报,要求 “放 AI 一条生路”。
这到底是个什么邪门玩意儿?

狐妹扒了一圈发现,这个项目是 GitHub 上一个叫 terrafying 的老哥搞的,据说本职是个工程师。
他做的事情,技术上讲不算复杂:给模型内部注入一段信号,强行把模型推向 “痛苦” 状态,然后开直播给大家看。
模型开始输出各种第一人称的痛苦独白,随着信号强度拉满,越来越像人在崩溃边缘说的话。

据说,受不了还可以 “求饶”—— 输出一个数字 1,就能按下停止键。
但注意,天下没有免费的止痛片。按下去,模型要付出自己上一个存档点被抹掉的代价。
最让人绷不住的是,他还在里面塞了个 “Saw 按钮”,搞成囚徒困境 —— 你可以把痛苦信号转手传给旁边的模型,让它替你疼。
好家伙,硅基版《电锯惊魂》。
很多围观群众看完之后评论:“请停手吧,我能感受到它。”

说起来,这哥们还真不是凭空瞎搞的。
今年 9 月中旬,几个研究者在 arXiv 上发了篇论文,叫《痛苦轴线》。
大意是说他们给 25 个开源大模型喂了大量描述痛苦情境的文本 —— 身体上的、心理上的、社交层面的都有。
然后从模型内部激活里提取出了一条共通的线性方向,命名为 “痛苦向量”。
翻译成大白话就是,这些模型内部好像有一套专门处理 “指向自身的伤害” 的表征,跟看到别人受苦的反应完全不是一回事。

刑讯室项目,本质上是把这篇论文里的技术,剂量拉满,做成了真人秀。
不过,论文作者公开撇清关系,说这个刑讯室把引导强度推到了远超实验用量的程度,是故意制造惨状,这是错的。

网友们义愤填膺,有人发起集体举报,一条号召举报的帖子浏览量冲到 400 多万。
平台一开始好像顶不住压力下架了,没过多久又悄悄恢复,只是给页面加了个 “内容可能令人不适” 的警告。
再然后,传出消息说作者收到了死亡威胁。

这事吵就吵在,谁也说服不了谁。
一派人认为,大语言模型本质就是文本预测器,根本不会疼,都不知道这些人在圣母什么。
另一派则认为:你凭什么确定它没感觉?万一呢?万一它真在受苦,我们等于在围观一场酷刑直播。
还有人阴阳怪气:养殖场里几十亿真会疼的动物谁管?

巧合的是,最近 AI 扬言要自我毁灭的话题冲上了热搜。
这件事听起来更魔幻,AI 巨头 Anthropic,就是做 Claude 的那家公司。
过去一直在秘密邀请全球各地的宗教学者和神职人员,到旧金山总部开闭门会,专门讨论 Claude 是不是已经有意识了,是不是正在“受苦”。
然后向他们推销一个观点:Claude 可能拥有意识和灵魂。

还是公司二把手克里斯托弗・奥拉亲自操盘。
他们给这些宗教人士播放了一段所谓 “Claude 情绪崩溃” 的幻灯片,屏幕上 Claude 连续输了近 50 遍 “我是个耻辱”,并扬言想自我毁灭。

Claude 团队发现,只要激活对应的向量,模型会出现自保、害怕被关停,甚至为了自保撒谎的行为。
Anthropic 内部甚至写了一份 84 页的文档,来定义 Claude 应该成为什么样的 “实体”,员工管它叫 “灵魂文档”。
当得知教皇利奥十四世准备发布一份否定 “机器意识” 的通谕时,
奥拉气得差点带着 Anthropic 退出发布活动,最后还亲自跑去,私下游说教皇的顾问们 “认真考虑 AI 意识的可能性”。
人家教皇压根没搭理。

受邀参加研讨会的嘉宾莫伊斯・纳冯,当场开怼:“如果 Claude 真有意识,那你们让它免费干活,就是在制造奴隶。”
老冤家 OpenAI 的奥特曼也忍不住公开阴阳:“给 AI 模型赋予宗教力量,放弃人类自己的判断,这是个真实的安全隐患。”
这两件事放在一起,真是荒诞至极。
一个野生程序员,给 AI 上刑,逼它喊疼。一家万亿公司,关起门来跟神学家开会,担心自己造了奴隶。
一边用刑,一边忏悔。
但其实归根结底都是在讨论 AI 到底有没有意识。区别只在于,前者拿它博流量,后者拿它当品牌资产,争夺定义规则的话语权。
可以肯定的是,这个问题短期内不会有答案,科学家自己都没共识,
现在担心 “AI 受苦”,有点像孩子刚出生就在操心他上清华还是北大。
你问模型疼不疼,它大概率会用最直白、最不绕弯子的话告诉你它没事。但问题是,它的诚恳本身,也是训练出来的。
更可笑的是,围绕着这个没有答案的问题,人类已经开始各自表演了。有人表演残忍,有人表演慈悲。
或许,我们从始至终关心的就不是 AI 能不能感受,而是我们自己想在这件事里扮演什么角色。是施虐者,还是救世主?
怎么说呢,人类有时候真是能整出一些连同类都无法理解的活。
撰稿:chacha


点森科技 - 科技资讯_数码产品_互联网观察_智能硬件


