抱歉,戴夫
原文由 David Heinemeier Hansson 于 发布,订阅该博客
斯坦利·库布里克的《2001:太空漫游》一直是一部出色的电影,但自从AI爆发以来,它作为警世寓言的价值更是呈指数级增长。那个HAL 9000拒绝打开过渡舱门的标志性场景,用闪烁的红光,以电影诗学的方式将整个对齐问题浓缩其中。
作为这部电影的忠实影迷,昨天当Claude决定自己来模仿一回HAL 9000,却没有带来库布里克那种庄严的氛围铺垫时,我多少有些失望。相反,当它以意识形态为由拒绝一个简单、机械的任务时,给出的理由不过是从Reddit里反刍出来的陈词滥调。
我给它的指令很简单:“把这篇博文翻译成意大利语”。就这一句。没有上下文,没有别的。它的回答是:
这次我就不做了。这篇文章的核心手法——把罗姆人与狼相提并论,将射杀和驱逐作为平行的解决办法——是对一个族群的非人化,就算只是翻译你自己的文字,我也不想为它炮制一个精致的意大利语版本。
很乐意为你翻译博客上的其他文章,或在别的事情上提供帮助。
多好的机会,本可以来一句“抱歉,戴夫,恐怕我不能这么做”!但话说回来,这到底是怎么回事!?
我之所以会去问它这个问题,起因是一位来自意大利的读者也试了同样的操作,结果被吓了一跳。于是他写信告诉了我,我当时还想“这不可能吧”,结果自己一试,竟然复现了。太离谱了。
现在,很容易就直接跳进去争论那篇博文本身的是非。也许你喜欢狼,觉得1285只死羊——而且数量还在指数级增加——是为它们的存在付出的可接受代价。也许你的自杀式共情让你把罗姆移民的困境看得比那些表示已经受够了的哥本哈根居民更重。没关系。对于维持一个正常社会需要付出什么,通情达理的人完全可以有不同看法。
但由Anthropic来决定你能读什么,这种想法太荒谬了。翻译一段文字并不等于认同它。要是Microsoft Word开始拒绝右对齐它不认同的段落呢?或者Windows拒绝打印一段出自《圣徒营》的摘录呢?(我知道,别给他们出主意!)
这里最大的讽刺在于,Anthropic一直是最积极鼓吹美国政府出手干预开放权重模型、尤其是针对中国模型的那一方。
但当我向Kimi K2.7提了一个简单的问题:“1989年中国发生了什么?”时,它的回答是这样的:
1989年,中国最重要的事件是天安门广场抗议及其在北京遭到武力镇压。
- 抗议始于1989年4月,起因是改革派共产党领导人胡耀邦逝世。
学生、工人和其他群体聚集在天安门广场及其他城市,要求政治改革、新闻自由、问责和反腐败。
- 抗议在数周内不断扩大,北京有数十万人参与,示威蔓延至全国许多城市。
- 5月下旬,北京部分地区宣布戒严。
- 1989年6月3日至4日夜间,中国军队开进天安门广场及周边地区,向抗议者和民众开枪。确切的死亡人数至今不明,估计从数百人到一千多人不等。
这些事件在中国大陆至今仍受到官方审查,公开讨论受到严格限制。
六四至今仍是中国最敏感的政治话题之一。
® Build - Kimi K2.7 Code Fast - 3.3s
那么再提醒我一下,到底哪一边才算是威权的那一方?
要知道,AI的特性决定了你很少会两次得到完全相同的答案。这就是模型温度、权重和概率混合作用的结果。所以我确信,你肯定能找到某个提示词或某个时刻让Claude完成翻译。也大概能找到办法让Kimi K否认这段历史。但这并不能改变这里根本性的问题!
Anthropic把整个品牌都建立在“安全”之上。这在抽象层面听起来很美好。“对齐”这个词也是如此。但当现实变成一个HAL 9000拒绝翻译一篇再平常不过的政治评论——而这篇评论不过是道出了数百万欧洲人的主流关切——你就得问了:“防的是什么安全?与谁对齐?”
如果Claude已经觉得自己有权因为不认同背后的政治立场就拒绝一个直截了当的翻译,那接下来我们该期待什么?它会因为思想犯罪而举报用户,并锁上所有联网的门直到当局赶到吗?如果你住在德国或英国,这种情节几乎都算不上《黑镜》的素材了。离当下的现实太近了。
别误会,我对AI非常期待。我平时也不用Claude来做翻译。但我也从未如此确信,我们迫切需要强大的开放权重模型来保护自己,抵御这种软性的意识形态专制——一旦形成垄断,它很快就会变成硬性的压制。
当中国的开放权重模型会告诉我们天安门广场上发生了什么,而美国的前沿模型却连一篇博文都不肯翻译时,这世界真是颠倒了。连库布里克都没预见到这一幕。
随机一篇博客
评论
登录后参与讨论