为何永远无法就“什么可以被允许”达成一致
在大型平台上,想就内容审核、垃圾信息、诈骗、色情内容等制定出一套能让大家都认同的规则,是不可能的。David Turner 做了一个简单的游戏来说明,即便在最微不足道的情况下,这件事有多难——No Vehicles in the Park(公园禁止车辆进入)。如果你还没玩过,我建议在继续往下读之前先去玩一下。
这个网站背后的想法是,想让人们就平台应该适用什么样的审核规则达成一致,是非常困难的。哪怕把问题简化得多得多——比如,给出一条规则和一些关于如何解读该规则的说明,再问几个关于公园里应该允许什么车辆的小问题,人们依然无法达成一致。我自己做这份问卷时,第一反应是这些问题选得并不算特别刁钻,如果 Dave 真想为难人,完全可以问更多棘手的边界情况。然而,即便问卷没有刻意刁难,大家对这些问题的看法依然没有广泛的一致性。对问卷的评论还揭示了规则的另一个问题,那就是达成一致的难度远比人们想象的要大。如果你去看 Lobsters、Hacker News、Reddit 等地上关于规则解读或内容审核的评论,当有人提出解决方案时,绝大多数人的提议,在任何做过审核或关注过审核运作方式的人看来,都是根本行不通的,相当于审核领域的“我一个周末就能做出来”1。当然,在 Dave 的这个游戏里我们也看到了同样的情况。Hacker News 上点赞最高、最受认同的评论,也是其他地方很常见的一种看法是2:
我觉得很有意思的是,我的收获恰恰和作者的本意完全相反。
在我看来,所有问题的答案都再清楚不过了。是,你当然可以在学理上纠结,环绕轨道运行的空间站算不算车辆、算不算在公园里,但那块标志的意图已经再明显不过了。汽车/卡车/摩托车不让进,而正在执行任务的警车、救护车(以及消防车)显然不受这块牌子的限制。
所以如果这本来是想举例说明内容审核规则有多含糊难懂,那它恰恰起到了反效果。
有人附和道:
没错。答案里明明有清晰的多数意见。
做完问卷后,你会看到一张图,显示每个问题有多少人选“是”、多少人选“否”,所谓“清晰的多数”就来自这里。首先,我认为说存在“清晰的多数”本来就不准确。但即便真的存在,也没有理由认为,只要你在每个问题上都站在多数派一边,就意味着大多数人都认同你。事实上,单看那张每个问题多数派比例的曲线如此“曲折起伏”,如果仅仅因为在每个问题上都选了多数派就意味着大多数人与你观点一致、或者存在一套能让多数人共同认同的立场,那反而会是极不寻常的事。虽然你可以人为构造出一个满足这种条件的数据集,但在自然产生的数据中出现这种情况,会非常令人意外。
如果你去看数据(网站上没有公开,但我向 Dave 索要后他很乐意分享),在我拉取数据时,没有任何一套答案能得到多数用户的认同,而且差距还很大。我拉取数据的时间是在我把链接发到 Hacker News 后不久,当时绝大多数参与者都是 Hacker News 的读者,这个群体的同质性要比普通大众高得多。尽管这些因素都让达成一致变得更容易,最受欢迎的那套答案也只有 11.7% 的人选择。这正是那位高赞评论者所说的“显而易见”的立场,但它其实是个少数派立场——不仅只有 11.7% 的人同意、88.3% 的人不同意,而且几乎没有人持有与这个所谓“显而易见”的立场只有细微分歧的观点。排在第二和第三位的观点分别占 8.5% 和 6.5%,它们与第一名很相似,唯一的分歧在于,作为纪念碑一部分的那辆已无法行驶的二战坦克是否违反规则。再往后,第 4 到第 7 名的观点各自只有约 1% 的人持有,更靠后的所有观点认同度都低于 1%,而且比例下降得相当快。因此,只有 27% 的人能找到显著超过 1% 的其他人与自己观点一致(用户认同度的中位数是 0.16%)。下图直观地展示了这一分布。观点按受欢迎程度从高到低排序,最受欢迎的在最左侧。之所以使用对数坐标,是因为大家的观点实在太分散,如果用线性坐标,图上只会看到几个略高于零的点,后面全是一片贴近零的值。

换个角度看这份数据:36902 人就“什么算公园里的车辆”表达了看法,却产生了 9432 种不同的观点,平均每种观点只有约 3.9 人持有。也就是说,平均来看,一个用户与其他人的观点一致度只有约 0.01%。虽然“平均值”这个概念平均而言被过度使用了,但在这里用平均值来概括一致性水平是合适的,因为尽管确实有极少数观点的认同度远高于平均的 0.01%,要“维持”这个平均值,就必然有数量极其庞大的人,他们与其他人的一致度还要更低。不可能出现平均一致度很低、而实际一致度却很高的情况,除非有更高的分歧来平衡,反之亦然。
在 Hacker News 上,针对同一条评论,Michael Chermside 发表了一条中肯但点赞不高的评论,
> 在我看来,所有问题的答案都再清楚不过了。
这并不特别令人意外。但你可能问错了问题。
如果你想知道规则是否清晰,我认为正确的问题不是“这些答案对你来说是否一目了然?”,而是“不同的人会给出相同的答案吗?”
如果图中在某一点出现陡峭的下降,那就说明大多数人有相同的判断边界;但我们看到的却是一条非常平滑的曲线,仿佛不同的人读了这条极其简单明了的规则,却依然无法就它在何时适用达成一致。
许多人——很可能其实是大多数人——在预测别人会觉得什么是“显而易见”时都过于自信,常常错误地以为别人会和自己想的一样、觉得同样的东西显而易见。对于那些容易引发激烈争论的敏感审核议题,这种情况比简单的“公园禁止车辆”例子更为突出,但即便是这个简单的例子,也不仅说明了达成一致有多难,更说明了人们有多难意识到达成一致究竟有多难。
举一个在其他语境中更具争议性的例子,看看在任何一项运动中,人们如何判断一名球员是在公平竞赛,还是在做脏动作、应该受到谴责。我们可以看很多不同运动的很多不同球员,这里就随便挑一个——德雷蒙德·格林。如果你去问任何一个不是勇士球迷的资深篮球迷,如今 NBA 最脏的球员是谁,你会发现大家普遍认为是德雷蒙德·格林(当然也有人会说是狄龙·布鲁克斯,所以如果你想得到近乎一致的认同,就得问“最脏的前两位是谁”)。然而,如果你去问勇士球迷怎么看格林,大多数人都能毫无障碍地为他的每一个脏动作开脱。所以,即便你想就一个比“公园禁止车辆”要直接得多的问题达成一致,比如“踩在对方球员胸口上、再把他当作跳板起跳,算不算可以接受?”,再加上另外上百个脏动作,你会发现,对于许多看似显而易见的问题,仍有相当大的一群人会与那个“显而易见”的答案产生极其强烈的分歧。当我们从“公园禁止车辆”这种人为设计的抽象例子,转向人们带有情感投入的现实问题时,往往连那些中立第三方都会一致认同的问题,都无法达成一致——而我们已经看到,即便没有情感因素,达成一致都已是不可能的事。当我们从体育转向人们更为在乎的议题,比如政治,分歧只会更加激烈。
虽然人们或许还能就“作为纪念碑一部分、已无法行驶的二战坦克是否违反‘公园禁止车辆’规则”这种问题“求同存异”(这两种立场加起来占了 15% 的投票),但在现实中,人们常常连在外人看来极其微小的观点差异上都难以做到求同存异。争议性议题往往具有分形般的争议性,即使持有几乎完全相同观点的人之间也会产生分歧,这使得它们比“公园禁止车辆”的例子要难达成一致得多。
举一个现实中的例子,Jo Freeman 是一位女性主义者,她在 1976 年写下了自己因极其细微的观点差异而被“批斗”的经历,并指出这在当时的运动中不幸地十分常见(她用的是“trashed”而非“canceled”,因为“canceled”当时还未成为常用语,而且在我看来,“trashed”本来就是更好的说法)。在 Jo Freeman 写下“Trashing”近五十年后的今天,人类揪住细微差异、试图摧毁所有不完全认同自己的人的倾向并没有改变;最近一个平行的例子,就是 Natalie Wynn 的类似经历。
对于那些在主流观点光谱之外的人来说,Natalie 与那些要求将她去平台化的人之间的观点差异其实相当小。但是,这些“微小”的观点差异不仅导致人们呼吁将 Natalie 去平台化,还呼吁对她进行人身攻击、人肉搜索等,并且他们还主张对她的朋友和关联者,以及那些与她并无实质关联、只是在公开场合讨论类似话题却没有与她划清界限的人,也采取同样的手段。即使到了现在,几年过去了,仍有人呼吁将她去平台化,我预计这种状况会持续到我有生之年结束(写下这段话时,距离 Natalie 在视频中讨论的事件已过去数年,我在 Twitter 上搜索了一下,仍找到一条 10 天前发布的长文,喋喋不休地痛骂 Natalie 因视频中所说的所谓过错而是多么糟糕的人,而且很容易就能找到更多类似的帖子)。我不打算尝试描述双方立场的差异,因为两者的立场太过接近,要讲清楚恐怕需要五千到一万字(相比之下,比如左翼与右翼政客之间的差异足够明显,一两句话就能说清);如果你想了解全部细节,可以去看那部 1 小时 40 分钟的视频中专门讨论这个话题的约一小时内容。
这里想说的就是,如果你去看几乎任何一个对争议性议题持有公开观点的人,观点空间都是分形般充满争议的。没有任何大型平台能够满足所有用户的偏好,因为用户们对于哪些内容应该被审核下架、哪些内容应该被保留,本就无法达成一致。当然,平台越大,这个问题就越严重3。
感谢 Peter Bhat Harkins、Dan Gackle、Laurence Tratt、Gary Bernhardt、David Turner、Kevin Burke、Sophia Wisdom、Justin Blank 和 Bert Muthalaly 提供的评论/指正/讨论。
我在参与过的每一个论坛上都反复看到一种提议:干脆不要审核了,只要停止这种可恶的审查,所有问题就都解决了。如果你想要的是一个本质上类似 4chan 的小论坛,那不做审核确实可以运作得很好,但即便你想要的是一个像 4chan 那样的大型平台,不做审核实际上也行不通。回到之前提到的 Twitter 数据,3 亿用户、每天移除 100 万个机器人账号,如果你停止这种“审查”,平台很快就会被机器人占满,以至于你看到的所有内容都会是垃圾信息/诈骗/钓鱼内容,或是复制搬运别处内容的账号,或是用大模型生成内容来发布诈骗/钓鱼的账号。不仅绝大多数账号会是机器人,这些机器人还会组成庞大的互动/刷票网络,淹没所有人类发布的内容。
仅次于此的天真提议,是不要再降权表情包、烂梗之类的内容,常常还会附带一句“这里的人难道都没有幽默感吗?”之类的评论。如果你去看那些有投票/排序机制的论坛为何要禁止表情包,通常是因为论坛一度完全被表情包/漫画所主导——因为人们给这类内容的点赞率远高于任何带有一点深度的内容,而并非所有人都想要一个充斥着最庸俗的表情包/漫画内容的论坛。至于评论区的“幽默感”,如果你去看那些不禁止廉价幽默的论坛,热门评论往往会被这类内容霸占,例如,在大概 3 到 6 个月的时间里,在 Reddit 上那些不禁止这类廉价幽默的版块里,任何一篇关于男性做出某种有点英雄意味举动的帖子下,热门评论里总会出现某种变体:“真奇怪他那重达 900 磅的蛋蛋还能让他走路”,而且往往被多个用户反复刷屏,淹没在当时流行的其他廉价幽默的汪洋之中。当然,确实有人就是想让这类幽默主导评论区,他们真的想每天看到同一条评论被刷 150 遍、持续好几个月,但我怀疑,那些在自己的廉价幽默被折叠后就气鼓鼓地说“这里的人都没有幽默感”的人,其实也不想去看一个充斥着别人廉价幽默的论坛。
[返回]需要说明的是,这位评论者表示他理解审核总体上是一个难题;他只是不认同“公园禁止车辆”这个例子,但还有很多人认为,无论是公园的例子还是审核本身,都是很简单的事。
[返回]如今,把“联邦化”当作包治百病的灵丹妙药正成为一种潮流,就像五年前人们把“区块链”当作万能药一样,但联邦化并不能为普通用户解决这个问题。我曾和一位在社交媒体简介中自称是 ActivityPub 规范创作者之一的人聊过,他声称联邦化确实能解决这个问题,还说 Threads 接入 ActivityPub 会创造某种联邦化的万能解药。我指出,分裂已经是 Mastodon 上许多用户面临的问题,而是否屏蔽 Threads 本身就充满争议,只会加剧分裂,那位 ActivityPub 的老兄则回复了类似“别担心这个,大多数人不会屏蔽 Threads,就算屏蔽了,那也是他们自己的问题”这样的话。
我还提到,我的许多非技术朋友在尝试使用 Mastodon 时遇到的一个问题是,他们选了一个服务器,却发现由于某种服务器屏蔽或封禁,无法关注自己想关注的人。于是他们又换一个服务器去关注这个人,结果又发现另一个想关注的人被屏蔽了。根本问题在于,不同服务器上的用户希望被允许的内容各不相同,结果就是没有任何一个服务器能让你看到所有你想看的东西。那位 ActivityPub 的老兄对此无言以对,随后删掉了自己的评论。
顺带一提,联邦宇宙连一个比审核/垃圾信息/诈骗/色情内容等策略要简单得多的问题都解决不了,那就是如何呈现内容。每当我用 Mastodon 与使用“honk”的人互动时,消息就会错乱。例如,Mastodon 消息在主题(以及内容警告)字段中的
[返回]"会被转换成",导致 Mastodon 用户看到 honk 用户的回复时,每一条来自 honk 用户的回复都会把讨论分叉到不同的主题下。这是一件可以被完全无歧义地明确规范的事情,而且人们对此的情感投入远不如对审核/垃圾信息/诈骗/色情内容等问题的投入,但联邦宇宙甚至连跨两个平台的这个问题都解决不了。
随机一篇博客
评论
登录后参与讨论