為什麼我們永遠無法對「什麼可以、什麼不行」達成共識
在大型平台上,根本不可能制定出一套讓所有人都接受的規範,無論是內容審核、垃圾訊息、詐欺還是情色內容。David Turner 做了一個簡單的遊戲來說明即使在最微不足道的情境下,要做到這點有多困難,這個遊戲叫做 No Vehicles in the Park。如果你還沒玩過,我建議你在繼續往下讀之前先去玩玩看。
這個網站背後的概念是,要讓大家對平台該用什麼樣的審核規則達成共識是非常困難的。就算換成一個簡單得多的例子——給你一條規則和一些解釋規則的說明,再問你哪些車輛應該被允許進入公園,然後只問幾個小問題,人們還是無法達成共識。我自己做完這份問卷後的第一個感想是,這些問題並沒有特別刁鑽,如果 Dave 真的想為難大家,他大可以問更多邊緣案例。但即使問卷沒有刻意刁難,大家對這些問題還是沒有廣泛的共識。問卷下的留言也點出了規則的另一個問題:要達成共識的難度,遠比人們想像的還要高。如果你去看 lobsters、HN、reddit 等地關於規則詮釋或內容審核的留言,當有人提出解法時,絕大多數人提的都是那種只要實際做過審核、或稍微關注過審核如何運作的人,一眼就知道行不通的東西——就相當於審核領域的「我一個週末就能做出來」1。當然,在 Dave 的這個遊戲裡我們也看到了同樣的情況。HN 上按讚數最高、最受認同的留言,也是其他地方很常見的一種心聲是2:
我覺得很有意思的是,我的結論跟作者想表達的完全相反。
對我來說,所有問題的答案都再清楚不過了。你當然可以在學理上爭辯軌道上的太空站算不算車輛、算不算在公園裡,但那個標誌的意圖再明顯不過了:汽車、卡車、摩托車不能進去,而正在執行勤務的警車和救護車(還有消防車)顯然不需要遵守這個標誌。
所以如果這是要當作內容審核規則難以遵循的例子,那它達到的效果恰恰相反。
而有人贊同地回覆:
沒錯。答案是有明顯多數的。
做完問卷後,你會看到一張圖,顯示每個問題有多少人回答「是」、多少人回答「否」,所謂的「明顯多數」就是從這裡來的。首先,我認為說有「明顯多數」並不正確。但就算退一步假設真的有,也沒有理由認為,即使你在每個投票中都站在多數那一邊,就代表大多數人都跟你意見一致。事實上,考慮到每個問題的多數比例圖表看起來如此「起伏不定」,如果「每題都站多數」就等於「大多數人跟你一致」,或是真的存在一套多數人都同意的立場,那反而會是非常罕見的事。雖然你可以刻意構造出一個符合這種情況的資料集,但在自然產生的資料中出現這種情況,會讓人非常意外。
如果你去看實際資料(這些資料在網站上沒有公開,但我詢問後 Dave 很樂意提供),以我取得資料的時間點來看,沒有任何一套答案是獲得多數使用者認同的,而且差距還很大。我是在把連結貼到 HN 後不久抓的資料,當時絕大多數的回覆都來自 HN 的讀者,而這群人比起一般大眾已經算是同質性很高了。儘管這些因素都讓達成共識變得更容易,最熱門的那套答案也只有 11.7% 的人選擇。這正是那位熱門留言者口中「顯而易見」的立場,但它其實是少數派——不只是因為只有 11.7% 的人同意、88.3% 的人不同意,而是幾乎沒有人持有的立場是只跟這個所謂「顯而易見」的立場有些微不同。第二和第三常見的立場分別佔了 8.5% 和 6.5%,而且它們跟第一名很相似,只差在是否認為那輛作為紀念碑一部分、已經無法行駛的二戰時期戰車違反了規則。再往下,第四到第七名的立場各約只有 1% 的人支持,更後面的每一個立場支持度都不到 1%,而且下降得很快。所以,只有 27% 的人所持的立場能獲得超過 1% 的其他使用者認同(中位數的使用者只跟 0.16% 的其他使用者意見一致)。下面的圖表呈現的就是這個情況。這些意見按照熱門程度由高到低排列,最熱門的在最左邊。圖表使用對數尺度,是因為大家的意見實在太分散,如果用線性尺度,圖表看起來會像是幾個高於零的點,後面接著一堆趨近於零的點。

另一種看待這份資料的方式是,有 36902 個人對「什麼算是公園裡的車輛」表達了意見,結果產生了 9432 種不同的意見,平均每種不同的意見只有約 3.9 個人支持。也就是說,平均的使用者共識度只有約 0.01%。雖然平均數通常被過度使用了,但在這裡用平均來總結共識程度是有效的,因為雖然我們確實有少數幾個意見的支持度遠高於平均的 0.01%,但為了「維持」這個平均值,就必然有更多的人其意見的共識度遠低於平均。不可能在平均共識度很低的情況下,實際上的共識度卻很高,除非有更高的分歧來平衡,反之亦然。
在 HN 上,針對同一則留言,Michael Chermside 留下了一則合理但按讚數不高的回覆:
> 對我來說,所有問題的答案都再清楚不過了。
這並不特別令人意外。但你可能問錯問題了。
如果你想知道規則是否清楚,我認為正確的問題不是「對你來說答案是否再清楚不過?」而是「不同的人會不會給出相同的答案?」。
如果圖表在某個點出現急遽下降,那就表示大多數人有相同的分界點;相反地,我們看到的是一條非常平滑的曲線,好像不同的人讀了這條「非常簡單明瞭」的規則,還是無法對它何時適用達成共識。
許多人(而且很可能其實是大多數人)在預測別人覺得什麼是「顯而易見」時都會過度自信,常常錯誤地以為別人也會想同樣的事、覺得同樣的東西顯而易見。這在那些會引發激烈審核爭論的高度敏感議題上,比在「公園禁止車輛」這個簡單例子中更為嚴重,但即使是這個簡單的例子,也不僅顯示了達成共識的困難,更顯示了人們有多難理解「要達成共識有多難」這件事本身。
舉一個在另一個更具爭議性的脈絡下的例子,來看看在任何運動中,怎樣的行為算是公平競爭、怎樣的行為算是骯髒動作而應該受到譴責。我們可以看很多不同運動、很多不同球員,所以就隨便挑一個——以 Draymond Green 為例。如果你去問任何一個不是勇士隊球迷的認真籃球迷,現在 NBA 最髒的球員是誰,你會發現大家普遍都會說是 Draymond Green(雖然也有人會說是 Dillon Brooks,所以如果你想要接近一致的答案,就得問「最髒的兩個球員是誰」)。然而,如果你去問勇士隊的球迷怎麼看 Draymond,他們大多都能對他的每一個骯髒動作提出解釋。所以,如果你想針對一個比「公園禁止車輛」還要直接得多的問題取得一致共識,例如,「踩在另一個球員的胸口上、再把他當作跳板躍向空中,這樣可以嗎?」再加上其他上百個骯髒動作,你會發現,對於許多看似顯而易見的問題,都會有為數不少的人對這個「顯而易見」的答案抱持極強烈的反對意見。當你從「公園禁止車輛」這種刻意設計、抽象的例子,轉向人們帶有情感依附的真實世界議題時,就算是在原本局外人會一致同意的情況下,也往往變得不可能取得共識——而我們已經觀察到,即使沒有情感依附,要達成共識就已經是不可能的了。而當你從運動再轉向人們更加在乎的議題,例如政治時,分歧只會更劇烈。
雖然人們或許能夠對「那輛作為紀念碑一部分、已經無法行駛的二戰時期戰車是否違反『公園禁止車輛』規則」這種問題「求同存異」(這兩種立場加起來佔了 15% 的票數),但在現實中,人們往往很難對那些在外人看來只是微小意見差異的事情做到求同存異。具爭議性的議題往往是呈現碎形般的爭議性,即使是持有幾乎相同意見的人之間也會產生分歧,使得這些議題比我們「公園禁止車輛」的例子還要難上許多,更難達成共識。
舉一個真實世界的例子,來看看Jo Freeman這位女性主義者,她在 1976 年寫下了自己因為意見上的細微差異而被「批鬥」,以及這種情況在運動中是多麼常見的經歷(她用的是「trashing」這個詞,而不是「canceled」,因為當時「canceled」還沒成為常用語,而且在我看來,「trashing」本來就是更好的詞)。在 Jo Freeman 寫下〈Trashing〉一文後的近五十年來,人類因為細微差異就挑剔、並試圖摧毀任何不完全同意自己的人的傾向並沒有改變;近期的類似例子,可以看看Natalie Wynn 的類似經歷。
對於那些在常見意見光譜中相距甚遠的人來說,Natalie 和那些要求將她去平台化的人之間的意見差異其實相當小。但是,不僅這些「微小」的意見差異導致人們要求將 Natalie 去平台化,他們還要求對她進行人身攻擊、肉搜等,並且對她的朋友和夥伴,甚至那些其實跟她沒有直接關聯、只是公開談論類似主題卻沒有抵制她的人,也提出了同樣的對待方式。即使到了現在,事發多年之後,她仍然會收到要求將她去平台化的呼聲,我預期這種情況會持續到我有生之年結束(在我寫下這段文字時,距離影片中討論的事件已經過了數年,我在 Twitter 上搜尋了一下,發現一篇 10 天前才發的長篇推文串,有人在裡面痛罵 Natalie 因為影片中討論的那個所謂的過錯是個多麼糟糕的人,而且要找到更多這類痛罵並不難)。我不打算在此描述雙方的立場差異,因為雙方的立場已經接近到要描述清楚,大概需要五千到一萬個字(相較之下,例如左派與右派政治人物之間的差異就非常明顯,用一兩句話就能說清楚);如果你想了解完整細節,可以去看那部 1 小時 40 分鐘的影片中,花了一小時專門講這個主題的部分。
這裡的重點在於,如果你去看幾乎任何一個對具爭議性議題有公開意見的人,其意見空間都是呈現碎形般的爭議性。沒有任何大型平台能夠滿足使用者的偏好,因為使用者對於什麼內容應該被審核下架、什麼內容應該被允許,會有不同的意見。當然,這個問題會隨著平台規模變大而更加嚴重3。
感謝 Peter Bhat Harkins、Dan Gackle、Laurence Tratt、Gary Bernhardt、David Turner、Kevin Burke、Sophia Wisdom、Justin Blank 和 Bert Muthalaly 提供的意見、更正與討論。
我在待過的每個論壇上都反覆看到有人建議我們根本不需要審核,只要停止這種惡劣的審查制度,所有問題就都能解決。如果你想要的是一個基本上像 4chan 那樣的小型論壇,那麼不做審核確實可以運作,但即使你想要的是一個像 4chan 那樣的大型平台,不做審核其實也行不通。回到前面提到的 Twitter 數據,3 億使用者、每天移除 100 萬個機器人帳號,如果你停止這種「審查」,平台很快就會被機器人塞滿,到時候你看到的一切都會是垃圾訊息、詐騙、釣魚內容,或是從別處複製內容、或用大型語言模型生成內容來發布垃圾訊息/詐騙/釣魚內容的帳號。不僅大多數帳號會是機器人,機器人還會形成大規模的互動/投票圈,把所有人類的內容都淹沒掉。
下一個最天真的建議是停止壓制迷因、無聊笑話等等,常常還會伴隨著一句「這裡的人難道都沒有幽默感嗎?」之類的評論。如果你去看那些有按讚/排名機制的論壇為什麼會禁止迷因,通常都是因為論壇在被迷因/漫畫徹底佔據之後才這麼做的,因為人們對這類內容的按讚率遠高於任何帶有一點細微差別的內容,而且不是每個人都想要一個充滿最低公約數迷因/漫畫內容的論壇。至於留言中的「幽默感」,如果你去看那些不禁止廉價幽默的論壇,熱門留言通常最後都會被這些內容佔據,例如,大概有 3 到 6 個月的时间,在 reddit 上那些不禁止這類廉價內容的論壇裡,任何關於某個男人做了任何有點英雄氣概的事情的故事,最熱門的留言都會是某種「我很驚訝他那顆重達 900 磅的蛋蛋還能讓他走路」之類的變體,而且常常被多個使用者重複好幾次,夾雜在一堆當時流行的其他廉價幽默中。當然,有些人其實就是想看這種幽默主導留言區,他們真的想一天看到同一個笑話 150 次、連續看好幾個月,但我懷疑大多數那些在自己的廉價幽默被標記時、抱怨「這裡的人都沒有幽默感」的人,其實並不想讀一個充滿別人廉價幽默的論壇。
[return]這位特定的留言者表示,他理解內容審核整體來說是個難題;他只是不認同「公園禁止車輛」這個例子,但許多其他人則認為公園的例子和內容審核都很簡單。
[return]如今,用「聯邦化」來當作萬靈丹正變得很流行,就像五年前人們把「區塊鏈」當作萬靈丹一樣,但對於一般使用者來說,聯邦化並沒有解決這個問題。我其實曾和一位在社群媒體個人簡介上自稱是 ActivityPub 規格創建者之一的人對話過,他聲稱聯邦化確實能解決這個問題,還說 Threads 加入 ActivityPub 就會創造某種聯邦化的烏托邦。我提到,碎片化對 Mastodon 上的許多使用者來說已經是個問題,而是否要封鎖 Threads 本身就充滿爭議,只會加劇碎片化,那位 ActivityPub 的人回覆了類似「別擔心,大多數人不會封鎖 Threads,如果他們真的封鎖了,那是他們自己的問題」之類的話。
我提到,我的許多非技術背景的朋友在嘗試使用 Mastodon 時遇到的問題是,他們選了一個伺服器,卻發現因為某種伺服器封鎖或禁令而無法追蹤他們想追蹤的人。於是他們又試著換另一個伺服器去追蹤那個人,結果又發現另一個想追蹤的人被封鎖了。根本的問題在於,不同伺服器上的使用者想要被允許的內容不一樣,這導致沒有任何一個伺服器能讓你看到所有你想看的東西。那位 ActivityPub 的人對此沒有回應,並刪除了他的留言。
順帶一提,對於比內容審核/垃圾訊息/詐欺/情色內容等政策還要簡單得多的問題,聯邦宇宙甚至都無法解決,那就是如何呈現內容。每當我用 Mastodon 和使用「honk」的人互動時,訊息就會被搞亂。舉例來說,一則 Mastodon 訊息在主旨(以及內容警告)欄位中的
[return]",在 Mastodon 使用者看到來自 honk 使用者的回覆時,會被轉換成",所以每一則來自 honk 使用者的回覆都會把討論串分叉成不同的主旨。這是一個可以完全明確定義、而且人們對其的情感依附遠低於內容審核/垃圾訊息/詐欺/情色內容等議題的東西,而聯邦宇宙甚至連跨兩個平台都無法解決這個問題。
隨機一篇部落格
留言
登入後參與討論