一个词都不认识,你能在《行动代号》里玩得多好?
大约八年前,我在玩一局《行动代号》时,局面已经到了如果我们这回合不能把剩下的所有词都猜对,就几乎必输的地步。仅凭给出的线索,我们做不到这一点。虽然这个游戏本质上是靠词语线索来猜词的,但一位队友提出,可以根据已选词语在桌面上的实际分布来判断——我们考虑的大多数可能性都会形成一些“过于奇怪”的图案,所以最后一个词应该按位置来选。结果这个办法奏效了,我们赢了。
[点击展开《行动代号》规则简介(如果你不熟悉这款游戏)]
《行动代号》分两队进行。游戏有 5×5 的词语网格,每个词都秘密地归属于 {蓝队、红队、中立、刺客} 中的一方。每队有一名“间谍大师”,他知道词语与归属的秘密对应关系。间谍大师的任务是给出单个词语的线索,让队友猜出哪些词属于己方,同时避免猜中对方队伍或刺客的词。每回合,间谍大师给出线索,队友则猜测哪些词与线索相关。游戏持续到某一队的词语全部被猜中,或有人猜中刺客词(立即判负)为止。为简洁起见,这里省略了一些细节,但就本文而言,这样的说明已经足够。如果你想了解更多,可以看这个视频,或查阅官方规则从那以后,我一直在想,如果有人只做一件事——把游戏自带的全部 40 张配置卡全部背下来——他能玩到什么水平。为了模拟这种情况,我们接下来会做一个只利用位置信息来游戏的机器人(你也可以叫它 AI,但因为后文会讨论用 LLM/AI 来编写这个机器人,为了便于区分,我们用“机器人”来指代这个自动玩《行动代号》的智能体)。
当时,在那次猜中获胜之后,我们翻遍了所有配置卡,想验证队友那种按形状猜测的思路是否正确——结果确实是对的,他基于所有可能的物理布局,做出了概率最高的猜测。每张卡的布局都定义了哪些词属于己方、哪些属于对方,而且大概是为了控制成本,游戏只附带了 40 张卡(算上旋转后共有 160 种布局)。那位队友并没有把这些卡背下来(如果背下来,就能把可能性缩小到唯一一种布局),但他玩的局数足够多,已经对哪些图案/聚类常见、哪些罕见形成了直觉,这让他得以对游戏发动了一次侧信道攻击。举个例子,玩得多了你就会发现,没有任何一张卡会让同一队有 5 个词连成一行或一列;只有先手队伍的颜色才可能出现 4 连的情况,而且如果这 4 连出现在边缘且是蓝色,那么第 5 个词一定属于红队;也没有任何一种布局会出现 6 个相连的蓝色词(但红队有一种,是中间 2 连旁边紧挨着 4 连)。即使你没有有意识地去利用这些信息,潜意识里也会对那些感觉“太奇怪”的图案产生排斥。
回到做一个模拟“花几天时间把 40 张卡全部背下来的人”的机器人这个想法上,下面就有一个简单的机器人,你可以和它对战,它模拟的就是这样一支队伍。正常游戏时,你需要给出线索,让队友去猜词。但为了尽可能地给你这个人类玩家优势,我们会给你一个现实中不可能存在的巨大优势:假设你随时都能给出一个线索,让队友精确选中你想要的格子——在模拟中,这体现为你可以直接点击任意一块瓷砖,让你的队伍去猜那一块。
默认情况下,你每回合还有三次猜测机会,这已经让你远远超过了我所见过的《行动代号》玩家中 99% 的水平。虽然高手经常能在一回合内猜对三个或更多,但要做到平均每回合猜对三个且零失误,在大多数玩家群体里都是极其出色的表现。你可以切换是否显示剩余的匹配版面,但如果你想体验一下没有背下所有版面的人类玩家的感受,不妨先关掉显示,试玩几局。
如果在任意时刻,你结束回合轮到机器人行动,而此时只剩下一种可能的匹配版面,机器人就会正确猜出自己的所有词语并获胜。如果机器人在能全部猜中之前就开始猜词——无论是盲目地猜,还是为了有策略地缩小搜索空间——或者哪怕它只有一个简单的启发式策略,比如在能推断出你下一回合就会获胜时,就在可能的版面中随机猜一个,它都会强得多。但即使用这种最稚拙的“背板”机器人,在那些没有打开剩余匹配版面显示、因而无法获得与机器人相同信息的对局中,它也已经能在大多数游戏中击败我让它试玩的每一位《行动代号》玩家1。
既然我对这个问题的 curiosity 已经得到满足,我认为这只是一个小问题,算不上游戏真正的缺陷,因为猜词游戏本来就不是设计来让人严肃对待的——大多数这类游戏一旦被认真对待,甚至只是玩得多了、并非有意要去破解,也会变得有些失衡。相对于其他猜词游戏,尤其是那些热门的,《行动代号》在玩家开始有意或无意地利用侧信道攻击之前,拥有高得多的可重玩性。
对于像 Just One 或 Taboo 这样词语数量有限的游戏,玩上几局后,人们就会在不经意间记住那些“难词”本身以及与之相关的联想。《行动代号》缓解了这个问题,因为它要求人们记住的是数量呈组合级增长的词语关联,而不是线性的、有限的关联。我们刚才讨论的这个问题,大约在我们玩了二十来局《行动代号》后就出现了——即便玩家没有意识到版面形状正在影响自己的判断,这种影响也很可能在潜意识层面发生,但相比其他猜词游戏中出现的问题,这已经算是相当轻微了。而且,如果真有人在意这个问题,完全可以用数字随机生成器来布置版面,只不过我个人从未在任何一个认真到会去做这件事的群体里玩过《行动代号》。
感谢 Josh Bleecher Snyder、David Turner、Won Chun、Laurence Tratt、Heath Borders、Spencer Griffin、Ian Henderson 和 Yossi Kreinin 提供的评论、指正与讨论
附录:为本文编写代码
为了写这篇文章的代码,我尝试了两种不同的 AI 助手,Storytell 和 Cursor。我并没有像程序员那样去使用它们,而是更像一个不会编程的人那样用它们来写程序。总体而言,我发现 AI 助手在某些任务上表现惊人地好,而在另一些任务上又糟糕得可笑。这次也不例外。
我的做法基本上就是让它们写代码,然后运行看看能否工作,再把出错的地方告诉助手,让它重写,直到看起来基本能跑。即使以这种非常天真、刻意不去理解代码、只看结果是否能用的方式,我觉得得到可运行代码所花的时间,也并没有比我完全手写要多太多。我猜大概多花了一倍时间,但程序员的时间估算一向不准,说不定实际花的时间差不多。我对代码正确性的信心要低得多——如果要达到自己手写代码时的那种确信程度,我大概还得花更多时间去验证——但即便如此,我依然觉得相当令人印象深刻:只需向这些 AI 助手发几句提示,就能在与程序员手写所需时间相差不多的情况下得到基本可用的代码。这些工具肯定比雇一个程序员便宜得多,而且如果你是以程序员的身份、而非天真的提示者的身份来使用它们,你会更快地得到可用的东西,因为你可以直接在某个基本正确的版本上修复 bug,而不必把大部分时间花在反复调整提示词上,只为让 AI 去掉一个对任何程序员来说都极易调试修复的 bug。
我见过很多程序员谈论“AI 永远无法取代程序员”,理由诸如“要把程序的细节描述到足够让它按你想要的方式工作,这本身就是在编程”。如果用户必须在一开始就正确、完整地描述程序如何工作,那这确实是个相当有力的批评;但当用户可以像我们这样反复迭代时,这个批评就弱得多了。用户不需要是程序员也能观察到输出是错的,这时就可以让 AI 去修正输出,重复这个过程直到输出看起来足够正确。软件对性能或正确性的要求越严格,这种天真的迭代方式就越不奏效。幸运的是,对于想用 LLM 来生成代码的人来说,如今线上运行的大多数软件对性能和正确性的要求其实相当宽松。人们基本上已经接受了软件充斥着大量 bug、在任意一周内遇到成百上千个 bug 是常态,以及广泛使用的软件常常比高度优化后可能达到的速度慢上十万倍。
一个比较贴切的类比是关于 AI 是否会取代人类客服的争论。即便这种取代已经在发生,仍有人声称这永远不会发生,理由是 AI 会犯人类不会犯的低级错误。但正如我们之前指出的,人类也经常犯同样的错误。而且,即便 AI 客服要差得多,只要性价比足够高,很多公司还是会选择更差、但更便宜的方案。科技公司在这方面尤为著名,对各种消费者支持都这么做,但在各行各业的公司中我们都能看到类似情况——例如,当你拨打任何大公司、甚至很多本地小企业的客服电话时,通常都会被推入语音菜单,或是某种糟糕的自动语音识别系统来替代语音菜单。这些系统的体验通常远不如一个拿最低工资的员工,但成本却比让最低工资员工接听每一通电话并转接到正确部门要低好几个数量级,所以公司选择了语音菜单。
真正相关的问题不是“AI 何时能让外行做出比程序员更好的软件?”而是“AI 何时能让外行做出像语音菜单和糟糕的语音识别在客服领域那样的软件?”。而且,现实地说,软件甚至不需要达到那么好,因为程序员比拿最低工资的客服人员贵得多,而这些工具每月只需 20 美元就能使用。我不知道 AI 还要多久才能取代一个合格的程序员,但如果最低标准只是做到像自动语音菜单转接电话那样水平的编程,我想我们很快就能达到——如果还没有达到的话。而且,就像客服领域一样,这不必是一场零和博弈。从语音菜单中省下的钱并不全都变成了利润——其中一部分会用于雇佣处理其他任务的客服人员。
顺带一提,我觉得这次体验中有一点很好笑:我尝试的两个平台,Storytell 和 Cursor,都经常会生成一个本可以自动检查出来的错误结果,而当我指出结果有误时,它们又能立刻修正。下面是与其中一个平台的典型交互过程:
- 我:请完成 X
- AI:[生成了一些 TypeScript 代码和测试,但无法通过类型检查]
- 我:这段代码通不过类型检查,能修一下吗?
- AI:[生成了一些代码和测试,但在执行测试时失败了]
- 我:运行时测试失败了,报错是 [粘贴测试失败信息]
- AI:[生成了一些代码和测试,这次通过了,并且在一些额外的基础测试中似乎也能正常工作]
另一个好笑的交互是,我会陷入一个循环:存在几个不同的 bug,让 AI 修其中一个,它又会把其他 bug 重新引入,即使我已经明确要求它不要再引入那些 bug。相比那些天天使用这类工具的人,我对它们的经验很少(我只是偶尔摆弄一下,看看它们进步了多少),我估计那些更有提示词经验的人,能够更快地写出能跳出这种循环的提示。
但即便如此,如果这些环境中的某一个能够接入执行环境,从而真正自动修复这类问题(在可修复的情况下),并能在简单的、天真的重提“刚才那样是错的,导致了 XYZ,请修复”无法解决问题时,判断出输出已知是错误的,那体验会好得多。
我问了比我熟悉这个领域得多(无论是技术上还是产品上)的 Josh Bleecher Snyder,为什么没有一个工具这么做,几乎也没有公司用这样的环境来做训练或微调,他的回答是,这个领域几乎所有人都信奉《苦涩的教训》,因而不会去做这类琐碎的改进。其想法是,搭建上述环境所需的那种枯燥的工程工作,将会被某种根本性的突破所淘汰,因此去做这些只能带来增量收益的事情是在浪费时间。Sam Altman 甚至建议那些依赖 OpenAI API 的公司的创始人,要假定会有巨大的进步,并围绕这种假定来构建公司,因为那些不这么做的公司将会被即将到来的巨大进步所淘汰。从我与这个领域的创始人和风投的交流来看,几乎所有人都把这话奉为圭臬。
我已经有 11 年没做过任何严肃的机器学习相关工作了,所以我的观点和其他外行人一样,没什么分量。但如果有人在 GPT-3 时代就对这样一个琐碎的系统做了逆向押注,那它当时似乎就会很有用,而且在今天的模型上依然有用,无论是用于训练/微调,还是为用户生成更好的输出。但我想,真正相关的问题是,今天再去尝试构建这样一个琐碎的系统是否还有意义——对于业内人士来说,这相当于对“进步”本身做一次逆向押注。据说大型 AI 实验室雇了一大批低薪的海外外包人员来做标注,但如果你想标注编程样例,从单个标注的成本来看,一个能产生标准正确答案的环境,肯定比付钱让人去标注要便宜,除非你只需要极少量的标注。在万亿美元、哪怕是 500 亿美元体量的公司层面,作为一种组合投资,似乎应该去做这样的押注。如果我想创办一家初创公司并下注,那还有意义吗?如果把所有鸡蛋都放在一个篮子里,情况也许就没那么明显了,但即便如此,也许依然有充分的理由去做,因为几乎整个行业都在押另一边?如果逆向的一方是对的,那么几乎没有竞争,这似乎有点类似于我们之前关于逆向招聘的讨论。
附录:游戏精神 vs. 为赢而玩
就我个人而言,当我在游戏中遇到侧信道攻击,或是遇到像 Perfect Words 那样只要为赢而玩就彻底崩坏的游戏时,我觉得应该尽可能避免去“攻击”游戏。我认为在《行动代号》中要完全做到这一点几乎是不可能的,因为人们会形成潜意识的联想(我注意到有人会在第一回合多猜一个词纯粹为了好玩,而这种猜测十有八九都能猜中——假设他们没有作弊,而我相信他们没有作弊,如此高的成功率强烈表明他们利用了某种侧信道信息。这不一定非得是来自卡片的位置信息,也可能只是潜意识里注意到了间谍大师正专注地盯着什么)。
Dave Sirlin 认为任何不利用一切合法手段去赢的人都是傻瓜(他轻蔑地把这类人称为“菜鸟”)(他说,只要赛事组织者没有禁止,就应该利用作弊手段去赢,比如在 FPS 游戏中使用地图外挂,而赛事应该明确列出禁止事项,避免使用笼统的“不要做坏事”这类规则)。我认为人们应该以自己觉得有趣的方式去玩游戏,并找到同样喜欢以那种方式玩游戏的群体。如果 Dave 觉得把各种随意的信息背下来以赢得这些游戏很有趣,那他就应该那么做。至于我——用 Dave Sirlin 的话来说——在本文讨论的这类游戏中之所以会像“菜鸟”那样玩,是因为这些游戏一旦认真对待往往就严重失衡,而我个人并不觉得它们失衡的方式有什么乐趣。在某些情况下,比如 Perfect Words,游戏的破绽是显而易见的,靠这种破绽去赢,我觉得很无聊。在另一些情况下,比如《行动代号》,只要花几个小时把一些随意的信息背下来就能破解游戏。对我来说,花几个小时去背 40 张可能的《行动代号》卡片,是一件既不好玩又没有产出的事,完全是毫无意义的活动。
附录:你可能会喜欢的猜词游戏
如果你喜欢猜词游戏,下面是一些同类推荐,思路和这份编程书推荐清单以及这份编程博客推荐清单类似,目的是指出人们通常喜欢或不喜欢某样东西的哪些特性(而不是像我看到的大多数评测那样,只讨论某样东西是“好”还是“坏”)。为了控制篇幅,这份清单只包含猜词游戏——这类游戏通常关注词语的含义,而不包括那些更关注词语拼写与操作的游戏,如 Banagrams、Scrabble 或 Anagrams,也不包括那些关注图像与词语之间映射的游戏,如 Dixit 或 Codenames: Pictures。
同样出于篇幅考虑,我不会讨论那些适用于本清单中所有或几乎所有游戏的、让人不喜欢的理由。例如,有人可能因为某个游戏是猜词游戏就不喜欢它,但为每个游戏都重复这一点没有意义。类似地,许多人会根据游戏的“重量”来选择游戏,并因为感觉“轻”而非“重”而讨厌几乎所有猜词游戏,但这些游戏都被认为是相当轻量的,所以也没有讨论的必要(不过如果你想要一个轻量但又紧张刺激的猜词游戏,在下面的清单中你可以考虑 Montage 或 Decrypto,而在未详细讨论的游戏中,则可以考虑 Scrabble 或 Anagrams,后者是我玩过的最残酷的猜词游戏,残酷程度遥遥领先)。
Taboo
一款需要快速给出线索、让队友猜出你手中词语的猜词游戏,每个目标词还附带 5 个禁止说的词,在给出线索时不允许说出这些词。
这是一款有趣、轻量的游戏,但有两个导致其可重玩性较低的问题:
- 由于每个被提示的词都是完全独立的,一旦你的游戏小组把整副牌过上一两遍、每个人都认识所有词语后,游戏就会变得极其简单;在我最早玩这个游戏的小组里,我觉得玩了两次后就出现了这种情况
- 即使还没到那一步,当人们意识到只要稍微绕个弯子就能相当容易地提示任何词语时,游戏在你因为玩得太多而无意中记住词语之前,就已经变得相当机械和程式化了
当人们不喜欢这款游戏时,往往是因为不喜欢这种快节奏游戏中巨大的时间压力。
Just One
一款有点像 Taboo 的猜词游戏,同样需要让队友猜出一个词,但不同之处在于,每个目标词不再有固定的禁用词表,禁用词是由你的队友动态生成的(每个人各给出一个线索词,任何被给出超过一次的线索都会被划掉)。
禁用词通过与队友的互动来产生,这让这款游戏的可重玩性比 Taboo 高得多。然而,有限的词表最终还是会遇到同样的问题——我的游戏小组在玩了大约 20 到 40 局后,就能认出几乎所有词语,并对每个词都有了一套不错的提示方法。
按书面规则的一个 quirks 是,这个游戏其实是为 5 人以上设计的,用 4 人玩时会变得非常简单,不过当你只有 4 人时,也完全没理由不能按 5 人局的规则来玩。
对这款游戏常见的一个抱怨是,考虑到游戏的售价(建议零售价 30 美元,而《行动代号》为 20 美元),其物理组件显得廉价且质量不高。另一个抱怨是,词语的难度差异极大,有些似乎是无意中造成的。例如,词表中包含了“grotto”(岩洞)这个词,如果有人没见过这个词,就很难给出线索,似乎是因为游戏最初是用发语开发的,在法语中提示“grotto”会相对容易得多。
Perfect Words
一款团队协作构建线索的猜词游戏,目标是让全队根据每组线索共同认同同一个词(只要大家达成一致,可以是任意词)。
其核心玩法——试图想出一组能让大家对所指词语达成一致的词——与像 Just One 这样玩法近乎相反的游戏形成了很好的互补,但实际的规则实现似乎存在严重缺陷。感觉就像游戏设计师自己不玩游戏,也没有找真正玩游戏的人来试玩。游戏在你第一次或第二次玩时就能被轻易破解,你必须故意把游戏中“竞技”的部分玩得很差,才能让游戏变得有趣
Montage
一款 2 对 2 的猜词游戏(如果你想让更多人参与,也可以像《行动代号》那样玩)。每队中,玩家轮流在固定的时间内分别负责给出线索和猜词。当前的版面状态对词语中特定位置必须出现的字母有所限制。给出线索的人需要想出一个能让猜词者猜出符合这些限制的词语的线索,但线索又不能太直白,因为如果对方两名玩家都在己方队友之前猜出了这个词,对手就会赢得这个词。
也许是这份清单上最难的游戏?我见过的大多数新玩家在第一次尝试时,往往在自己的回合内都想不出一个有效的线索(而一个好玩家如果搭档能比对手更快领会思路,每回合大概能成功提示至少 5 个词)。这可能也是清单上所有游戏中最奖励词汇量的游戏。它也是清单上唯一一款会锻炼“思考词语字母构成”这项技能的游戏,有点像 Scrabble。
只要你不是和固定搭档一起玩、依赖“秘密”约定或共享知识,这种直接对抗性的猜测机制就赋予了这款游戏非常高的可重玩性,至少不亚于清单上的任何其他游戏。
和 Perfect Words 一样,如果你喜欢这类玩法,其核心的猜词游戏本身是很有趣的,但围绕核心玩法设计的游戏规则似乎并没有经过很好的推敲,很容易被钻空子。这里的情况没有 Perfect Words 那么糟,但你仍然需要避免一心求胜,才能让游戏真正好玩起来。
据我观察,人们不喜欢这款游戏,通常是因为觉得它太难,或者不喜欢输——在这款游戏中,技术上的微小差距会导致比清单上其他游戏更大的结果差距,因此新玩家除非对手主动让步(而规则本身并没有让步机制)或自己通过玩其他游戏已具备一定的猜词游戏能力,否则应该做好被惨败的准备。我自己不怎么玩猜词游戏,尤其很少玩像 Scrabble 或 Anagrams 这类“严肃”的猜词游戏,所以玩这个时通常会被打得落花流水,但这恰恰是我觉得它有吸引力的地方,而这也正是很多人不喜欢它的原因。
Word Blur
一款猜词游戏,其限制在于你必须用摆在面前桌上的 900 块小词语瓷砖来组成线索。
我只玩过几次,因为我在本地不认识任何搞到一盒的人,但它看起来至少拥有不亚于清单上任何游戏的可重玩性。这款游戏最大的缺点是已经绝版十多年,而且以难以买到而闻名,不过看起来克隆一套应该并不太难。
当人们不喜欢这款游戏时,往往是因为不喜欢其核心玩法——看着一堆词语瓷砖并用它们来拼出描述,有些人会觉得这让人应接不暇。
觉得 Word Blur 过于复杂的玩家可以试试它的仿制品 Word Slam,它既更简单,也更容易买到,因为它不像前者那样是小众神作(虽然它似乎也已经绝版了)。Word Slam 只有 105 个词,而且词语是分好类的,这让游戏感觉没那么混乱。
Codenames
除了本文已提到的内容外没什么要补充的,这里只说说人们不喜欢这款游戏的常见原因。
每队中一个嗓门大的人就可能主导整个游戏,这一点比清单上的任何其他游戏都更明显(除了 Codenames: Duet)。而且虽然游戏附带了计时器,但很少有人使用(规则本身也基本暗示你不该使用计时器),所以另一个常见的抱怨是,和那些每回合都要想很久的人一起玩时,游戏会被无限拉长,而且除非你是间谍大师,否则在对方队伍回合时你几乎无事可做,导致游戏中有大段无聊的空档。
Codenames: Duet
虽然这款游戏被设计为《行动代号》的双人合作版本,但我玩的时候从来都是超过两人(通常是 4 到 5 人),只要你不介意讨论必须以半公开的方式进行,这样玩也完全没问题。
就可重玩性而言,Codenames: Duet 与《行动代号》大致处于同一水平,优缺点也基本相同。
Decrypto
我不打算尝试直接描述这款游戏,因为我见过的所有对玩法直白的解释,在新玩家实际玩上一两轮之前都无法让他们真正理解。但从概念上说,每队轮流由不同人给出线索,目标是让己方队员正确猜出哪个线索对应哪个词,同时让对方队伍猜错。猜测方有额外的信息——他们知道那些词是什么,因此更容易得出正确的对应关系。然而,猜测方产生的那组对应关系也会被“解密”方看到,所以他们可能会得知某个神秘词曾被“Lincoln”和“milliner”作为线索提示过,由此推断出这个词是“hat”,从而在下一条线索时正确猜出对应关系。
我玩这款游戏的次数还不够多,无法判断它的可重玩性到底有多高。有可能非常高,也有可能人们会摸索出一些技巧,让“解密”方基本不可能猜出对应关系。我观察到的一个主要缺点是,当与随机组成的玩家群体一起玩时,游戏的胜负往往取决于哪一队拥有最弱的玩家(在我见过的随机组局中每次都是如此),这与很多团队和合作游戏常见的问题恰好相反——在那些游戏中,往往是最强的玩家主导了游戏。在这里,高手很难做出决定胜负的操作,但菜鸟却很容易做出导致输掉游戏的操作,所以当与非高手一起玩时,哪队有最差的玩家,哪队就会输。
Person Do Thing
David Turner 说:
Person Do Thing 有点像 Taboo,但不同之处在于,它没有禁用词表,而是有一份可用词表。有 40 个基础词始终可用,(如果你愿意)每个秘密词还有 3 个专属的额外可用词。和 Taboo 一样,出题者可以对猜测做出回应——但只能使用这些可用词。由于可用词非常少,要给出好的线索需要很多创造力……值得玩几次,但就我上次查看时,它的词表非常小。
我想如果一个群体玩得多了,可能会发展出一些约定俗成的暗号,例如用“像人但不思考大的东西”来表示“动物”。我听说在 Concept 中就发生过类似情况:有一个群体约定用红、白、蓝和地点来指代拥有这些旗帜颜色的国家,再用一个额外的修饰词来具体指明:用水指英国,用寒冷指俄罗斯,用食物指法国,用枪支指美国。我认为需要相当多的这类约定,才能让游戏明显变简单。
Semantle
有点像 Wordle,但猜的是基于 word2vec 的词语含义。最初被设计为单人游戏,但作为合作游戏来玩也很合适。
虽然我相信有人会乐此不疲地反复玩这个游戏,但我觉得对大多数人来说,它的可重玩性相当低(而且我认识的人中几乎没有人玩超过 40 局,所以我觉得我的感受并不少见)。一旦你玩了一段时间,摸索出如何通过猜词来快速缩小搜索空间,游戏玩起来就开始有点程式化了。
我聊过的大多数不喜欢这款游戏的人,都是因为无法在脑中建立起对游戏机制的心智模型,导致词语相似度分数看起来像是随机的胡话。
- 如果你觉得这个模式太简单,能够做到每次都准确地让你的队伍猜中你想要的任意三块瓷砖,并且对存在哪些图案有足够的直觉、通常能避免被 AI 击败,你可以尝试另一种模式:在该模式下,AI 每回合可以猜一个词,如果它猜对的这一个词足以将搜索空间缩小到只剩一种可能的版面,它就会通过猜出剩余的所有词语来获胜。一般来说,如果你每回合猜三个词,就足以把搜索空间缩小到让 AI 只需猜一个词就能获胜的程度(用游戏术语来说,AI 会给出一个“无限”线索 [返回]
随机一篇博客
评论
登录后参与讨论