LLMs predict my coffee

Dynomight

大模型预测我的咖啡

原文由 Dynomight 发布,订阅该博客

写代码、做数学,诸如此类。大模型能预测物理实验的结果吗?

假设我将 8 盎司(226.8 克)沸水倒入一个重 1.25 磅(0.57 千克)的陶瓷咖啡杯中。周围空气静止,温度为 20 摄氏度。杯子初始温度为室温。请给出水温随时间变化的方程,单位为摄氏度。方程中唯一的自由变量应为注水后经过的秒数 t。请重点保证前 5 分钟内的准确性。

这听起来很难吗?我觉得很难。至少涉及以下物理现象:

  1. 水、杯子、空气和桌面之间的热传导。
  2. 上述各物体内部的热传导。
  3. 水和空气内部的对流(流体运动)。
  4. 水分子汽化带来的蒸发冷却。
  5. 水蒸气在空气中的运动。
  6. 辐射。(和所有物质一样,杯子和水都会发射与温度相关的红外辐射。)
  7. 表面张力、热胀冷缩、水冷却时空气重新溶入水中,可能还有更多。

而且提示词里还有很多细节没有说明。杯子是瓷的还是炻器的?杯子是什么形状?桌子是什么材质?空气湿度如何?我又是如何把空间上分布不均的水温归结为一个数值的?

所以这不是一个靠思考就能找到“正确答案”的问题。现实太复杂了。相反,回答这个问题需要“品味”——猜测哪些因素最重要,对缺失的细节做出假设,等等。

于是我把这个问题抛给了一堆大模型。它们的回答如下:

(严格来说,它们给出的是文本形式的方程。我把这些方程画成了图。)

这些曲线让我感到意外,无论是它们预测的初期降温速度,还是后期降温的缓慢程度。它们认为前几分钟的降温幅度竟和之后将近一小时的降温幅度相当。这可能吗?

然后我做了这个实验。首先,我等到环境温度恰好达到 20 摄氏度。接着,我用量杯量取 8 盎司水,用微波炉加热至沸腾,稍作静置让温度均匀一下,再次用微波炉加热至沸腾。然后,我把水倒入放有数字温度计的 1.25 磅咖啡杯中,每隔五秒大声报出读数,由 Dynomight Biologist 紧张地记录下来。随后我逐渐将测量间隔延长至 15 秒、30 秒、1 分钟,最后到 5 分钟。

结果如下:

或者,这是前五分钟的放大视图:

这些预测都还行,但都不算出色。Claude 4.6 Opus 可能是表现最好的,不过它消耗了价值 0.61 美元的 token。(此处应有一个关于物理实验/国防部/经费/咖啡的笑话。)

话说回来,预测中让我惊讶的是前几分钟温度下降得很快,而之后下降得很慢。但实验结果显示,初期降温甚至更快,而后期的降温则更慢。所以如果你想把我的直觉和大模型的预测做个集成,我猜我的直觉权重会是零。

总之,它们或许会抢走我们的数学工作,但要抢走我们精细的动手能力,速度会慢一些。感谢阅读又一个中学生科学小实验。

(附录:数据与方程)

你可以在这里找到 CSV 格式的数据。第一列是 MM:SS 格式的经过时间,第二列是以分钟为单位的经过时间,第三列是测得的温度。

以下是所有模型给出的关于 T(t) 的实际方程,即 t 秒后的预测温度。

大模型T(t)成本
Kimi K2.5 (reasoning)20 + 52.9 exp(-t/3600)+ 27.1 exp(-t/80)$0.01
Gemini 3.1 Pro20 + 53 exp(-t/2500) + 27 exp(-t/149.25)$0.09
GPT 5.420 + 54.6 exp(-t/2920) + 25.4 exp(-t/68.1)$0.11
Claude 4.6 Opus (reasoning)20 + 55 exp(-t/1700) + 25 exp(-t/43)$0.61 (eeek)
Qwen3-235B20 + 53.17 exp(-t/1414.43)$0.009
GLM-4.7 (reasoning)20 + 53.2 exp(-t/2500)$0.03

有趣的是,它们全部都基于一到两个指数衰减项。可以这样理解:把 exp(-t/b) 看作一个函数,当 t 为零时值为 1,随后逐渐减小。b 秒后,它会降至 1/e ≈ 0.368,此后每过 b 秒就再乘以 0.368,一直持续下去。

因此,这些模型大多有一个“快速率”,反映水向杯子的热流,以及一个“慢速率”,反映水/杯子向空气的热流。有少数模型省略了快速率。我也试过 DeepSeek 和 Grok,但它们只是无休止地胡乱尝试,始终没有返回答案。它们还很贴心地为此向我收费了。

本文章由 muse-spark-1.2-contributor 进行翻译

评论