成为高品味测试员
原文由 Shawn Wang 于 发布,订阅该博客
写这篇文章有一个具体原因,暂时还不能透露。但我会把准备工作公开分享出来
“高品味测试员”(high taste tester)是实验室对一类意见领袖的称呼,他们经常对前沿模型做出评判,因为他们能以有创意、有趣的方式来测试模型(相比之下,像 FrontierMath、IMO 或其他任何“标准人类专家测试”就没那么灵活)。成为一名 HTT 还是有一定价值的,而且我认为你完全可以通过少样本学习的方式快速上手。
以下是我收集的案例和心得:
- https://nicholas.carlini.com/writing/2024/my-benchmark-for-large-language-models.html
- 从你的 ChatGPT 历史记录中抓取案例
- https://simonwillison.net/2025/Jun/6/six-months-in-llms/
- 有点无厘头,但不可否认既有趣又直观的测试
- 更多视觉类测试:https://mcbench.ai/
- every.to 的 Dan Shipper
- https://every.to/vibe-check/vibe-check-openai-s-4o-image-generation
- 用于图像生成测试
- https://every.to/vibe-check/we-tried-openai-s-new-agent-here-s-what-we-found
- “我们让它帮忙梳理 Spotify Wrapped 这些年来的演变。它最初是什么样的?现在新增了哪些内容?”
- https://every.to/vibe-check/we-tried-openai-s-new-deep-research-here-s-what-we-found
- “我们让它整理了一份关于 Every 在过去五年中发展的庞大时间线”
- “我们让它阅读《战争与和平》的第一章,留意托尔斯泰如何通过描写来揭示人物内心,并推断这体现了他怎样的人性观。”
- “这是我穿最喜欢的几套衣服的照片,我喜欢这些品牌,我的身材比例是 X、Y、Z——帮我设计一个胶囊衣橱,并推荐适合我风格的店铺。”
- 挖掘立法文件:“我们让 deep research 去查找 10 到 15 年前的大额支出法案,并验证其预期效果是否已经实现。”
- 在 10-K 年报中发现异常。要求它找出近期存在错误或可疑数据的公司财报时,deep research 只是找出了已知的问题,而没有去挖掘全新的问题。这表明除非被明确推动,否则它很大程度上依赖于已被标记过的内容,而不是真正去“调查”。
- https://every.to/vibe-check/vibe-check-openai-enters-the-browser-wars-with-chatgpt-agent
- https://every.to/vibe-check/vibe-check-openai-s-4o-image-generation
- Ben Hylak
- Riley Goodside
- 和 Zack Witten
- 幽默和梗
- https://karpathy.github.io/2012/10/22/state-of-computer-vision/ 在 GPT-4 中被引用 https://x.com/karpathy/status/1635697741925064704
- 其他梗
那些属于“我擅长”的东西
- 推文总结器
- YouTube 总结与时间戳工具 https://gemini.google.com/gem/da23325c2fca
- https://github.com/openai/codex
codex --full-auto "create the fanciest todo-list app"
- https://github.com/swyxio/openai-test-sandbox
- https://github.com/stackblitz-labs/bolt.diy
随机一篇博客
评论
登录后参与讨论