成為高品味測試員
原文由 Shawn Wang 于 發布,訂閱此部落格
寫這篇文章有個特定原因,目前還不能公開,但我先把準備工作公開分享出來
「高品味測試員」是實驗室對那些經常對前沿模型下判斷的影響力人物的稱呼,因為他們能用有創意、有趣的方式來測試模型(相較於像 FrontierMath、IMO 或其他任何「標準人類專家測試」)。成為 HTT 還算有點價值,而且我覺得某種程度上可以靠 few-shot 學習來達成。
以下是我收集的範例和心得
- https://nicholas.carlini.com/writing/2024/my-benchmark-for-large-language-models.html
- 從你的 ChatGPT 對話紀錄裡抓範例
- https://simonwillison.net/2025/Jun/6/six-months-in-llms/
- 有點無厘頭但無可否認地有趣又視覺化的測試
- 更多視覺化測試:https://mcbench.ai/
- every.to 的 Dan Shipper
- https://every.to/vibe-check/vibe-check-openai-s-4o-image-generation
- 用於圖片生成測試
- https://every.to/vibe-check/we-tried-openai-s-new-agent-here-s-what-we-found
- 「我們請它幫忙了解 Spotify Wrapped 這些年來的演變。一開始是什麼樣子?現在多了哪些新東西?」
- https://every.to/vibe-check/we-tried-openai-s-new-deep-research-here-s-what-we-found
- 「我們讓它整理 Every 在過去五年中的發展歷程,做成一份龐大的時間軸」
- 「我們請它閱讀《戰爭與和平》第一章,留意托爾斯泰如何透過描寫來揭示角色的內心世界,並推斷這反映了他對人性有何看法。」
- 「這裡有幾張我穿著最喜歡的衣服的照片,我喜歡這些品牌,我的身形比例是 X、Y、Z——幫我設計一個膠囊衣櫥,並推薦符合我風格的店家。」
- 挖掘立法文件:「我們請 deep research 去查找 10 到 15 年前的大型支出法案,並驗證其預期效果是否達成。」
- 揪出 10-K 財報中的異常。請它找出近期有錯誤或可疑數據的企業申報文件時,deep research 只找出了已知的問題,而不是去挖掘全新的問題。這顯示除非明確催促它,否則它很大程度上只是依賴已經被標記過的資訊,而非真正去「調查」。
- https://every.to/vibe-check/vibe-check-openai-enters-the-browser-wars-with-chatgpt-agent
- https://every.to/vibe-check/vibe-check-openai-s-4o-image-generation
- ben hylak
- riley goodside
- and zack witten
- 幽默與迷因
- https://karpathy.github.io/2012/10/22/state-of-computer-vision/ 在 GPT-4 中被引用 https://x.com/karpathy/status/1635697741925064704
- 其他迷因
屬於「我的領域」的東西
- 推文摘要工具
- YouTube 摘要與時間戳記工具 https://gemini.google.com/gem/da23325c2fca
- https://github.com/openai/codex
codex --full-auto "create the fanciest todo-list app"
- https://github.com/swyxio/openai-test-sandbox
- https://github.com/stackblitz-labs/bolt.diy
隨機一篇部落格
留言
登入後參與討論