DeepSeek V4 Flash 自評篩選準確率升至 88% 超越 Claude Fable 5
來源:
x.com
Stanford 團隊用 DeepSeek V4 Flash 採樣 5 個答案並讓同一模型自評打分,在 Terminal-Bench 2.1 上準確率從 79% 提升至 88%,超越 Claude Fable 5,且成本僅爲對方 1/11。該方法驗證了 test-time scaling 的潛力,相關框架已開源,可復現。