Terminal Bench 82.7 反超 Pro 預覽版:V4-Flash Agent 能力拆解
Terminal Bench 82.7 反超 Pro 預覽版V4-Flash Agent 能力拆解先說一個反常識的事實2026 年 7 月 31 日上線的 DeepSeek-V4-Flash 正式版在一個關(guān)鍵 Agent 基準上把自己的大哥 V4-Pro-Preview 踩在了腳下——Terminal Bench 2.1 得分 82.7獨立測算比 V4-Pro-Preview 高約 14.7%。這不是 Pro 版拉胯。恰恰相反它說明一個被很多團隊忽略的事實決定 coding agent 上限的不只是模型參數(shù)還有后訓練怎么打磨。據(jù)公開信息這次升級沒有更換模型架構(gòu)、沒有增加參數(shù)量官方的主要動作是重新做后訓練Agent 能力就出現(xiàn)了肉眼可見的躍升。這篇文章把官方公布的基準逐個拆開講清楚每一分到底測的是什么、對做代碼助手的團隊意味著什么以及這份成績單里藏著哪些沒說出口的限定條件。一個 Flash 版憑什么讓 Pro 預覽版尷尬先對齊一個前提DeepSeek-V4 系列走的是雙軌策略——V4-Pro 是旗艦V4-Flash 是輕量版主打低延遲、低成本。按常理Flash 版應該是夠用就好的定位Pro 版才是性能天花板。但這次正式版更新官方把升級重點全部押在了 Flash 的 Agent 能力上本次僅升級了 V4-Flash 的 API 接口V4-Pro API 及 APP/WEB 端模型未做任何更改V4-Pro 正式版將會盡快發(fā)布。翻譯成人話你現(xiàn)在能拿到的最強 DeepSeek Agent 能力不在 Pro 上在 Flash 上。對正在選型的人來說這直接改變了一個判斷——之前要 Agent 能力就等 Pro 正式版的預期不成立了。想用上 DeepSeek 打磨過的 Agent 能力現(xiàn)在就可以動手不必等。Terminal Bench 2.1 82.7這不是寫代碼分數(shù)是干活分數(shù)Terminal Bench 評測的是 agent 在真實終端環(huán)境里完成工程任務的能力跑命令、讀報錯、改代碼、反復試錯直到任務完成。它和傳統(tǒng)代碼生成基準最大的區(qū)別是——沒有一次寫對的優(yōu)雅只有最終搞定的結(jié)果。測的是 agent 在無人看管情況下獨立把活干完的耐力。V4-Flash 正式版在 Terminal Bench 2.1 拿到 82.7這個數(shù)字的多源驗證情況如下基準分數(shù)校驗狀態(tài)說明Terminal Bench 2.182.7? 多源一致終端工程任務獨立測評方亦引用該數(shù)NL2Repo54.2? 多源一致自然語言需求 → 完整代碼倉庫Toolathlon verified70.3? 多源一致工具調(diào)用能力verified 為嚴格判定版DSBench-Hard59.6 僅官方口徑DeepSeek 內(nèi)部難題測試集無獨立來源可核所以呢82.7 意味著什么它不是寫 100 段代碼對 82 段的作文分而是丟進真實終端環(huán)境、100 個任務里獨立干完 82.7 個的實戰(zhàn)分。對做代碼助手的團隊這個數(shù)字比任何代碼生成類分數(shù)都更接近用戶體驗。你的用戶感知到的不是模型會寫代碼而是它自己把活干完了沒有。NL2Repo 54.2從一句話到一整個倉庫NL2Repo 測的是更野的場景給 agent 一句自然語言需求比如寫一個帶 JWT 認證的 FastAPI 項目包含遷移腳本和測試它要端到端產(chǎn)出一個結(jié)構(gòu)完整、能跑的代碼倉庫——包括目錄組織、依賴聲明、配置文件和測試。54.2 分不高但這類任務的難點在于沒有標準答案只有能不能跑。倉庫級生成最容易翻車的地方恰恰不在主邏輯而在那些沒人寫文檔的邊角版本兼容、路徑假設(shè)、環(huán)境配置。所以呢如果你的產(chǎn)品是自然語言生成項目腳手架或者從需求直接起步的研發(fā)助手這個分數(shù)比 Terminal Bench 更值得盯——它直接對應你用戶的第一屏體驗輸入需求后看到的是一堆能跑的文件還是三秒后的報錯。Toolathlon verified 70.3Agent 的手腳靈活度Toolathlon 測的是工具調(diào)用——agent 能不能正確決定該調(diào)哪個工具、傳什么參數(shù)、拿到結(jié)果后下一步干什么。verified 后綴意味著結(jié)果是嚴格校驗過的不是模型自報。70.3 這個分數(shù)放在當前模型梯隊里屬于什么水平不同榜單口徑略有差異但它反映的能力方向很明確多步工具調(diào)用的可靠性。對做代碼助手的團隊這直接決定一個高頻場景的成敗——你的 agent 要調(diào) linter、跑測試、讀日志、改文件任何一步工具調(diào)用出錯整條鏈就斷了。所以呢工具調(diào)用是 Agent 的手腳模型能力再強手腳不穩(wěn)也干不成活。70.3 的 verified 分數(shù)意味著在每步都要動手的工程任務里這個模型值得一試而不是直接排除。至于具體體驗如何必須拿你的真實工具鏈跑一輪才知道。和 V4-Pro-Preview 比到底強了多少文章摘要里說多項基準遠超 V4-Pro-Preview獨立來源 flowtivity 的測算給出了一個具體數(shù)字Terminal Bench 2.1 上比 V4-Pro-Preview 高約 14.7%。注意一個細節(jié)這次對比的基準是預覽版Pro不是正式版。官方明確表示 V4-Pro 正式版將會盡快發(fā)布——也就是說Flash 正式版目前的領(lǐng)先很可能是暫時的。預覽版和正式版之間的差距通常正是后訓練打磨的那部分而這次 Flash 的躍升恰恰來自后訓練。所以呢現(xiàn)在這個時間點做選型決策正確的姿勢是短期1-3 個月內(nèi)需要 Agent 能力V4-Flash 正式版是當下可用的最優(yōu)解但如果你的架構(gòu)切換成本高值得等 V4-Pro 正式版發(fā)布后再做最終決定。不要因為 Flash 領(lǐng)先就斷言 Pro 不行——這兩者的差距正是后訓練投入的差距。對做代碼助手團隊這是當下性價比最高的入口之一把數(shù)據(jù)放回成本視角事情就更清楚了。獨立來源 flowtivity 測算 V4-Flash 輸入價格約$0.14/百萬 tokens——一個 Flash 版模型Agent 能力打到了 Pro 預覽版之上價格卻是輕量版的價位。對做代碼助手的團隊這意味著試錯成本極低用 Flash 版跑通你的工具鏈驗證花的錢幾乎可以忽略單位成本下的 Agent 能力密度高同樣預算能支撐的用戶量級和調(diào)用頻率完全不同調(diào)用方式零遷移成本模型名設(shè)為deepseek-v4-flash即可base_url不變兼容 OpenAI/Anthropic 接口官方文檔確認API 調(diào)用方式與之前完全一致兼容 OpenAI ChatCompletions 與 Anthropic 接口Claude Code、GitHub Copilot、OpenCode 等工具可直接把 DeepSeek 作為后端模型使用無需改代碼importosfromopenaiimportOpenAI clientOpenAI(api_keyos.environ.get(DEEPSEEK_API_KEY),base_urlhttps://api.deepseek.com,)responseclient.chat.completions.create(modeldeepseek-v4-flash,# 已自動指向 V4-Flash-0731messages[{role:system,content:你是資深后端工程師},{role:user,content:幫我定位這個 repo 里測試偶發(fā)失敗的原因},],streamFalse,)print(response.choices[0].message.content)所以呢高性價比不是營銷話術(shù)是這次發(fā)布最硬的事實Agent 能力反超 Pro 預覽版 輕量版定價 零遷移成本三個條件同時滿足的情況在主流模型里并不多見。潑冷水這份成績單的三條限定條件拆完分數(shù)說三個容易被忽略的坑第一DSBench-Hard 是 DeepSeek 內(nèi)部測試集。59.6 這個數(shù)字目前只有官方口徑?jīng)]有獨立機構(gòu)跑過同樣的測試集。引用時請務必帶上據(jù) DeepSeek 官方的限定它和 Terminal Bench 這類公開基準的可比性完全不同。第二基準分數(shù)翻倍的說法需要打折。部分媒體在傳播編碼 agent 基準分數(shù)翻倍但多源對照后官方口徑和獨立報道用的都是大幅增強遠超預覽版這類表述翻倍沒有獲得明確印證。真實的提升幅度是顯著的但翻倍很可能只對個別子項成立不建議當通用結(jié)論傳播。第三Agent 分數(shù)高 ≠ 全能力領(lǐng)先。官方只聲稱 Agent 能力增強通用對話、長文本等維度并未聲明提升。選型時如果你的場景偏 RAG、偏寫作而非工程執(zhí)行這個分數(shù)對你不構(gòu)成決策依據(jù)。結(jié)尾Flash 的逆襲值得重新審視你的模型分層最后說點行業(yè)層面的觀察。V4-Flash 這次的表現(xiàn)對Flash低配的刻板印象是一次有力的修正后訓練投入可以顯著拉開同架構(gòu)模型的 Agent 能力差距輕量版模型完全可以通過打磨獲得超出定位的表現(xiàn)。對做代碼助手的團隊現(xiàn)在的局面其實很微妙一邊是 Flash 正式版已經(jīng)可用的高性價比 Agent 能力一邊是官方預告的 V4-Pro 正式版。你是現(xiàn)在就切 Flash 跑起來還是等 Pro 正式版一步到位我的建議是后者不沖突——先用 Flash 驗證工具鏈Pro 發(fā)布后再做成本與能力的權(quán)衡。數(shù)據(jù)來源DeepSeek API 官方文檔與更新日志2026-07-31、IT之家2026-07-31、極客公園2026-07-31、flowtivity.ai 獨立測算2026-07、Unsloth 模型頁。DSBench-Hard 分數(shù)為 DeepSeek 官方口徑定價為第三方測算值正式價格以官方定價頁為準。

相關(guān)新聞

國產(chǎn)新模型說寫代碼超了 Claude,我真調(diào)了一遍

國產(chǎn)新模型說寫代碼超了 Claude,我真調(diào)了一遍

最近國產(chǎn)大模型集體刷屏。Kimi K3,目前最大的開源模型;GLM-5.2,MIT 許可能商用;還有 DeepSeek-V4,一個個都號稱 coding 能力屠榜,某些項超過了 GPT、超過了 Claude。 榜分是好看。但做過開發(fā)的都知道,榜分和「真寫代碼好不好用」是兩回事。所以我沒看榜,直接調(diào)它們的 API,拿兩道…

2026/8/2 8:35:18 閱讀更多
AI工程實踐:從安全沙箱到資源隔離的Containment架構(gòu)設(shè)計

AI工程實踐:從安全沙箱到資源隔離的Containment架構(gòu)設(shè)計

1. 項目概述:從“隔離”到“集成”的工程哲學 最近在技術(shù)社區(qū)里,關(guān)于Claude Code、Claude Desktop等產(chǎn)品的討論熱度一直很高,很多開發(fā)者都在嘗試安裝、配置,并探索如何將其集成到自己的開發(fā)流中。與此同時,一個更底層、…

2026/8/2 8:35:18 閱讀更多
Unity DOTS中EntityCommandBufferSystem的原理與實戰(zhàn)應用

Unity DOTS中EntityCommandBufferSystem的原理與實戰(zhàn)應用

1. 項目概述:為什么我們需要EntityCommandBufferSystem? 如果你正在用Unity的DOTS(面向數(shù)據(jù)的技術(shù)棧)做項目,尤其是ECS(實體組件系統(tǒng))部分,那么你大概率已經(jīng)踩過或者即將踩到一個大坑…

2026/8/2 8:35:18 閱讀更多
197、AI驅(qū)動的質(zhì)量評價:無參考評價模型訓練與部署實踐

197、AI驅(qū)動的質(zhì)量評價:無參考評價模型訓練與部署實踐

197、AI驅(qū)動的質(zhì)量評價:無參考評價模型訓練與部署實踐 去年夏天,我在產(chǎn)線調(diào)試一款車載環(huán)視系統(tǒng)的圖像質(zhì)量??蛻敉对V說,某批次攝像頭在黃昏場景下輸出的畫面“看著不對勁”,但所有客觀指標——信噪比、動態(tài)范圍、色彩還原——都在規(guī)格書范圍內(nèi)。我盯著屏幕上的圖像,確實,…

2026/8/2 9:45:20 閱讀更多
北京次渠寵物彩超檢查哪家專業(yè)

北京次渠寵物彩超檢查哪家專業(yè)

最近,一位北京通州的鏟屎官在小區(qū)群里哭訴:家里養(yǎng)了5年的金毛突然食欲不振、呼吸急促,跑了兩家寵物醫(yī)院都說“可能只是感冒”,結(jié)果病情惡化后送到專業(yè)機構(gòu),一查竟是嚴重的心臟病——錯過最佳治療時機,最終花…

2026/8/2 9:45:20 閱讀更多
XGBoost實戰(zhàn):從環(huán)境配置到模型部署的完整Python指南

XGBoost實戰(zhàn):從環(huán)境配置到模型部署的完整Python指南

1. 項目概述:為什么XGBoost值得你投入時間 如果你在機器學習領(lǐng)域摸爬滾打過一陣子,尤其是在處理結(jié)構(gòu)化數(shù)據(jù)的分類或回歸任務時,一定繞不開“XGBoost”這個名字。它不是什么新潮的算法,但絕對是競賽場上的“大殺器”和工業(yè)界的“老…

2026/8/2 9:45:20 閱讀更多
3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南 【免費下載鏈接】GetQzonehistory 獲取QQ空間發(fā)布的歷史說說 項目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾想過,那些年發(fā)過的QQ空間說說,那些記錄青春的文字…

2026/8/2 0:04:01 閱讀更多
3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南

3分鐘搞定!QQ空間歷史說說完整備份終極指南 【免費下載鏈接】GetQzonehistory 獲取QQ空間發(fā)布的歷史說說 項目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory 你是否曾想過,那些年發(fā)過的QQ空間說說,那些記錄青春的文字…

2026/8/2 0:04:01 閱讀更多
AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O 分配 PCB

AMAT 0100-02186 I/O分配PCB板是應用材料(Applied Materials)公司生產(chǎn)的一款用于半導體設(shè)備的I/O信號分配電路板。該型號(0100-02186)的核心特點如下:專用于Endura等半導體工藝腔室。集成信號路由與分配功能。連接控制…

2026/8/2 2:51:21 閱讀更多
Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動機

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動機

Nissei Corp FFMN-32L-10-T0 40AX 三相異步電動機是日本日清(Nissei)品牌的一款工業(yè)用三相異步電機,適用于自動化設(shè)備及通用機械驅(qū)動。該型號(FFMN-32L-10-T0 40AX)的核心特點如下:三相交流異步電動機。額定…

2026/8/2 2:52:49 閱讀更多