勵(lì)模型做成可復(fù)用Agent Skill)
一句話講清楚阿里巴巴 Qwen 團(tuán)隊(duì)提出 Skill-RM 把異構(gòu)的獎(jiǎng)勵(lì)評(píng)估標(biāo)準(zhǔn) rubric 、參考答案、 checklist 、 verifier 等封裝成可執(zhí)行的 Reward-Evaluation Skill 讓 Agent 按需檢索資源、收集證據(jù)并聚合打分在 RewardBench2 、 RM-Bench 、 JudgeBench 三項(xiàng)基準(zhǔn)上以 Qwen3.5-27B 骨干取得 86.2 平均分超越同骨干 LLM-as-a-Judge 基線 2.3 分。論文標(biāo)題Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill論文鏈接https://arxiv.org/abs/2606.03980Github 鏈接https://github.com/Qwen-Applications/Skill-RM一道 JSON 題暴露 RM 的「拼湊困境」論文 Figure 1 給了一個(gè)極簡(jiǎn)但典型的判卷場(chǎng)景。 Prompt 要求寫一個(gè)normalizeScores(values)函數(shù)返回包含minScore、maxScore、normalizedScores的 JSON 字符串。兩個(gè)候選回答擺在一起■A用了 snake_case 鍵名 JSON 結(jié)構(gòu)也不對(duì)■B camelCase 鍵名正確字段齊全。怎么判如果只看「像不像好代碼」兩個(gè)回答都可能騙過淺層 judge 。真正靠譜的評(píng)估要同時(shí)動(dòng)用好幾類資源1.Rubric代碼類任務(wù)優(yōu)先跑測(cè)試2.Checklist camelCase 標(biāo)識(shí)符、精確 JSON 鍵名3.Verifier Python sandbox 執(zhí)行parse_json檢查4.Aggregation rule正確性優(yōu)先于風(fēng)格平局才看次要維度。傳統(tǒng) LLM-as-a-Judge 會(huì)把上述內(nèi)容全塞進(jìn)一個(gè) prompt 讓模型自己琢磨先看哪條、后看哪條。 Skill-RM 換了個(gè)思路把這些資源寫進(jìn) Reward-Evaluation Skill 按固定流程「診斷 → 選資源 → 驗(yàn)證 → 聚合」走一遍。論文示例軌跡里 A 得 2/5 B 得 5/5 最終選 B——每一步證據(jù)都掛在結(jié)構(gòu)化輸出里事后能復(fù)查。這個(gè)例子雖小卻點(diǎn)中了當(dāng)下 RM 的核心矛盾評(píng)估標(biāo)準(zhǔn)已經(jīng)碎片化編排層卻還停留在 flat prompting。背景 RM 從「打分器」變成「多源驗(yàn)證器」做過 RLHF 管線的人大概都踩過坑訓(xùn)練用的 reward 信號(hào)和線上用戶真實(shí)偏好經(jīng)常對(duì)不上。數(shù)學(xué)題步驟全對(duì)、答案錯(cuò)一位標(biāo)量 RM 仍可能給高分代碼能跑通、變量命名違規(guī) flat judge 有時(shí)又過度糾結(jié)風(fēng)格。大模型后訓(xùn)練里 Reward Model RM 是 RLHF 、 RFT 、 GRPO 等流程的「方向盤」。早期范式是點(diǎn)式標(biāo)量預(yù)測(cè)優(yōu)化目標(biāo)為是 prompt 是回答 輸出一個(gè)數(shù)。簡(jiǎn)單、快但信息損失大。模型能力往推理、代碼、工具調(diào)用方向擴(kuò)張后「怎么判好壞」也跟著變復(fù)雜■數(shù)學(xué)題要對(duì)答案、跑 verifier ■代碼題要過單元測(cè)試■安全場(chǎng)景要拆約束、做 policy veto ■事實(shí)類問題要查 reference 、檢索證據(jù)■Agent 軌跡要逐步校驗(yàn) tool call 合法性。信號(hào)來源各異現(xiàn)有設(shè)計(jì)卻缺統(tǒng)一編排。標(biāo)量 RM 把多維證據(jù)壓成不透明分?jǐn)?shù) LLM-as-a-Judge 能寫理由但資源選擇、證據(jù)追蹤、信號(hào)聚合往往藏在模型「直覺」里難復(fù)現(xiàn)。 rubric 條件化、工具增強(qiáng) judge 等方向各有進(jìn)展大多一次只暴露一種資源模態(tài)——缺的是可復(fù)用、可編排、證據(jù)可追溯的抽象層。Agent Skill 范式為何能遷移到 RM Anthropic 的 Agent Skills 、開源 agentskills.io 規(guī)范把「怎么做一類任務(wù)」打包成文件系統(tǒng)制品核心是SKILL.md流程 元數(shù)據(jù)旁邊掛腳本、參考文檔、可執(zhí)行資源 Agent 按需漸進(jìn)式加載。獎(jiǎng)勵(lì)評(píng)估和 Agent 做任務(wù)底層邏輯很像都要在多種工具/文檔里選對(duì)資源、按步驟執(zhí)行、留下可復(fù)查記錄。 Anthropic 的 Skill 把這類流程固化成文件 Skill-RM 把它專門用到「怎么給模型回答打分」。論文把資源庫(kù)分成五類每類在判卷鏈路里各司其職資源類型例子作用Rubric Criterion有用性、正確性、安全定義評(píng)判維度與優(yōu)先級(jí)Reference答案鍵、證據(jù)段落支撐事實(shí)/數(shù)學(xué)正確性Checklist Constraint格式要求、禁止行為把指令遵循拆成可檢查項(xiàng)Verifier ToolPython sandbox產(chǎn)出可執(zhí)行觀測(cè)Calibration Aggregation證據(jù)優(yōu)先級(jí)規(guī)則解決沖突、映射到最終判斷Skill-RM 的核心動(dòng)作把獎(jiǎng)勵(lì)知識(shí)外化成Reward-Evaluation Skill——帶資源庫(kù)、調(diào)用協(xié)議、證據(jù) schema 的可執(zhí)行評(píng)估程序相當(dāng)于給 judge 一份「判卷說明書」加「工具箱」。Skill-RM 總覽 Reward-Evaluation Skill 含流程文檔與結(jié)構(gòu)化資源庫(kù)評(píng)估時(shí)動(dòng)態(tài)檢索 rubric 、 verifier 等資源產(chǎn)出可追溯的 Agentic 評(píng)估軌跡。三步走 Skill-RM 實(shí)際怎么判一道題把形式化定義翻譯成工程語(yǔ)言流程可以壓成三步。第一步加載 Skill 規(guī)格。 類似讀SKILL.md這次要評(píng)哪些準(zhǔn)則輸出格式是點(diǎn)式分?jǐn)?shù)、成對(duì)偏好還是從 個(gè)候選里選一個(gè)論文把 Skill 記為 —— 是說明書 是工具箱。第二步按協(xié)議收集證據(jù)。 Agentic judge 逐步執(zhí)行列出可用資源 → 檢視 rubric → 調(diào) verifier → 填 checklist 。每激活一條準(zhǔn)則 就記一條證據(jù) 是觀測(cè)比如 sandbox 返回parse_json: pass 是局部判定滿足/違反/不確定。所有證據(jù)匯總成 是最終結(jié)論字段。第三步確定性讀出獎(jiǎng)勵(lì)。 讀出函數(shù) 從完整軌跡 映射到任務(wù)所需輸出 給標(biāo)量 給最優(yōu)候選編號(hào) 即成對(duì)偏好。點(diǎn)式 RM 、 pairwise RM 、 rubric 聚合 RM 被收進(jìn)同一套 Skill 執(zhí)行范式——差別只在最后一步怎么讀 。關(guān)鍵設(shè)計(jì)是漸進(jìn)式披露資源默認(rèn)潛伏 Skill 規(guī)格觸發(fā)才加載。 flat prompt 把整庫(kù)資源一次性倒給 judge 上下文噪聲會(huì)把關(guān)鍵信號(hào)淹沒——后面消融實(shí)驗(yàn)會(huì)驗(yàn)證這一點(diǎn)。資源庫(kù)本身通過 LLM 輔助策展從文獻(xiàn)、 benchmark 文檔、可驗(yàn)證評(píng)估實(shí)踐里聚合候選去重、泛化、版本凍結(jié)。論文 Appendix 列了 6 類通用資源 helpfulness rubric 、 math answer-first rubric 、 code test-first rubric 、 safety bounded-help rubric 、 JSON format checklist 、 evidence priority aggregation rule 加樣本級(jí)擴(kuò)展接口。實(shí)驗(yàn)同骨干對(duì)比才是硬指標(biāo)RewardBench2 / RM-Bench / JudgeBench 主結(jié)果論文在三大 RM benchmark 上對(duì)比了標(biāo)量 RM 、生成式 RM 、 rubric 系統(tǒng)、 agentic judge 等基線。外行看榜單容易被 MoE 大模型分?jǐn)?shù)吸引內(nèi)行應(yīng)盯同骨干 Qwen3.5-27B方法RewardBench2RM-BenchJudgeBench平均GPT-4o Judge64.973.159.865.9Skywork-Reward-V2-Llama-3.1-8B84.192.880.085.6Qwen3.5-27B Judge81.189.880.883.9RewardAgent (Qwen3.5-27B)82.080.566.376.3Skill-RM (Qwen3.5-27B)85.091.582.186.2同骨干下 Skill-RM 三項(xiàng)全漲平均從 83.9 提到 86.2 2.3 。 RewardBench2 和 RM-Bench 拿到完整行最高 JudgeBench 上 122B MoE 變體沖到 85.2 27B 版 82.1 也已超過同骨干 judge 的 80.8 。三大 benchmark 完整對(duì)比加粗為最高、下劃線為次高。 Skill-RM (Qwen3.5-27B) 平均 86.2 為完整行第一。和 TIR-Judge-Zero agentic verifier judge 平均 76.4 比 Skill-RM 的優(yōu)勢(shì)在統(tǒng)一編排多種資源而不只是掛一個(gè) Python 執(zhí)行器。和 OpenRubrics 、 Auto-Rubric 等 rubric 系統(tǒng)比 Skill-RM 能同時(shí)調(diào)度 rubric 、 reference 、 verifier 、聚合規(guī)則不必為每種任務(wù)單獨(dú)改 prompt 模板。掛載樣本級(jí)資源 RL 場(chǎng)景的關(guān)鍵增益標(biāo)準(zhǔn) benchmark 通常只給 prompt 和候選回答。真實(shí) RL 管線里 per-sample 的 reference 、約束、 verifier 輸出經(jīng)??捎谩?Skill-RM 通過 Skill 接口掛載這些sample-specific資源方法RewardBench2RM-BenchJudgeBench平均Qwen3.5-27B Judge81.189.880.883.9OpenRS sample-spec.84.087.593.188.2Skill-RM85.091.582.186.2Skill-RM sample-spec.86.091.589.789.1OpenRS 在 JudgeBench 上沖到 93.1 定制評(píng)估協(xié)議但同骨干平均最高仍是 Skill-RM sample-spec. 的 89.1。無樣本資源時(shí) Skill-RM 已 2.3 掛上樣本資源后再 2.9 說明 Skill 接口對(duì) RL 下游價(jià)值更大。消融 append 資源反而降分這篇論文最有啟發(fā)的一行數(shù)據(jù)在這里方法平均ΔBaseline (Qwen3.5-27B Judge)83.90.0 appended resources81.0-2.9 appended sample-spec.82.0-1.9 Python tool83.6-0.3Skill-RM86.22.3Skill-RM sample-spec.89.15.2把 reference 和 verifier 直接粘進(jìn) prompt 平均分從 83.9 掉到 81.0 。 append 模式下 judge 同時(shí)看到 rubric 、 checklist 、 verifier 說明卻缺少 Skill 協(xié)議規(guī)定的「先診斷再選資源」順序關(guān)鍵信號(hào)如 sandbox 的 parse_json 結(jié)果容易被長(zhǎng) prompt 稀釋——這和漸進(jìn)式披露的設(shè)計(jì)正好相反。單獨(dú)給 Python 工具也幾乎沒增益 83.6 。2.3 分的提升更像是編排贏了而不是資源變多了。論文還在 GPT-4o 、 Claude-3.5-Sonnet 、 DeepSeek-V3 等多個(gè)骨干上做了補(bǔ)充實(shí)驗(yàn) Appendix Table 8 趨勢(shì)一致 Skill-RM 相對(duì)同骨干 flat judge 均有正向提升說明機(jī)制不綁死 Qwen 一家。Best-of-N 重排哪里賺、哪里還難JETTS 固定池實(shí)驗(yàn)用 Qwen2.5-72B-Instruct 生成 10 個(gè)候選比較重排質(zhì)量和生成能力無關(guān)。 Baseline 和 Skill-RM 走相同 sequential pairwise knockout Skywork-Reward-V2-Qwen3-8B 獨(dú)立打分選最高?!鯣SM8K Skill-RM 97.8 Oracle10 上界 97.9 Baseline 97.7——數(shù)學(xué)近乎飽和 Skill 只是把最后 0.1 摳出來■IFEval 、 HumanEval Skill-RM 明顯超過 Baseline 和 Skywork 指令遵循和代碼場(chǎng)景收益最實(shí)在■BigCodeBench Skill-RM 有正向提升但距 Oracle 仍有明顯差距復(fù)雜代碼任務(wù)的重排仍是短板。如果你在工程里做采樣解碼 Best-of-N IFEval 和 HumanEval 值得優(yōu)先加 Skill-RM 式重排層 BigCodeBench 這類復(fù)雜代碼任務(wù)單靠 judge 重排很難貼近 Oracle10 上界。指令遵循 RL 能當(dāng)獎(jiǎng)勵(lì)源嗎IF-RewardBench 排序Kendall 相關(guān) overall assessment 方法Single-TurnMulti-TurnSystem-Prompt平均Gemini-3-Flash0.5890.4600.4890.513Qwen3.5-27B0.5070.4400.2870.411Skywork-V2-Llama3.1-8B0.1530.2050.0390.133Skill-RM0.6190.5400.4130.524標(biāo)量 RM Skywork 平均 0.133 在 IF 場(chǎng)景幾乎失靈 Skill-RM 平均 0.524 最高 Single-Turn 0.619 和 Multi-Turn 0.540 拉滿。 System-Prompt 子集 0.413 仍落后 Gemini-3-Flash 的 0.489——長(zhǎng)系統(tǒng)提示是指令遵循 judge 的硬骨頭后續(xù) Skill 擴(kuò)展值得盯。VerInstruct GRPO 下游訓(xùn)練方法IFEvalIFBenchAdvancedIF平均Tulu 382.627.625.045.1VerIF83.727.622.844.7Skill-RM84.827.625.445.9VerIF 是最接近的對(duì)照同樣用 VerInstruct GRPO 。 Skill-RM 平均 45.9 最高 IFEval 1.1 、 AdvancedIF 2.6 IFBench 持平 27.6 。增幅不大但方向正確——Skill-RM 可以端到端接入 RL 獎(jiǎng)勵(lì)鏈路而不只是離線 benchmark 刷分。和 TIR-Judge 、 OpenRS 差在哪快速對(duì)照三條代表性路線TIR-Judge-Zero給 judge 掛 Python 執(zhí)行器讓模型寫代碼驗(yàn)證答案。強(qiáng)項(xiàng)是 verifiable 任務(wù)弱項(xiàng)是資源類型單一——rubrics 、 checklists 、聚合規(guī)則仍靠 prompt 硬塞。OpenRS樣本級(jí)資源做得深 JudgeBench 上樣本資源掛載后極強(qiáng) 93.1 。代價(jià)是評(píng)估協(xié)議定制程度高跨任務(wù)泛化要單獨(dú)適配。Skill-RM用 Skill 抽象統(tǒng)一調(diào)度所有資源類型默認(rèn)協(xié)議下就能漲分掛載樣本資源后進(jìn)一步拉升。 trade-off 是推理開銷多步 Agentic 軌跡比單次標(biāo)量 RM 慢論文也承認(rèn)需要 early stopping 、證據(jù)緩存、 artifact 剪枝來控成本。局限三件事還沒解決作者列了三條邊界1.評(píng)估范圍以文本 IF 和標(biāo)準(zhǔn) RM benchmark 為主多模態(tài)、長(zhǎng)程 Agent 、主觀偏好待擴(kuò)展2.Skill 靠人工策展自動(dòng)化構(gòu)建與持續(xù)更新是開放題3.推理成本高于標(biāo)量 RM 生產(chǎn)環(huán)境要算 ROI——Best-of-N 重排可能劃算每 token 在線 RL 獎(jiǎng)勵(lì)可能要慎重。RM 競(jìng)爭(zhēng)正在轉(zhuǎn)向「評(píng)估基礎(chǔ)設(shè)施」Skill-RM 本質(zhì)是把 agentskills.io 那套「說明書 工具箱」搬進(jìn)判卷同一骨干 Qwen3.5-27B 上編排式 Skill 比 flat judge 平均高 2.3 分 append 資源反而掉 2.9 分——說明問題在流程不在堆料。對(duì)齊訓(xùn)練要的是穩(wěn)定、可審計(jì)的獎(jiǎng)勵(lì)信號(hào) flat prompt 每次讓 judge 從零決定資源用法復(fù)現(xiàn)性和透明度都吃虧。幾條工程建議基于論文數(shù)據(jù)而非空泛展望■RL 管線里已有 reference / verifier 的試試封裝成 Skill 式接口別直接 append 進(jìn) prompt——消融已經(jīng)證明會(huì)降分■采樣解碼后加 Best-of-N 重排 IFEval / HumanEval 收益明確■System-Prompt 長(zhǎng)上下文場(chǎng)景仍是弱點(diǎn)值得單獨(dú)擴(kuò) Skill 資源庫(kù)■上線前算清楚延遲 Agentic 多步評(píng)估的 token 開銷能不能被 Best-of-N 的質(zhì)量增益覆蓋。開源倉(cāng)庫(kù) https://github.com/Qwen-Applications/Skill-RM 已放出。 Qwen 應(yīng)用團(tuán)隊(duì)這條線如果和 Qwen3.5 訓(xùn)練棧深度整合有機(jī)會(huì)成為開源對(duì)齊方案里「可編排獎(jiǎng)勵(lì)」方向的標(biāo)桿實(shí)現(xiàn)。學(xué)AI大模型的正確順序千萬不要搞錯(cuò)了2026年AI風(fēng)口已來各行各業(yè)的AI滲透肉眼可見超多公司要么轉(zhuǎn)型做AI相關(guān)產(chǎn)品要么高薪挖AI技術(shù)人才機(jī)遇直接擺在眼前有往AI方向發(fā)展或者本身有后端編程基礎(chǔ)的朋友直接沖AI大模型應(yīng)用開發(fā)轉(zhuǎn)崗超合適就算暫時(shí)不打算轉(zhuǎn)崗了解大模型、RAG、Prompt、Agent這些熱門概念能上手做簡(jiǎn)單項(xiàng)目也絕對(duì)是求職加分王給大家整理了超全最新的AI大模型應(yīng)用開發(fā)學(xué)習(xí)清單和資料手把手幫你快速入門學(xué)習(xí)路線:?大模型基礎(chǔ)認(rèn)知—大模型核心原理、發(fā)展歷程、主流模型GPT、文心一言等特點(diǎn)解析?核心技術(shù)模塊—RAG檢索增強(qiáng)生成、Prompt工程實(shí)戰(zhàn)、Agent智能體開發(fā)邏輯?開發(fā)基礎(chǔ)能力—Python進(jìn)階、API接口調(diào)用、大模型開發(fā)框架LangChain等實(shí)操?應(yīng)用場(chǎng)景開發(fā)—智能問答系統(tǒng)、企業(yè)知識(shí)庫(kù)、AIGC內(nèi)容生成工具、行業(yè)定制化大模型應(yīng)用?項(xiàng)目落地流程—需求拆解、技術(shù)選型、模型調(diào)優(yōu)、測(cè)試上線、運(yùn)維迭代?面試求職沖刺—崗位JD解析、簡(jiǎn)歷AI項(xiàng)目包裝、高頻面試題匯總、模擬面經(jīng)以上6大模塊看似清晰好上手實(shí)則每個(gè)部分都有扎實(shí)的核心內(nèi)容需要吃透我把大模型的學(xué)習(xí)全流程已經(jīng)整理好了抓住AI時(shí)代風(fēng)口輕松解鎖職業(yè)新可能希望大家都能把握機(jī)遇實(shí)現(xiàn)薪資/職業(yè)躍遷這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】