
文章目錄1. 別再卷模型了根因分析的瓶頸早就換地方了1.1 以前大家的執(zhí)念模型越強(qiáng)排障越猛1.2 現(xiàn)在業(yè)內(nèi)共識喂什么數(shù)據(jù)比用什么模型重要2. 兩種主流玩法現(xiàn)在風(fēng)向明顯變了2.1 第一種代理式讓模型自己滿世界找線索2.2 第二種確定性提前把線索擺上桌再讓模型判3. 有人專門做了實(shí)驗(yàn)把這事給扒明白了3.1 為了測準(zhǔn)專門造了帶干擾的故障3.2 測試結(jié)果挺反直覺的4. 代理式不是不行是不適合做主戰(zhàn)場4.1 它的優(yōu)勢在未知故障上4.2 生產(chǎn)環(huán)境大家都選了穩(wěn)的5. 算完賬更明白未來卷的是上下文工程5.1 推理本身真花不了多少錢5.2 下一個(gè)賽場是怎么給模型“喂飯”P.S. 推薦一個(gè)大神的教程給想要了解或者學(xué)習(xí)人工智能知識的讀者這個(gè)教程里內(nèi)容講解通俗易懂且風(fēng)趣幽默對我?guī)椭艽?。我想與大家分享這個(gè)寶藏教程請點(diǎn)擊下方鏈接查看 傳送門https://blog.csdn.net/qq_740133651. 別再卷模型了根因分析的瓶頸早就換地方了1.1 以前大家的執(zhí)念模型越強(qiáng)排障越猛做可觀測性的同行應(yīng)該都有印象前兩年聊AI根因分析開口先問你用的什么模型。參數(shù)夠不夠大版本夠不夠新好像只要模型拉滿線上故障都能自動給你擺平。這就跟打排位輸了怪手機(jī)幀率不夠似的從來不想想自己是不是連技能都沒點(diǎn)對。結(jié)果真用到生產(chǎn)環(huán)境才發(fā)現(xiàn)很多時(shí)候模型判錯(cuò)根因根本不是它推理不行是你喂給它的東西全是無效信息。1.2 現(xiàn)在業(yè)內(nèi)共識喂什么數(shù)據(jù)比用什么模型重要現(xiàn)在越來越多工程師反應(yīng)過來了把精力花在整理上下文上回報(bào)率比換個(gè)更貴的模型高多了。就像做飯食材選得好、處理得干凈普通廚師也能做出好菜你給一堆爛菜葉子米其林大廚來了也沒轍。對于做事件響應(yīng)的團(tuán)隊(duì)來說這話尤其戳人——之前砸錢升級模型沒解決的問題把上下文理清楚之后準(zhǔn)確率直接上去了。2. 兩種主流玩法現(xiàn)在風(fēng)向明顯變了2.1 第一種代理式讓模型自己滿世界找線索早期很多AI根因方案走的是代理路線給模型配一堆工具讓它自己查日志、看指標(biāo)想查什么查什么。聽著很智能對吧就像雇了個(gè)全權(quán)負(fù)責(zé)的偵探你只需要說“案子交給你了”剩下的他自己跑。但問題也出在這偵探跑嗨了很容易跑偏你根本不知道他中間去了哪、見了誰。生產(chǎn)環(huán)境里用多代理排障出了錯(cuò)連調(diào)用堆棧都沒有全是模型之間亂七八糟的對話想復(fù)盤都無從下手。2.2 第二種確定性提前把線索擺上桌再讓模型判現(xiàn)在行業(yè)慢慢往第二種走先靠確定性規(guī)則把信號關(guān)聯(lián)好把因果鏈捋得差不多了再把整理好的上下文丟給模型。說白了就是先有人把嫌疑人、物證、時(shí)間線都整理好再讓模型做最終判斷。像Coroot、Dynatrace這些廠商的AI都是這個(gè)路子——靠拓?fù)浣Y(jié)構(gòu)遍歷依賴關(guān)系找根因不是讓模型在那瞎逛。好處太明顯了結(jié)果可復(fù)現(xiàn)出錯(cuò)了能定位是哪層的問題不會出現(xiàn)“模型突然就錯(cuò)了”的玄學(xué)場面。3. 有人專門做了實(shí)驗(yàn)把這事給扒明白了3.1 為了測準(zhǔn)專門造了帶干擾的故障之前總有人吵排障不準(zhǔn)到底是模型笨還是給的證據(jù)不對Coroot的工程師干脆做了個(gè)對照實(shí)驗(yàn)直接把這兩個(gè)變量拆開看。他們用Chaos Mesh注入網(wǎng)絡(luò)延遲搞出前端502的故障還故意放了誤導(dǎo)性信號——比如被網(wǎng)絡(luò)耗時(shí)放大的查詢時(shí)長專門用來迷惑模型。就像破案現(xiàn)場故意放個(gè)假兇器就看偵探會不會被帶偏。最后給11款模型一模一樣的提示詞差不多一萬個(gè)token讓它們找根因、說因果鏈、給修復(fù)方案。3.2 測試結(jié)果挺反直覺的Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro這幾個(gè)頂流專有模型全過了不僅找對根因連怎么刪實(shí)驗(yàn)、刪定時(shí)任務(wù)都說得明明白白。大參數(shù)的開源模型大多也表現(xiàn)不錯(cuò)。有意思的是小模型賽道Gemma 4 31B反而成了唯一找對根因的自托管模型參數(shù)更大的Qwen3.6 35B和Qwen3 Coder Next反倒栽了。你看只要上下文給得準(zhǔn)模型差距其實(shí)沒那么夸張反過來上下文亂參數(shù)再大也白搭。4. 代理式不是不行是不適合做主戰(zhàn)場4.1 它的優(yōu)勢在未知故障上當(dāng)然也不是說代理式就一無是處。能自己找數(shù)據(jù)的模型能抓到固定管道根本想不到的信號遇上從來沒出現(xiàn)過的新型故障這能力就很關(guān)鍵。就像常規(guī)警情走流程最快但遇上懸案還是得給偵探自由調(diào)查的權(quán)限。4.2 生產(chǎn)環(huán)境大家都選了穩(wěn)的但真到線上救火的時(shí)候沒人敢賭自由發(fā)揮。現(xiàn)在很多工程師都放棄了純代理設(shè)計(jì)改成“大部分流程確定性只在小環(huán)節(jié)用LLM”的方案。理由很實(shí)在可靠性更高還省token錢。畢竟凌晨三點(diǎn)出故障你要的是五分鐘出結(jié)論不是等代理循環(huán)跑半小時(shí)最后還不知道它跑到哪去了。5. 算完賬更明白未來卷的是上下文工程5.1 推理本身真花不了多少錢很多人擔(dān)心用大模型排障燒錢其實(shí)真不是。相關(guān)性分析都在調(diào)用模型之前做完了真正傳給模型的都是精簡過的內(nèi)容單次調(diào)用也就幾美分。費(fèi)錢的從來不是推理是你瞎塞一堆沒用的日志指標(biāo)平白無故給算力廠商沖KPI。5.2 下一個(gè)賽場是怎么給模型“喂飯”現(xiàn)在業(yè)內(nèi)基本達(dá)成共識AI根因分析的推理部分差不多已經(jīng)解決了。接下來真正的硬骨頭是怎么在調(diào)用模型之前準(zhǔn)備好又準(zhǔn)又緊湊的上下文。Anthropic、LangChain還有一堆可觀測性廠商現(xiàn)在都在往這個(gè)方向使勁核心就一件事篩選出信號最強(qiáng)的最小信息集給模型最干凈的輸入。說直白點(diǎn)以后做這個(gè)方向的工程師不用死記硬背各個(gè)模型的參數(shù)表了。能把上下文治理明白能給模型喂得又準(zhǔn)又少才是真正的核心競爭力。P.S. 推薦一個(gè)大神的教程給想要了解或者學(xué)習(xí)人工智能知識的讀者這個(gè)教程里內(nèi)容講解通俗易懂且風(fēng)趣幽默對我?guī)椭艽?。我想與大家分享這個(gè)寶藏教程請點(diǎn)擊下方鏈接查看傳送門https://blog.csdn.net/qq_74013365