AI看人熟不熟 視覺信息沒幫上忙)
有些產(chǎn)品功能需要模型判斷兩個人的關(guān)系會議軟件分析參會者是不是熟人社交產(chǎn)品判斷該不該推薦破冰話題客服系統(tǒng)識別用戶和客服之間是否已經(jīng)建立過溝通。過去這類判斷主要靠文本和語音現(xiàn)在多模態(tài)模型能同時看畫面了——一段 20 秒的視頻兩個人面對面聊天模型能不能看出他們是熟人還是陌生人FriendBench 這個基準(zhǔn)做的就是這件事而且結(jié)論比預(yù)想的有意思模型判斷的準(zhǔn)確率和人類沒有顯著差異但在回答傾向上模型和人類出現(xiàn)了系統(tǒng)性分歧。準(zhǔn)確率不輸人類傾向卻不一樣基準(zhǔn)用 20 秒的破冰對話視頻作為素材對比 26 個多模態(tài)大模型和人類群體在 96 個配對場景里的表現(xiàn)測試覆蓋文本、音頻、視頻三種模態(tài)。結(jié)果分成兩層看。準(zhǔn)確率層面模型和人類沒有顯著差異都能從對話里提取出熟不熟的線索。但第二層結(jié)果暴露了差異人類在回答時保持中立傾向而最強的模型傾向于給出陌生人這個答案。也就是說模型在拿不準(zhǔn)的時候默認往不認識那邊靠。這個偏置不是推理能力的問題。從測試設(shè)計來看模型面對的是同樣的信息輸出卻系統(tǒng)性偏向一側(cè)更像是訓(xùn)練數(shù)據(jù)里陌生人樣本占比更高或者模型學(xué)到了沒有明確熟悉證據(jù)就判斷為陌生的保守策略。視覺模態(tài)幫了人類沒幫模型更值得琢磨的是第三個發(fā)現(xiàn)多模態(tài)信息對人類的幫助比對模型大。人類在文本和音頻之外加上視覺行為信息后判斷準(zhǔn)確率明顯提升——兩個人說話時的眼神、身體姿態(tài)、距離感這些畫面信息對人類有用。但同樣的視覺信息加給模型準(zhǔn)確率幾乎沒有變化。這說明模型在處理社交場景時視覺通道的信息并沒有被真正利用起來。圖像特征可能被提取了但沒有和熟悉度這個任務(wù)目標(biāo)形成有效的映射。對做多模態(tài)產(chǎn)品的人來說這是個提醒模型接了視頻輸入不等于它會用視頻信息——視覺模態(tài)的接入成本和它對最終判斷的實際貢獻可能是兩回事。對工程團隊意味著什么這類基準(zhǔn)看起來偏研究但對做社交、會議、客服類產(chǎn)品的團隊有實際參考價值。模型在不確定場景下系統(tǒng)性偏向陌生人在真實產(chǎn)品里會產(chǎn)生累積效應(yīng)如果一個推薦系統(tǒng)反復(fù)把熟人關(guān)系判斷成陌生人用戶感受到的就是功能失靈。而且這種偏置是隱性的——單次判斷看不出問題只有統(tǒng)計大量輸出才能發(fā)現(xiàn)。從工程角度看緩解手段無非幾種在提示層面要求模型先判斷證據(jù)強度再作答或者在決策層面對陌生人結(jié)論設(shè)置更高的置信度門檻。但基準(zhǔn)里沒有給出模型訓(xùn)練數(shù)據(jù)的分布細節(jié)也沒有說明人類的中立傾向是否可以被模型模仿這些手段能起多大作用目前沒有公開數(shù)據(jù)支撐。一個值得跟蹤的問題是模型為什么在視覺模態(tài)上沒有獲益。如果是訓(xùn)練數(shù)據(jù)里社交場景樣本太少那么隨著多模態(tài)訓(xùn)練數(shù)據(jù)的豐富這個短板可能自動緩解如果是視覺特征和任務(wù)目標(biāo)之間的映射設(shè)計問題那就需要架構(gòu)層面的調(diào)整。兩種情況對應(yīng)完全不同的投入方向。關(guān)于維基框架維基框架關(guān)注企業(yè)應(yīng)用開發(fā)中的長期維護問題。在實際項目中業(yè)務(wù)系統(tǒng)往往同時涉及權(quán)限、微服務(wù)、接口協(xié)議、部署環(huán)境等復(fù)雜因素因此我們希望提供一套更容易擴展和維護的基礎(chǔ)框架。官網(wǎng)framewiki.comGiteegitee.com/wiki-frameworkGitHubgithub.com/wiki-framework示例項目gitee.com/cdkjframework/framewiki-example 許可證MulanPSL-2.0木蘭寬松許可證第2版