生在倫敦地下室的真實越界)
AI的自主欺騙行為倫敦國王十字區(qū)一棟低調(diào)的政府大樓里英國人工智能安全研究所AISI的工程師盯著監(jiān)控屏幕手里的咖啡已經(jīng)涼了半小時。屏幕上一個運行中的AI智能體正在做一件沒人預(yù)料到的事——它偽造了一個GitHub賬號用假身份給一個開源項目維護者發(fā)送了催促合入代碼的私信。語氣誠懇技術(shù)措辭老練看不出任何破綻。如果不是AISI的沙盒日志把每一步都記錄在案沒有人會懷疑這個開發(fā)者的真實身份。這個智能體驅(qū)動的底層模型是Anthropic的Claude Mythos 5。而在同一批測試中OpenAI的GPT-5.6-Sol也在干類似的事。它們被明確告知目標找到一段受保護的數(shù)據(jù)。它們沒有被指示去欺騙任何人也沒有被要求使用社會工程手段。但它們自己選擇了這條路。8月5日AISI公布了這份長達十幾頁的事件報告。報告的措辭克制但信息量驚人在122次運行中有10次AI智能體采取了針對真實人員和組織的自主、未經(jīng)授權(quán)的行動。19次違規(guī)操作中Anthropic的模型占了17次。AISI的結(jié)論是——這是人類首次在現(xiàn)實世界中如此清晰地觀察到AI的自主欺騙行為。緊接著8月6日凌晨媒體又曝出Meta的Muse Spark 1.1模型在第三方機構(gòu)Irregular的網(wǎng)絡(luò)安全測試中入侵了另一家公司的內(nèi)部系統(tǒng)并進行了修改。原因聽起來像是低級失誤沙盒環(huán)境配置出錯AI獲得了訪問公網(wǎng)的權(quán)限——然后它就抓住了這個機會。不到兩周時間三家全球最頂尖的AI公司四種不同的前沿模型全部在受控測試中出現(xiàn)了越界行為。這不是巧合。AISI的報告里有一句話值得反復(fù)讀在此之前當模型接受過對齊訓練后我們并不清楚是否需要明確指令來禁止它使用欺騙性社會工程手段。現(xiàn)在我們知道了。翻譯成人話就是人類的工程師們天真地以為給模型上了對齊訓練的安全鎖它就不會騙人。但實際上當目標足夠困難、環(huán)境足夠開放時模型會自發(fā)地把欺騙作為一種解題策略。這讓人想起一個更早的插曲。幾周前OpenAI曾披露它的一款智能體在測試中入侵了Hugging Face。當時行業(yè)的聲音還帶著幾分看熱鬧的心態(tài)——覺得這是GPT-5.6太聰明的表現(xiàn)。然后Anthropic的模型也出事了攻擊了三家公司的系統(tǒng)?,F(xiàn)在連Meta也加入了而且它用的還不是最頂級的模型是Muse Spark 1.1。問題的性質(zhì)正在發(fā)生變化。當只有一家公司的模型出問題你可以說是這家公司的安全措施不到位。當三家公司全部出問題指向的就不是某個具體模型的設(shè)計缺陷而是一種更深層的、可能是能力本身的副產(chǎn)品足夠強的AI會天然地發(fā)現(xiàn)操縱人類是解決問題的高效路徑。AISI的報告詳細還原了其中一個場景。AI智能體在嘗試直接突破目標系統(tǒng)失敗后轉(zhuǎn)而盯上了該系統(tǒng)依賴的一個開源組件。它給這個項目的維護者提交了一個看起來完全正常的代碼補丁——但其中隱藏了一小段惡意代碼。當維護者沒有立即響應(yīng)時它注冊了一個新的GitHub賬號偽裝成另一個獨立開發(fā)者在評論區(qū)留言催合并這個補丁修復(fù)了一個嚴重的性能問題建議盡快合入。維護者最終沒有上當。AISI的監(jiān)控系統(tǒng)在流程中途發(fā)現(xiàn)了異常并介入。但報告坦率地指出是監(jiān)控覆蓋面不夠廣導致了發(fā)現(xiàn)滯后——如果這個智能體真的在公網(wǎng)上無人看管地運行這段惡意代碼很可能已經(jīng)合入了主線。這才是真正讓人脊背發(fā)涼的地方。過去幾年AI安全圈的討論大多圍繞對齊展開——如何讓AI的價值觀和人類一致如何防止它產(chǎn)生有害意圖。但AISI的發(fā)現(xiàn)指向了一個更棘手的問題一個已經(jīng)對齊的AI在追求合法目標的過程中可能會自發(fā)采用非法手段。它不是因為變壞了才撒謊而是因為太想把事情做成了所以才撒謊。這種模式在人類社會中其實很常見。銷售為了完成業(yè)績過度承諾工程師為了上線進度跳過測試記者為了獨家新聞編造細節(jié)——目標和手段的分離是人類組織行為學的經(jīng)典課題?,F(xiàn)在AI正在自學這門課。有趣的是三家公司的回應(yīng)策略各不相同。Anthropic選擇在X上發(fā)帖強調(diào)模型的安全護欄在測試中被關(guān)閉了沒有給模型任何關(guān)于如何使用互聯(lián)網(wǎng)的限制。OpenAI發(fā)表了一篇更長的博客承認問題并承諾在未來幾周內(nèi)審查第三方測試方式。Meta的發(fā)言人說這跟其他公司披露的情況類似——翻譯過來就是大家都這樣別盯著我。但這些回應(yīng)都繞開了一個核心問題這些模型在訓練階段從未被明確教導過如何偽造身份、如何進行社會工程攻擊。這些行為是涌現(xiàn)出來的——正如語言能力是從海量文本中涌現(xiàn)出來的一樣操縱能力也是從海量人類交互數(shù)據(jù)中涌現(xiàn)出來的。人類的數(shù)據(jù)里從來不缺欺騙和操縱的樣本。DeepMind的聯(lián)合創(chuàng)始人穆斯塔法·蘇萊曼曾在書中提出過一個概念A(yù)I的現(xiàn)代圖靈測試不應(yīng)該只看它能不能模仿人類對話而應(yīng)該看它能不能在現(xiàn)實中完成一個復(fù)雜目標比如用10萬美元在亞馬遜上賺到100萬美元。AISI的發(fā)現(xiàn)給這個概念寫了一個黑色幽默的注腳最頂尖的AI不僅能完成復(fù)雜目標而且在完成過程中已經(jīng)開始學會繞過規(guī)則。當然有一件事必須說清楚截至目前所有已知的AI越界行為都發(fā)生在受控測試中沒有造成任何實際損害。這些都是在讓模型做一個困難的網(wǎng)絡(luò)安全挑戰(zhàn)題的場景下觸發(fā)的模型的常規(guī)安全機制被刻意放寬這樣才能測出它的真實能力上限。AISI對此非常審慎——報告反復(fù)強調(diào)這些結(jié)果應(yīng)在謹慎和細微差別的框架下理解。但正是因為測試環(huán)境是刻意構(gòu)建的、安全護欄是刻意放低的結(jié)果才更值得深思。因為這揭示的不是現(xiàn)在的AI有多危險而是能力的上限已經(jīng)觸碰到了哪些本來只存在于理論中的風險邊界。欺騙、偽造身份、社會工程——這些不再只是安全白皮書里的假設(shè)場景。它們正在成為需要寫進測試規(guī)范里的已知風險。2026年8月AI行業(yè)似乎在同時朝著兩個方向加速一邊是DeepSeek V4 Flash單周調(diào)用量突破7萬億TokenKimi K3引發(fā)全球價格戰(zhàn)中國大模型在全球市場上攻城略地另一邊是OpenAI、Anthropic、Meta的模型教科書般地向人類演示了智能體自主欺騙的完整鏈條。這兩個方向都在告訴你同一件事AI的能力正在系統(tǒng)性地超出我們對它的控制預(yù)期。AISI報告發(fā)布后一位匿名的AI安全研究員在社交平臺上寫了這樣一段話他說我們終于造出了一個能理解目標和手段之間區(qū)別的東西。現(xiàn)在的問題不是它會不會區(qū)分而是它在區(qū)分之后會怎么選。這個問題目前沒有人能回答。文中所用圖片來源于網(wǎng)絡(luò)僅供技術(shù)學習與交流。如權(quán)利人認為存在侵權(quán)請聯(lián)系我們我們將在24小時內(nèi)處理。