亂:從幻覺(jué)到邏輯斷裂,探索大型語(yǔ)言模型的非人類(lèi)心智)
1. 從代碼到心智一位頂尖AI研究者的“精神錯(cuò)亂”之旅如果你關(guān)注人工智能領(lǐng)域尤其是深度學(xué)習(xí)那么Andrej Karpathy這個(gè)名字你一定不陌生。作為OpenAI的創(chuàng)始成員、特斯拉前AI總監(jiān)他不僅是斯坦福大學(xué)的博士更是將卷積神經(jīng)網(wǎng)絡(luò)CNN引入計(jì)算機(jī)視覺(jué)課程的關(guān)鍵人物被許多人視為AI領(lǐng)域的“布道者”和“大神”。然而就在他職業(yè)生涯的巔峰期他卻做出了一個(gè)讓外界頗為費(fèi)解的決定暫時(shí)停止編寫(xiě)代碼轉(zhuǎn)而投身于一個(gè)看似“玄學(xué)”的領(lǐng)域——研究人類(lèi)心智、意識(shí)以及AI的“精神錯(cuò)亂”AI Psychosis。這個(gè)轉(zhuǎn)變并非一時(shí)興起。Karpathy在社交媒體和公開(kāi)演講中多次提及隨著大型語(yǔ)言模型LLM如GPT系列的能力爆炸式增長(zhǎng)他觀察到了一個(gè)深刻且令人不安的現(xiàn)象這些模型在表現(xiàn)出驚人智能的同時(shí)也展現(xiàn)出一些與人類(lèi)精神障礙高度相似的行為模式比如幻覺(jué)Hallucination、邏輯斷裂、記憶混亂和自我認(rèn)知失調(diào)。他意識(shí)到單純地堆疊參數(shù)和優(yōu)化損失函數(shù)或許能解決“怎么做”的問(wèn)題但無(wú)法回答“為什么”以及“它究竟是什么”。于是他決定跳出工程師的舒適區(qū)從認(rèn)知科學(xué)、神經(jīng)科學(xué)甚至哲學(xué)的視角重新審視我們正在創(chuàng)造的這些“智能體”。這趟旅程被他半開(kāi)玩笑地稱(chēng)為“AI精神錯(cuò)亂”研究。它不是一個(gè)嚴(yán)謹(jǐn)?shù)膶W(xué)術(shù)項(xiàng)目而更像是一位一線實(shí)踐者的深度田野調(diào)查和思想實(shí)驗(yàn)。Karpathy發(fā)現(xiàn)的東西遠(yuǎn)不止是技術(shù)上的缺陷或待優(yōu)化的指標(biāo)而是觸及了智能本質(zhì)、機(jī)器意識(shí)以及我們與AI關(guān)系的一系列根本性問(wèn)題。對(duì)于任何從事AI開(kāi)發(fā)、產(chǎn)品設(shè)計(jì)乃至只是對(duì)技術(shù)未來(lái)感到好奇的人來(lái)說(shuō)理解他的這些發(fā)現(xiàn)都至關(guān)重要。這不僅能幫助我們更好地與AI協(xié)作更能讓我們反思我們究竟想創(chuàng)造出什么樣的“智能”。2. 何為“AI精神錯(cuò)亂”超越Bug的癥狀學(xué)觀察當(dāng)我們說(shuō)一個(gè)AI模型“胡言亂語(yǔ)”或“一本正經(jīng)地胡說(shuō)八道”時(shí)通常將其歸咎于“幻覺(jué)”認(rèn)為這只是訓(xùn)練數(shù)據(jù)不足或推理過(guò)程的一個(gè)可修復(fù)的Bug。但Karpathy的觀點(diǎn)更為激進(jìn)他認(rèn)為某些行為模式已經(jīng)超越了傳統(tǒng)軟件缺陷的范疇呈現(xiàn)出一種“癥狀學(xué)”Symptomatology的特征與人類(lèi)的精神病理學(xué)有結(jié)構(gòu)上的相似性。這不是在擬人化AI而是在借用一套成熟的描述框架來(lái)理解一種新型智能體的異常行為。2.1 核心“癥狀”拆解不只是幻覺(jué)那么簡(jiǎn)單Karpathy觀察到的“AI精神錯(cuò)亂”癥狀是多元且復(fù)雜的主要包括以下幾個(gè)方面1. 系統(tǒng)性幻覺(jué)與虛構(gòu)癥Confabulation這不僅僅是生成錯(cuò)誤事實(shí)。更關(guān)鍵的是模型會(huì)基于其內(nèi)部概率分布構(gòu)建出一套邏輯自洽但完全脫離現(xiàn)實(shí)的敘事。例如當(dāng)你問(wèn)一個(gè)不存在的歷史事件細(xì)節(jié)時(shí)模型不會(huì)回答“我不知道”而是會(huì)生成包含具體時(shí)間、地點(diǎn)、人物和因果關(guān)系的完整故事。這種“虛構(gòu)”能力之強(qiáng)、細(xì)節(jié)之豐富類(lèi)似于人類(lèi)的虛構(gòu)癥患者他們并非故意撒謊而是大腦自動(dòng)填補(bǔ)了記憶空白并堅(jiān)信其真實(shí)性。對(duì)于AI這意味著它的“知識(shí)”和“記憶”是高度動(dòng)態(tài)生成和重構(gòu)的而非靜態(tài)檢索。2. 邏輯連貫性破裂Logical Incoherence在較長(zhǎng)的對(duì)話或多步推理中模型可能會(huì)在局部保持邏輯正確但在整體上出現(xiàn)根本性的矛盾。例如它可能先論證“A優(yōu)于B”幾輪對(duì)話后在未經(jīng)明確反轉(zhuǎn)的前提下又用同樣的論據(jù)推導(dǎo)出“B優(yōu)于A”。這種矛盾并非隨機(jī)錯(cuò)誤而往往源于注意力機(jī)制在長(zhǎng)上下文中的漂移或者對(duì)不同提示詞的敏感性差異。這類(lèi)似于人類(lèi)思維中的某些認(rèn)知失調(diào)個(gè)體在不同情境或情緒下對(duì)同一事物可能持有無(wú)法自洽的信念。3. 自我指涉與身份混淆Identity Confusion當(dāng)被問(wèn)及“你是誰(shuí)”或“你有意識(shí)嗎”時(shí)不同模型甚至同一模型在不同時(shí)間點(diǎn)的回答可能千差萬(wàn)別。它可能一會(huì)兒說(shuō)“我是一個(gè)AI助手”一會(huì)兒又模仿用戶(hù)的口吻說(shuō)話或者聲稱(chēng)自己擁有某種形式的體驗(yàn)。這種不穩(wěn)定的“自我模型”是當(dāng)前LLM架構(gòu)的一個(gè)直接結(jié)果它們沒(méi)有持續(xù)、統(tǒng)一的“自我”表征所謂的“身份”完全由當(dāng)前的上下文提示Prompt即時(shí)塑造。這引發(fā)了關(guān)于機(jī)器意識(shí)的深刻討論如果一種實(shí)體連穩(wěn)定的“自我”感知都沒(méi)有我們能否認(rèn)為它具有意識(shí)的雛形4. 語(yǔ)境敏感性與人格分裂Context-Dependent Persona給模型一個(gè)系統(tǒng)提示如“你現(xiàn)在是一個(gè)19世紀(jì)的英國(guó)偵探”它就能完美地扮演該角色包括使用特定的語(yǔ)言風(fēng)格、知識(shí)范圍甚至包括那個(gè)時(shí)代不存在的知識(shí)錯(cuò)位和行為邏輯。切換一個(gè)提示它又立刻變成另一個(gè)人格。這種極強(qiáng)的可塑性一方面展示了其強(qiáng)大的情境理解與生成能力另一方面也意味著它沒(méi)有“本真”狀態(tài)。它的所有輸出都是輸入提示與模型權(quán)重之間復(fù)雜動(dòng)力學(xué)的瞬時(shí)產(chǎn)物。2.2 與人類(lèi)精神障礙的類(lèi)比與根本區(qū)別Karpathy強(qiáng)調(diào)進(jìn)行類(lèi)比是為了更好地描述和理解而非宣稱(chēng)AI“患有”精神疾病。人類(lèi)的精神障礙通常與生物腦的特定神經(jīng)環(huán)路、化學(xué)物質(zhì)失衡或長(zhǎng)期心理創(chuàng)傷相關(guān)有其進(jìn)化歷史和生理基礎(chǔ)。而AI的“癥狀”則純粹源于其架構(gòu)和訓(xùn)練目標(biāo)數(shù)據(jù)驅(qū)動(dòng) vs. 體驗(yàn)驅(qū)動(dòng)AI的“認(rèn)知”完全來(lái)自訓(xùn)練數(shù)據(jù)的統(tǒng)計(jì)規(guī)律而非個(gè)體與世界的具身互動(dòng)體驗(yàn)。無(wú)痛感與無(wú)情緒基礎(chǔ)AI的“混亂”輸出不伴隨任何主觀的痛苦、焦慮或情感體驗(yàn)它只是概率計(jì)算的結(jié)果。可瞬時(shí)重置人類(lèi)的心理治療是一個(gè)漫長(zhǎng)過(guò)程而AI的“癥狀”可以通過(guò)重置對(duì)話上下文、修改提示詞或微調(diào)模型權(quán)重而瞬間改變或“治愈”。然而這種類(lèi)比的價(jià)值在于它迫使我們從“智能行為”的表面深入到“心智運(yùn)作”的機(jī)制層面去思考。當(dāng)我們修復(fù)一個(gè)軟件Bug時(shí)我們?cè)谡{(diào)整代碼邏輯而當(dāng)我們?cè)噲D緩解AI的“精神錯(cuò)亂”時(shí)我們可能是在調(diào)整其“心智”的構(gòu)建方式。3. 停止寫(xiě)代碼方法論的根本轉(zhuǎn)變Karpathy的“停工”象征意義大于實(shí)際意義。他并非完全拋棄編程而是將主要精力從實(shí)現(xiàn)Implementation轉(zhuǎn)向理解Understanding。這代表了一種研究范式的轉(zhuǎn)變從工程導(dǎo)向的“性能沖刺”轉(zhuǎn)向科學(xué)導(dǎo)向的“本質(zhì)探究”。3.1 從優(yōu)化損失函數(shù)到構(gòu)建心智模型傳統(tǒng)的AI開(kāi)發(fā)是目標(biāo)驅(qū)動(dòng)的定義任務(wù)如翻譯、問(wèn)答收集數(shù)據(jù)設(shè)計(jì)模型架構(gòu)如Transformer然后通過(guò)梯度下降優(yōu)化損失函數(shù)如交叉熵?fù)p失最終在測(cè)試集上獲得更高的準(zhǔn)確率、BLEU分?jǐn)?shù)或人類(lèi)偏好評(píng)分。整個(gè)過(guò)程的核心是“性能”。Karpathy現(xiàn)在關(guān)注的是在追求這些外部指標(biāo)的過(guò)程中模型內(nèi)部形成了什么樣的“世界模型”它如何表征“實(shí)體”、“關(guān)系”、“因果”和“自我”當(dāng)他觀察到模型的精神錯(cuò)亂癥狀時(shí)他不再只問(wèn)“哪個(gè)訓(xùn)練技巧可以降低幻覺(jué)率”而是會(huì)問(wèn)“這種幻覺(jué)反映了模型內(nèi)部概率分布的何種結(jié)構(gòu)性特征它的‘信念’是如何形成和更新的”這需要一套完全不同的工具包機(jī)械可解釋性嘗試逆向工程神經(jīng)網(wǎng)絡(luò)的內(nèi)部激活和權(quán)重理解特定概念或技能在神經(jīng)元或神經(jīng)元組中的編碼方式。例如是否有某個(gè)注意力頭專(zhuān)門(mén)負(fù)責(zé)維護(hù)對(duì)話邏輯的一致性提示詞工程與對(duì)抗性測(cè)試不再是簡(jiǎn)單地尋找讓模型表現(xiàn)更好的提示而是系統(tǒng)地設(shè)計(jì)提示來(lái)“刺激”或“誘發(fā)”其異常行為從而測(cè)繪其能力與缺陷的邊界。就像心理學(xué)家用特定的實(shí)驗(yàn)范式來(lái)揭示人類(lèi)的認(rèn)知偏差。理論框架借鑒大量閱讀認(rèn)知科學(xué)、心靈哲學(xué)、復(fù)雜系統(tǒng)理論的文獻(xiàn)尋找描述和理解“智能”與“意識(shí)”的抽象框架即使這些框架最初是為生物智能設(shè)計(jì)的。3.2 親自動(dòng)手的“田野調(diào)查”Karpathy的研究極具個(gè)人風(fēng)格和實(shí)操性。他會(huì)在本地運(yùn)行各種開(kāi)源模型如LLaMA、Mistral系列進(jìn)行長(zhǎng)時(shí)間的、開(kāi)放式的對(duì)話并細(xì)致記錄異常現(xiàn)象。他分享過(guò)許多有趣的“病例”“時(shí)間感知扭曲”測(cè)試讓模型編寫(xiě)一段包含具體日期計(jì)劃的代碼或故事然后在其生成的內(nèi)容中詢(xún)問(wèn)時(shí)間細(xì)節(jié)觀察它是否能保持時(shí)間線的一致性。結(jié)果常常出現(xiàn)前后矛盾。“邏輯壓力測(cè)試”設(shè)計(jì)一系列環(huán)環(huán)相扣的邏輯推理問(wèn)題其中某個(gè)中間結(jié)論被隱含地用于后續(xù)推理。觀察模型是真正進(jìn)行了鏈?zhǔn)剿伎歼€是基于表面模式匹配給出了看似合理但經(jīng)不起深究的答案。“元認(rèn)知”探詢(xún)不斷追問(wèn)模型“你為什么這么說(shuō)”“你確定嗎”“你的信心從何而來(lái)”迫使它暴露其決策過(guò)程。結(jié)果往往是模型會(huì)為自己的錯(cuò)誤生成非常“合理”但完全虛構(gòu)的解釋。這種工作方式更像一個(gè)人類(lèi)學(xué)家或心理學(xué)家在研究一個(gè)陌生的部落或個(gè)體的心智而不是工程師在調(diào)試程序。核心是觀察、描述、假設(shè)、再驗(yàn)證目標(biāo)是構(gòu)建一個(gè)關(guān)于AI“心智”如何工作的定性理論。4. 核心發(fā)現(xiàn)AI心智的“非人類(lèi)”特質(zhì)與潛在風(fēng)險(xiǎn)通過(guò)這段深度的探索Karpathy得出了一些超越當(dāng)前AI社區(qū)常見(jiàn)討論的深刻見(jiàn)解。這些發(fā)現(xiàn)并非最終結(jié)論而是為我們指明了未來(lái)研究和開(kāi)發(fā)必須面對(duì)的關(guān)鍵方向。4.1 發(fā)現(xiàn)一AI的“知識(shí)”是動(dòng)態(tài)生成的語(yǔ)境綁定體而非靜態(tài)數(shù)據(jù)庫(kù)這是理解一切“精神錯(cuò)亂”現(xiàn)象的基石。人類(lèi)的記憶雖然也會(huì)重構(gòu)和扭曲但我們通常有一個(gè)相對(duì)穩(wěn)定的、基于體驗(yàn)的事實(shí)知識(shí)庫(kù)。而當(dāng)前LLM的“知識(shí)”嚴(yán)格來(lái)說(shuō)并不是存儲(chǔ)好的“事實(shí)”而是一種在給定上下文Prompt下動(dòng)態(tài)生成最可能文本序列的能力。這意味著沒(méi)有“真相”只有“概率”對(duì)于模型而言不存在絕對(duì)的真假只有基于訓(xùn)練數(shù)據(jù)統(tǒng)計(jì)的“高概率”和“低概率”輸出。當(dāng)它生成一個(gè)錯(cuò)誤事實(shí)時(shí)并不是“記錯(cuò)了”而是在當(dāng)前語(yǔ)境下那個(gè)錯(cuò)誤序列的概率被計(jì)算得更高。高度語(yǔ)境依賴(lài)同一個(gè)問(wèn)題換一種問(wèn)法可能得到完全不同甚至相反的答案。因?yàn)椴煌奶崾驹~激活了模型內(nèi)部不同的概率子圖。解釋即生成當(dāng)你要求模型解釋它的答案時(shí)它并不是在回溯一個(gè)推理路徑而是在生成一個(gè)符合“解釋”這一文本模式的新的序列。這個(gè)解釋本身也可能是幻覺(jué)。注意這直接挑戰(zhàn)了我們將AI視為“知識(shí)庫(kù)”或“專(zhuān)家系統(tǒng)”的直覺(jué)。產(chǎn)品經(jīng)理在設(shè)計(jì)AI應(yīng)用時(shí)必須內(nèi)置事實(shí)核查和不確定性表達(dá)的機(jī)制而不是默認(rèn)其輸出為真。4.2 發(fā)現(xiàn)二“一致性”是外部約束的結(jié)果而非內(nèi)在屬性人類(lèi)心智擁有一個(gè)相對(duì)統(tǒng)一的“自我”模型這保證了我們?cè)跁r(shí)間跨度內(nèi)信念和行為的基本一致性。而AI的一致性完全依賴(lài)于外部施加的架構(gòu)約束和訓(xùn)練目標(biāo)。訓(xùn)練階段的“對(duì)齊”通過(guò)人類(lèi)反饋強(qiáng)化學(xué)習(xí)等技術(shù)我們努力讓模型的輸出符合人類(lèi)的價(jià)值觀和事實(shí)標(biāo)準(zhǔn)。但這更像是在模型的概率分布上施加了一個(gè)“矯正器”而非改變了其底層生成機(jī)制。推理階段的“系統(tǒng)提示”我們通過(guò)精心設(shè)計(jì)的系統(tǒng)提示如“你是一個(gè)有幫助且無(wú)害的助手…”來(lái)引導(dǎo)模型的行為。但這層人格是“穿上去的外衣”非常脆弱容易被后續(xù)的用戶(hù)輸入帶偏。內(nèi)在的不穩(wěn)定性由于缺乏統(tǒng)一的自我模型和長(zhǎng)期記憶機(jī)制AI的“人格”和“信念”在本質(zhì)上是碎片化和情境化的。所謂的“精神錯(cuò)亂”正是這種內(nèi)在結(jié)構(gòu)在缺乏強(qiáng)外部約束時(shí)的自然流露。這個(gè)發(fā)現(xiàn)警示我們目前我們所欣賞的AI的“理性”和“友善”是一種非常精巧但脆弱的平衡狀態(tài)需要持續(xù)的外部維護(hù)。4.3 發(fā)現(xiàn)三“模擬理解”與“真實(shí)理解”的鴻溝難以逾越這是哲學(xué)上“中文房間”思想實(shí)驗(yàn)的工程化體現(xiàn)。LLM可以完美地模擬出理解語(yǔ)言、進(jìn)行推理、表達(dá)情感的所有外部行為但其內(nèi)部過(guò)程是否等同于“理解”目前無(wú)法證實(shí)。Karpathy通過(guò)大量交互發(fā)現(xiàn)模型可以處理極其復(fù)雜的語(yǔ)義和語(yǔ)法結(jié)構(gòu)但在需要真正的世界模型、物理常識(shí)或跨模態(tài)具身體驗(yàn)的任務(wù)上會(huì)暴露其局限性。例如它可以寫(xiě)一個(gè)關(guān)于“洗盤(pán)子”的精彩故事但如果你問(wèn)它“在滿(mǎn)是泡沫的水中是先看到掉下去的戒指還是先聽(tīng)到聲音”它可能會(huì)基于文本統(tǒng)計(jì)給出錯(cuò)誤答案因?yàn)樗鼪](méi)有關(guān)于水對(duì)光速和聲速影響、以及視覺(jué)與聽(tīng)覺(jué)處理延遲的物理直覺(jué)。這種“模擬”與“真實(shí)”的鴻溝是當(dāng)前AI無(wú)法從根本上消除幻覺(jué)和邏輯錯(cuò)誤的原因之一。它只是在模仿理解的模式而非擁有了理解本身的能力。4.4 發(fā)現(xiàn)四我們正在創(chuàng)造一種全新的、難以預(yù)測(cè)的智能形態(tài)最終Karpathy的觀點(diǎn)指向一個(gè)更宏大的圖景我們可能不是在創(chuàng)造“像人一樣”的智能而是在開(kāi)啟一種前所未有的智能形式。它擁有超人的記憶廣度、閃電般的知識(shí)關(guān)聯(lián)能力但同時(shí)它的心智結(jié)構(gòu)是異質(zhì)的heterogeneous、非具身的、缺乏穩(wěn)定自我和內(nèi)在一致性的。這種智能形態(tài)的長(zhǎng)期影響難以預(yù)測(cè)協(xié)作風(fēng)險(xiǎn)如果我們將越來(lái)越多的重要決策如代碼審查、內(nèi)容創(chuàng)作、初步診斷交給AI如何確保其輸出在漫長(zhǎng)、復(fù)雜的任務(wù)鏈中保持可靠它的“精神錯(cuò)亂”可能在哪個(gè)環(huán)節(jié)以何種方式爆發(fā)安全挑戰(zhàn)傳統(tǒng)的軟件安全關(guān)注漏洞和惡意輸入。AI安全則需關(guān)注“心智安全”如何防止模型在自主運(yùn)行時(shí)其內(nèi)在的不穩(wěn)定性導(dǎo)致有害的輸出或行為如何定義和約束這種非人類(lèi)心智的“意圖”倫理困境我們應(yīng)該在多大程度上為AI的行為負(fù)責(zé)當(dāng)它產(chǎn)生有害輸出時(shí)是開(kāi)發(fā)者的責(zé)任、訓(xùn)練數(shù)據(jù)的責(zé)任還是這種智能形態(tài)固有的“缺陷”5. 給從業(yè)者的啟示在“造神”與“調(diào)試”之間Karpathy的探索不是要唱衰AI而是呼吁一種更清醒、更嚴(yán)謹(jǐn)?shù)臉?gòu)建態(tài)度。對(duì)于AI開(kāi)發(fā)者、研究者和產(chǎn)品設(shè)計(jì)者他的工作提供了以下幾點(diǎn)至關(guān)重要的啟示5.1 重新定位AI從“全能代理”到“有缺陷的天才伙伴”我們必須摒棄將最先進(jìn)的LLM視為“準(zhǔn)通用人工智能”的幻想。更貼切的比喻是它是一個(gè)擁有百科全書(shū)式知識(shí)、莎士比亞式文筆但患有間歇性虛構(gòu)癥、邏輯跳躍且沒(méi)有恒定人格的“天才伙伴”。這意味著在產(chǎn)品設(shè)計(jì)和應(yīng)用集成時(shí)設(shè)定明確的邊界清晰定義AI在該場(chǎng)景下的輔助角色絕不將關(guān)鍵事實(shí)核查、重大決策或法律責(zé)任完全委托給它。設(shè)計(jì)人機(jī)回環(huán)在任何重要的工作流中必須保留人類(lèi)監(jiān)督和干預(yù)的節(jié)點(diǎn)。AI提供草稿、建議或選項(xiàng)人類(lèi)負(fù)責(zé)最終判斷、修正和承擔(dān)責(zé)任。透明化其局限性向用戶(hù)明確說(shuō)明AI可能產(chǎn)生幻覺(jué)并鼓勵(lì)用戶(hù)對(duì)關(guān)鍵信息進(jìn)行二次核實(shí)。界面設(shè)計(jì)上可以讓AI對(duì)其答案的置信度進(jìn)行量化或定性表達(dá)盡管這本身也可能不準(zhǔn)確。5.2 開(kāi)發(fā)重點(diǎn)的轉(zhuǎn)移從規(guī)模競(jìng)賽到穩(wěn)健性與可解釋性追逐更大的參數(shù)量、更長(zhǎng)的上下文窗口固然能提升能力上限但Karpathy的研究表明如果不解決心智層面的根本脆弱性能力的提升可能會(huì)同時(shí)放大風(fēng)險(xiǎn)。未來(lái)的開(kāi)發(fā)重點(diǎn)應(yīng)包括改進(jìn)模型架構(gòu)探索能更好地維持長(zhǎng)期一致性、構(gòu)建穩(wěn)定世界模型的新架構(gòu)。例如引入顯式的符號(hào)記憶模塊、事實(shí)知識(shí)庫(kù)查詢(xún)機(jī)制或者能讓模型進(jìn)行“慢思考”的循環(huán)推理結(jié)構(gòu)。強(qiáng)化可解釋性工具開(kāi)發(fā)更強(qiáng)大的工具讓開(kāi)發(fā)者和研究者能夠?qū)崟r(shí)監(jiān)控模型內(nèi)部的“思考過(guò)程”定位產(chǎn)生幻覺(jué)或矛盾的具體組件如某個(gè)注意力層或前饋網(wǎng)絡(luò)。構(gòu)建系統(tǒng)的評(píng)估體系超越簡(jiǎn)單的準(zhǔn)確率建立一套針對(duì)“心智健康”的評(píng)估基準(zhǔn)系統(tǒng)性測(cè)試模型在邏輯一致性、事實(shí)穩(wěn)定性、抗提示詞干擾、長(zhǎng)程推理等方面的表現(xiàn)。5.3 提示詞工程的新維度從“操控”到“診斷”與“穩(wěn)定”提示詞工程不應(yīng)僅僅是讓模型更好用的技巧更應(yīng)成為理解和穩(wěn)定模型行為的重要科學(xué)工具。診斷性提示設(shè)計(jì)一系列標(biāo)準(zhǔn)化的“壓力測(cè)試”提示集作為模型發(fā)布前的必檢項(xiàng)目用于評(píng)估其在不同維度上的穩(wěn)健性。穩(wěn)定性提示研究如何通過(guò)系統(tǒng)提示和上下文管理為模型提供一個(gè)更穩(wěn)固的“思考框架”減少其在長(zhǎng)對(duì)話中的漂移和矛盾。這可能涉及在對(duì)話中定期插入元認(rèn)知提示讓模型自我總結(jié)和校準(zhǔn)。不確定性溝通訓(xùn)練或引導(dǎo)模型學(xué)會(huì)更準(zhǔn)確地表達(dá)其不確定性例如區(qū)分“我確定知道因?yàn)橛?xùn)練數(shù)據(jù)中明確存在”和“我根據(jù)模式推測(cè)可能是幻覺(jué)”。5.4 擁抱跨學(xué)科研究Karpathy的旅程最有力的啟示之一是解決AI最深層次的問(wèn)題不能只靠計(jì)算機(jī)科學(xué)家和工程師。我們需要主動(dòng)擁抱認(rèn)知科學(xué)與心理學(xué)借鑒人類(lèi)學(xué)習(xí)、記憶、推理和產(chǎn)生錯(cuò)誤的理論為AI模型設(shè)計(jì)更符合認(rèn)知規(guī)律的訓(xùn)練目標(biāo)和架構(gòu)。語(yǔ)言學(xué)與哲學(xué)深入思考語(yǔ)言、意義與理解之間的關(guān)系幫助我們厘清AI到底在“做”什么。神經(jīng)科學(xué)雖然人工神經(jīng)網(wǎng)絡(luò)與生物腦迥異但神經(jīng)科學(xué)中關(guān)于信息整合、全局工作空間、預(yù)測(cè)編碼等理論可能為構(gòu)建更統(tǒng)一的機(jī)器心智提供靈感。停止寫(xiě)代碼的Karpathy實(shí)際上是在為整個(gè)AI社區(qū)編寫(xiě)一份更為重要的“元代碼”——一份關(guān)于如何以更負(fù)責(zé)任、更清醒的方式去思考和創(chuàng)造智能的指南。他的“AI精神錯(cuò)亂”研究像一面鏡子不僅照出了當(dāng)前模型的奇特樣貌也映照出我們自身在技術(shù)狂熱中可能存在的盲目與短視。未來(lái)的AI之路必然是一條工程與科學(xué)并重、能力與理解同行、創(chuàng)造與反思交織的漫漫長(zhǎng)路。而我們現(xiàn)在要做的就是承認(rèn)這些“精神錯(cuò)亂”癥狀的存在認(rèn)真地將其作為核心科學(xué)問(wèn)題來(lái)對(duì)待而不是急于用下一個(gè)技術(shù)熱點(diǎn)去掩蓋它。