關(guān)鍵詞及原理:LLM、Transformer、GPT、Bert、預(yù)訓(xùn)練、微調(diào)、深度學(xué)習(xí)、Token)
什么是大模型你是不是腦子里浮現(xiàn)的是 OpenAI、ChatGPT、DeepSeek還有各式各樣能跳個(gè)舞、可以翻個(gè)跟頭的機(jī)器人再深入點(diǎn)的還能說出訓(xùn)練與推理。有沒有一種感覺就是身邊的信息都在聲嘶力竭的鼓吹大模型正在改變世界恍惚自己再不學(xué)習(xí)下大模型就馬上會(huì)被世界所拋棄的感覺如果你有這種感覺那就對(duì)了。因?yàn)槲以?jīng)也有這個(gè)感覺所以在某個(gè)時(shí)間、某個(gè)瞬間我就下定決心要躬身入局弄清楚它的概念與原理。所以就有了這篇文章弄懂了它們就已經(jīng)超過了很多人如果還明白了其原理就達(dá)到了“磚家”級(jí)別。即使是跟別人吹牛時(shí)也不致于內(nèi)心發(fā)虛。專業(yè)詞匯閱讀與理解時(shí)肯定沒有娛樂新聞?dòng)腥はM覀円黄鹉艹料滦膩硗暾喿x與理解時(shí)間不會(huì)辜負(fù)每個(gè)努力學(xué)習(xí)的人下面我們一起進(jìn)步。深度學(xué)習(xí)【人工智能】的英文單詞是 artificial intelligence即我們常說的 AI。跟它相關(guān)的還有兩個(gè)專業(yè)詞匯一個(gè)是深度學(xué)習(xí)一個(gè)是機(jī)器學(xué)習(xí)。【深度學(xué)習(xí)】英文單詞是 deep learning【機(jī)器學(xué)習(xí)】的英文單詞是 machine learning。深度學(xué)習(xí)是機(jī)器學(xué)習(xí)和人工智能領(lǐng)域的一個(gè)重要分支主要聚焦于神經(jīng)網(wǎng)絡(luò)的研究。深度學(xué)習(xí)的發(fā)展使得大語言模型能夠利用海量的文本數(shù)據(jù)進(jìn)行訓(xùn)練從而相比于以往的方法能夠捕獲更深層次的上下文信息和人類語言的細(xì)微之處。因此大語言模型在文本翻譯、情感分析、問答等各類自然語言處理任務(wù)中都有顯著的性能提升。大語言模型的成功一方面得益于為其提供支撐的Transformer 架構(gòu)另一方面得益于用于訓(xùn)練這些模型的海量數(shù)據(jù)。這使得它們能夠捕捉到語言中的各類細(xì)微差別、上下文信息和模式規(guī)律而這些都是手動(dòng)編碼難以實(shí)現(xiàn)的。LLM大語言模型large language modelLLM簡稱大模型是一種用于理解、生成和響應(yīng)類似人類語言文本的神經(jīng)網(wǎng)絡(luò)。這類模型屬于深度神經(jīng)網(wǎng)絡(luò)(deep neural network)通過大規(guī)模文本數(shù)據(jù)訓(xùn)練而成其訓(xùn)練資料甚至可能涵蓋了互聯(lián)網(wǎng)上大部分公開的文本。大語言模型在理解、生成和解釋人類語言方面擁有出色的能力。當(dāng)我們談?wù)撜Z言模型的“理解”能力時(shí)實(shí)際上是指它們能夠處理和生成看似連貫且符合語境的文本而這并不意味著它們真的擁有像人類一樣的意識(shí)或理解能力。“大語言模型”這一名稱中的“大”字既體現(xiàn)了模型訓(xùn)練時(shí)所依賴的龐大數(shù)據(jù)集也反映了模型本身龐大的參數(shù)規(guī)模。這類模型通常擁有數(shù)百億甚至數(shù)千億個(gè)參數(shù)(parameter)。這些參數(shù)是神經(jīng)網(wǎng)絡(luò)中的可調(diào)整權(quán)重在訓(xùn)練過程中不斷被優(yōu)化以預(yù)測(cè)文本序列中的下一個(gè)詞。下一單詞預(yù)測(cè)(next-word prediction)任務(wù)合理地利用了語言本身具有順序這一特性來訓(xùn)練模型使得模型能夠理解文本中的上下文、結(jié)構(gòu)和各種關(guān)系。由于大語言模型能夠生成文本因此它們通常也被歸類為生成式人工智能generative artificial intelligence簡稱 generative AI 或GenAI。如今大多數(shù)大語言模型是使用 PyTorch 深度學(xué)習(xí)庫實(shí)現(xiàn)的針對(duì)特定領(lǐng)域或任務(wù)量身打造的大語言模型在性能上往往優(yōu)于 ChatGPT 等為多種應(yīng)用場(chǎng)景而設(shè)計(jì)的通用大語言模型。這樣的例子包括專用于金融領(lǐng)域的模型和專用于醫(yī)學(xué)問答的大語言模型。使用定制的大語言模型具有多個(gè)優(yōu)勢(shì)尤其是在數(shù)據(jù)隱私方面。例如出于機(jī)密性考慮公司可能不愿將敏感數(shù)據(jù)共享給像 OpenAI 這樣的第三方大語言模型提供商。此外如果開發(fā)較小的定制的大語言模型那么就可以將其直接部署到客戶設(shè)備筆記本電腦和智能手機(jī)上。這也是大模型企業(yè)落地正在探索的方向。本地部署可以顯著減少延遲并降低與服務(wù)器相關(guān)的成本。【預(yù)訓(xùn)練】與【微調(diào)】此外定制的大語言模型使開發(fā)者擁有完全的自主權(quán)能夠根據(jù)需要控制模型的更新和修改。大語言模型的構(gòu)建通常包括預(yù)訓(xùn)練(pre-training)和微調(diào)(fine-tuning)兩個(gè)階段。預(yù)訓(xùn)練定義預(yù)訓(xùn)練是利用大規(guī)模通用數(shù)據(jù)對(duì)模型進(jìn)行初步訓(xùn)練使其學(xué)習(xí)數(shù)據(jù)中的通用特征和規(guī)律為后續(xù)特定任務(wù)學(xué)習(xí)奠定基礎(chǔ)的過程。“預(yù)訓(xùn)練”中的“預(yù)”表明它是模型訓(xùn)練的初始階段此時(shí)模型會(huì)在大規(guī)模、多樣化的數(shù)據(jù)集上進(jìn)行訓(xùn)練以形成全面的語言理解能力。以預(yù)訓(xùn)練模型為基礎(chǔ)微調(diào)階段會(huì)在規(guī)模較小的特定任務(wù)或領(lǐng)域數(shù)據(jù)集上對(duì)模型進(jìn)行針對(duì)性訓(xùn)練以進(jìn)一步提升其特定能力。請(qǐng)點(diǎn)擊圖片放大仔細(xì)理解其完整過程預(yù)訓(xùn)練是大語言模型的第一個(gè)訓(xùn)練階段預(yù)訓(xùn)練后的大語言模型通常稱為基礎(chǔ)模型(foundation model)。一個(gè)典型例子是 ChatGPT的前身——GPT-3這個(gè)模型能夠完成文本補(bǔ)全任務(wù)即根據(jù)用戶的前半句話將句子補(bǔ)全。此外它還展現(xiàn)了有限的少樣本學(xué)習(xí)能力這意味著它可以在沒有大量訓(xùn)練數(shù)據(jù)的情況下基于少量示例來學(xué)習(xí)并執(zhí)行新任務(wù)。【微調(diào)】的定義微調(diào)是在預(yù)訓(xùn)練模型基礎(chǔ)上通過少量特定領(lǐng)域數(shù)據(jù)對(duì)模型參數(shù)進(jìn)行針對(duì)性優(yōu)化使其更適配具體任務(wù)的過程。微調(diào)大語言模型最流行的兩種方法是【指令微調(diào)】和【分類任務(wù)微調(diào)】。在指令微調(diào)(instruction fine-tuning)中標(biāo)注數(shù)據(jù)集由“指令?答案”對(duì)比如翻譯任務(wù)中的“原文?正確翻譯文本”組成。在分類任務(wù)微調(diào)(classification fine-tuning)中標(biāo)注數(shù)據(jù)集由文本及其類別標(biāo)簽比如已被標(biāo)記為“垃圾郵件”或“非垃圾郵件”的電子郵件文本組成。Transformer 架構(gòu)該架構(gòu)是在谷歌于 2017年發(fā)表的論文“Attention Is All You Need”中首次提出的。Transformer 最初是為機(jī)器翻譯任務(wù)比如將英文翻譯成德語和法語開發(fā)的。Transformer 架構(gòu)由兩個(gè)子模塊構(gòu)成編碼器和解碼器。編碼器(encoder)模塊負(fù)責(zé)處理輸入文本將其編碼為一系列數(shù)值表示或向量以捕捉輸入的上下文信息。然后解碼器(decoder)模塊接收這些編碼向量并據(jù)此生成輸出文本。以翻譯任務(wù)為例編碼器將源語言的文本編碼成向量解碼器則解碼這些向量以生成目標(biāo)語言的文本。編碼器和解碼器都是由多層組成這些層通過自注意力機(jī)制連接。Transformer 和大語言模型的一大關(guān)鍵組件是自注意力機(jī)制(self-attention mechanism)它允許模型衡量序列中不同單詞或詞元之間的相對(duì)重要性。這一機(jī)制使得模型能夠捕捉到輸入數(shù)據(jù)中長距離的依賴和上下文關(guān)系從而提升其生成連貫且上下文相關(guān)的輸出的能力。并非所有的 Transformer 都是大語言模型因?yàn)門ransformer 也可用于計(jì)算機(jī)視覺領(lǐng)域。同樣并非所有的大語言模型都基于 Transformer 架構(gòu)因?yàn)檫€存在基于循環(huán)和卷積架構(gòu)的大語言模型。GPT 與 Bert與原始 Transformer 架構(gòu)相比GPT的通用架構(gòu)更為簡潔。請(qǐng)點(diǎn)擊圖片放大仔細(xì)理解其完整過程它只包含解碼器部分并不包含編碼器。由于像 GPT 這樣的解碼器模型是通過逐詞預(yù)測(cè)生成文本因此它們被認(rèn)為是一種自回歸模型(autoregressive model)。自回歸模型將之前的輸出作為未來預(yù)測(cè)的輸入。GPT-3 總共有 96 層 Transformer 和 1750 億個(gè)參數(shù)雖然原始的 Transformer 模型包含編碼器模塊和解碼器模塊專門為語言翻譯而設(shè)計(jì)但 GPT 模型采用了更大且更簡單的純解碼器架構(gòu)旨在預(yù)測(cè)下一個(gè)詞并且它們也能執(zhí)行翻譯任務(wù)。模型能夠完成未經(jīng)明確訓(xùn)練的任務(wù)的能力稱為涌現(xiàn)(emergence)。這種能力并非模型在訓(xùn)練期間被明確教授所得而是其廣泛接觸大量多語言數(shù)據(jù)和各種上下文的自然結(jié)果。GPT 則側(cè)重于原始 Transformer 架構(gòu)的解碼器部分主要用于處理生成文本的任務(wù)包括機(jī)器翻譯、文本摘要、小說寫作、代碼編寫等。零樣本學(xué)習(xí)(zero-shot learning)是指在沒有任何特定示例的情況下泛化到從未見過的任務(wù)而少樣本學(xué)習(xí)(few-shot learning)是指從用戶提供的少量示例中進(jìn)行學(xué)習(xí)。BERT 基于原始 Transformer的編碼器模塊構(gòu)建其訓(xùn)練方法與GPT 不同。GPT 主要用于生成任務(wù)而 BERT 及其變體專注于掩碼預(yù)測(cè)(masked word prediction)即預(yù)測(cè)給定句子中被掩碼的詞。請(qǐng)點(diǎn)擊圖片放大仔細(xì)理解其完整過程總而言之GPT 是 Transformer的解碼器部分Bert 是 Transformer 的編碼器部分。Token詞元(token)是模型讀取文本的基本單位。數(shù)據(jù)集中的詞元數(shù)量大致等同于文本中的單詞和標(biāo)點(diǎn)符號(hào)的數(shù)量。分詞即將文本轉(zhuǎn)換為詞元的過程。預(yù)訓(xùn)練 GPT-3的云計(jì)算費(fèi)用成本估計(jì)高達(dá) 460 萬美元。該模型僅在 3000 億個(gè)詞元上進(jìn)行了訓(xùn)練。好消息是許多預(yù)訓(xùn)練的大語言模型是開源模型可以作為通用工具用于寫作、摘要和編輯那些未包含在訓(xùn)練數(shù)據(jù)中的文本。同時(shí)這些大語言模型可以使用相對(duì)較小的數(shù)據(jù)集對(duì)特定任務(wù)進(jìn)行微調(diào)這不僅減少了模型所需的計(jì)算資源還提升了它們?cè)谔囟ㄈ蝿?wù)上的性能。下一單詞預(yù)測(cè)任務(wù)采用的是自監(jiān)督學(xué)習(xí)(self-supervised learning)模式這是一種自我標(biāo)記的方法。這意味著我們不需要專門為訓(xùn)練數(shù)據(jù)收集標(biāo)簽而是可以利用數(shù)據(jù)本身的結(jié)構(gòu)。也就是說我們可以使用句子或文檔中的下一個(gè)詞作為模型的預(yù)測(cè)標(biāo)簽。由于該任務(wù)允許“動(dòng)態(tài)”創(chuàng)建標(biāo)簽因此我們可以利用大量的無標(biāo)注文本數(shù)據(jù)集來訓(xùn)練大語言模型。請(qǐng)點(diǎn)擊圖片放大仔細(xì)理解其完整過程關(guān)鍵點(diǎn)總結(jié)LLM大語言模型基于深度學(xué)習(xí)構(gòu)建的超大規(guī)模語言模型能理解、生成自然語言并執(zhí)行復(fù)雜任務(wù)。Transformer一種基于自注意力機(jī)制的深度學(xué)習(xí)架構(gòu)是當(dāng)前主流大模型如 GPT、BERT的核心框架。GPT生成式預(yù)訓(xùn)練 Transformer基于 Transformer 的生成式預(yù)訓(xùn)練模型擅長自然語言生成如文本創(chuàng)作、對(duì)話交互。Bert雙向編碼器表示來自 Transformer基于 Transformer 的雙向預(yù)訓(xùn)練模型側(cè)重自然語言理解常用于文本分類、命名實(shí)體識(shí)別等任務(wù)。預(yù)訓(xùn)練在大規(guī)模無標(biāo)注數(shù)據(jù)上訓(xùn)練模型使其學(xué)習(xí)通用語言特征為下游任務(wù)提供基礎(chǔ)能力。微調(diào)FineTuning在預(yù)訓(xùn)練模型基礎(chǔ)上使用特定任務(wù)標(biāo)注數(shù)據(jù)進(jìn)一步訓(xùn)練使其適配具體應(yīng)用場(chǎng)景。深度學(xué)習(xí)通過多層神經(jīng)網(wǎng)絡(luò)自動(dòng)學(xué)習(xí)數(shù)據(jù)特征的機(jī)器學(xué)習(xí)領(lǐng)域是當(dāng)前大模型技術(shù)的基礎(chǔ)Token自然語言處理中對(duì)文本的最小處理單元如詞語、子詞或字符用于將文本轉(zhuǎn)換為模型可處理的數(shù)字序列。最后為什么要學(xué)AI大模型當(dāng)下??智能市場(chǎng)迎來了爆發(fā)期并逐漸進(jìn)?以??通?智能AGI為主導(dǎo)的新時(shí)代。企業(yè)紛紛官宣“ AI ”戰(zhàn)略為新興技術(shù)?才創(chuàng)造豐富的就業(yè)機(jī)會(huì)?才缺?將達(dá) 400 萬DeepSeek問世以來生成式AI和大模型技術(shù)爆發(fā)式增長讓很多崗位重新成了炙手可熱的新星崗位薪資遠(yuǎn)超很多后端崗位在程序員中穩(wěn)居前列。與此同時(shí)AI與各行各業(yè)深度融合飛速發(fā)展成為炙手可熱的新風(fēng)口企業(yè)非常需要了解AI、懂AI、會(huì)用AI的員工紛紛開出高薪招聘AI大模型相關(guān)崗位。最近很多程序員朋友都已經(jīng)學(xué)習(xí)或者準(zhǔn)備學(xué)習(xí) AI 大模型后臺(tái)也經(jīng)常會(huì)有小伙伴咨詢學(xué)習(xí)路線和學(xué)習(xí)資料我特別拜托北京清華大學(xué)學(xué)士和美國加州理工學(xué)院博士學(xué)位的魯為民老師給大家這里給大家準(zhǔn)備了一份涵蓋了AI大模型入門學(xué)習(xí)思維導(dǎo)圖、精品AI大模型學(xué)習(xí)書籍手冊(cè)、視頻教程、實(shí)戰(zhàn)學(xué)習(xí)等錄播視頻全系列的學(xué)習(xí)資料這些學(xué)習(xí)資料不僅深入淺出而且非常實(shí)用讓大家系統(tǒng)而高效地掌握AI大模型的各個(gè)知識(shí)點(diǎn)。這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】AI大模型系統(tǒng)學(xué)習(xí)路線在面對(duì)AI大模型開發(fā)領(lǐng)域的復(fù)雜與深入精準(zhǔn)學(xué)習(xí)顯得尤為重要。一份系統(tǒng)的技術(shù)路線圖不僅能夠幫助開發(fā)者清晰地了解從入門到精通所需掌握的知識(shí)點(diǎn)還能提供一條高效、有序的學(xué)習(xí)路徑。但知道是一回事做又是另一回事初學(xué)者最常遇到的問題主要是理論知識(shí)缺乏、資源和工具的限制、模型理解和調(diào)試的復(fù)雜性在這基礎(chǔ)上找到高質(zhì)量的學(xué)習(xí)資源不浪費(fèi)時(shí)間、不走彎路又是重中之重。AI大模型入門到實(shí)戰(zhàn)的視頻教程項(xiàng)目包看視頻學(xué)習(xí)是一種高效、直觀、靈活且富有吸引力的學(xué)習(xí)方式可以更直觀地展示過程能有效提升學(xué)習(xí)興趣和理解力是現(xiàn)在獲取知識(shí)的重要途徑光學(xué)理論是沒用的要學(xué)會(huì)跟著一起敲要?jiǎng)邮謱?shí)操才能將自己的所學(xué)運(yùn)用到實(shí)際當(dāng)中去這時(shí)候可以搞點(diǎn)實(shí)戰(zhàn)案例來學(xué)習(xí)。海量AI大模型必讀的經(jīng)典書籍PDF閱讀AI大模型經(jīng)典書籍可以幫助讀者提高技術(shù)水平開拓視野掌握核心技術(shù)提高解決問題的能力同時(shí)也可以借鑒他人的經(jīng)驗(yàn)。對(duì)于想要深入學(xué)習(xí)AI大模型開發(fā)的讀者來說閱讀經(jīng)典書籍是非常有必要的。600AI大模型報(bào)告實(shí)時(shí)更新這套包含640份報(bào)告的合集涵蓋了AI大模型的理論研究、技術(shù)實(shí)現(xiàn)、行業(yè)應(yīng)用等多個(gè)方面。無論您是科研人員、工程師還是對(duì)AI大模型感興趣的愛好者這套報(bào)告合集都將為您提供寶貴的信息和啟示。AI大模型面試真題答案解析我們學(xué)習(xí)AI大模型必然是想找到高薪的工作下面這些面試題都是總結(jié)當(dāng)前最新、最熱、最高頻的面試題并且每道題都有詳細(xì)的答案面試前刷完這套面試題資料小小offer不在話下這份完整版的大模型 AI 學(xué)習(xí)資料已經(jīng)上傳CSDN朋友們?nèi)绻枰梢晕⑿艗呙柘路紺SDN官方認(rèn)證二維碼免費(fèi)領(lǐng)取【保證100%免費(fèi)】