存操作)
1. 從“黑盒”到“白盒”為什么要親手模擬一個strcpy如果你寫過C語言strcpy這個函數(shù)對你來說肯定不陌生。它太基礎(chǔ)了基礎(chǔ)到我們常常把它當作一個理所當然的“黑盒”來用傳進去一個源字符串和一個目標地址它就把內(nèi)容復制過去。在初學階段老師可能還會強調(diào)一下它的危險性——目標緩沖區(qū)必須足夠大否則就是經(jīng)典的緩沖區(qū)溢出漏洞。但除此之外呢我們很少去深究這個看似簡單的函數(shù)內(nèi)部到底是怎么運轉(zhuǎn)的。這就是“動手模擬”的意義所在。它不是一個為了造輪子而造輪子的練習而是一次將“黑盒”變?yōu)椤鞍缀小钡纳疃忍剿鳌Mㄟ^親手實現(xiàn)一個my_strcpy你會被迫去思考那些被標準庫封裝起來的底層細節(jié)指針是如何一步步移動的字符串的終止標志\0是如何被處理的在復制過程中內(nèi)存的字節(jié)是如何被搬運的這個過程遠比調(diào)用十次、百次strcpy更能讓你理解C語言中指針和內(nèi)存操作的精髓。更進一步說strcpy是C語言字符串操作家族的基石。理解了它的實現(xiàn)strcat字符串連接、strcmp字符串比較等函數(shù)的實現(xiàn)思路也就觸類旁通了。它們核心的邏輯都是對指針的遍歷和操作。當你自己實現(xiàn)一遍后再去看man手冊里關(guān)于這些函數(shù)的描述會有一種“原來如此”的透徹感。這不僅僅是掌握了一個函數(shù)而是打通了字符串處理這一類問題的任督二脈。從工程實踐的角度看理解strcpy的底層行為是寫出健壯、安全代碼的前提。你知道為什么strcpy(dest, src)可能會覆蓋掉dest之后的內(nèi)存嗎因為你清楚地模擬過指針越界的過程。你知道為什么有些“安全”版本的strncpy函數(shù)行為詭異比如不保證目標字符串以\0結(jié)尾嗎因為你在實現(xiàn)自己的版本時已經(jīng)考慮過各種邊界條件。這種從內(nèi)部機理出發(fā)的理解是防范未來代碼中潛在漏洞的最有力武器。所以讓我們暫時忘掉#include string.h從零開始用最原始的指針操作來揭開strcpy的神秘面紗。這個過程會比你想象的有趣也更有收獲。2. 庖丁解牛標準strcpy的函數(shù)原型與行為約定在動手造輪子之前我們必須先徹底搞清楚原版輪子的規(guī)格說明書。strcpy的函數(shù)原型就是這份最核心的規(guī)格書。char *strcpy(char *dest, const char *src);這個聲明看似簡單卻蘊含了C語言設(shè)計哲學的多個關(guān)鍵點。我們來逐一拆解2.1 參數(shù)分析dest與src的“角色”與“約束”第一個參數(shù)char *dest這是目標destination字符串的指針。它指向一塊我們已經(jīng)分配好的、連續(xù)的內(nèi)存空間strcpy的任務就是把數(shù)據(jù)復制到這里。注意這里傳入的是指針函數(shù)內(nèi)部對dest的修改移動指針會影響外部的那個指針副本嗎不會因為C語言是值傳遞但通過這個指針我們可以修改它所指向的內(nèi)存內(nèi)容。這是理解后續(xù)所有操作的基礎(chǔ)。第二個參數(shù)const char *src這是源source字符串的指針。const關(guān)鍵字在這里至關(guān)重要它是一個對函數(shù)實現(xiàn)者和調(diào)用者的雙重承諾。對調(diào)用者而言它承諾“我傳給你的字符串你不會去修改它”增強了代碼的可讀性和安全性。對函數(shù)實現(xiàn)者也就是我們而言它是一個強制約束在函數(shù)體內(nèi)任何試圖通過src指針修改其指向內(nèi)存內(nèi)容的操作都會導致編譯器報錯。這保證了源字符串在復制過程中的“只讀”屬性。2.2 返回值解析為什么返回char*函數(shù)的返回值是char *并且通常返回的就是傳入的dest指針。這個設(shè)計初看有些多余但它實現(xiàn)了“鏈式調(diào)用”function chaining的可能性。例如你可以這樣寫printf(%s\n, strcpy(buffer, Hello));這里strcpy執(zhí)行后返回了buffer這個返回值直接作為printf的參數(shù)。雖然這種寫法在實際項目中需謹慎使用可能影響可讀性但它體現(xiàn)了C語言簡潔、高效的設(shè)計理念。在我們的模擬實現(xiàn)中也必須遵守這個約定在函數(shù)末尾返回目標指針。2.3 核心行為約定復制規(guī)則與終止條件這是strcpy的靈魂所在我們的模擬實現(xiàn)必須100%復現(xiàn)這些行為復制內(nèi)容將src指向的字符串包括終止的空字符\0復制到dest指向的位置。復制順序從內(nèi)存的低地址向高地址逐個字節(jié)對于char類型就是一個字節(jié)進行復制。終止條件復制過程持續(xù)進行直到遇到src中的空字符\0并且將這個\0也復制到dest中。復制完\0后整個復制過程立即停止。內(nèi)存重疊標準并未定義當src和dest所指向的內(nèi)存區(qū)域發(fā)生重疊overlap時的行為。這意味著如果dest的地址在src和srcstrlen(src)之間結(jié)果是未定義的Undefined Behavior, UB。一個健壯的庫實現(xiàn)可能會處理這種情況如使用memmove但標準的strcpy不保證。我們的基礎(chǔ)模擬版本也可以先不考慮這種情況。緩沖區(qū)大小調(diào)用者必須保證dest指向的空間足以容納src字符串包括\0。這是調(diào)用者的責任函數(shù)內(nèi)部不做任何檢查。這正是strcpy被認為“不安全”的根源。理解這些約定后我們就可以用最直觀的代碼來描述其行為了一個從src到dest的、以\0為終點的字節(jié)搬運循環(huán)。接下來我們就將這個循環(huán)用代碼實現(xiàn)出來。3. 第一版實現(xiàn)最直觀的“指針移動法”讓我們從最符合直覺的方式開始實現(xiàn)。既然是要逐個字符復制直到遇到\0那么一個while循環(huán)是最直接的選擇。這個版本我將它稱為“指針移動法”因為它直接操作傳入的指針參數(shù)。3.1 代碼實現(xiàn)與逐行解讀char *my_strcpy_v1(char *dest, const char *src) { // 步驟1保存目標指針的起始位置用于最終返回 char *origin_dest dest; // 步驟2核心復制循環(huán) while (*src ! \0) { // 只要源字符不是字符串結(jié)束符 *dest *src; // 將源字符賦值給目標位置 dest; // 目標指針向后移動一個字符位置 src; // 源指針向后移動一個字符位置 } // 步驟3復制字符串終止符 \0 *dest \0; // 步驟4返回目標字符串的起始地址 return origin_dest; }現(xiàn)在我們來拆解這個循環(huán)的每一個細節(jié)這比代碼本身更重要char *origin_dest dest;這是實現(xiàn)返回值約定的關(guān)鍵技巧。dest是一個指針變量傳入函數(shù)的是它的值一個內(nèi)存地址。在循環(huán)中我們需要移動這個指針dest來遍歷目標緩沖區(qū)。如果我們移動了dest函數(shù)結(jié)束時它指向的就是字符串的末尾\0的位置而不是起始位置。為了能返回起始地址我們在一開始就用另一個變量origin_dest“錨定”這個起始位置。整個函數(shù)中origin_dest保持不變而dest作為“工作指針”不斷移動。while (*src ! \0)這是循環(huán)的條件。*src是“解引用”操作它獲取src指針當前所指向的內(nèi)存中的字符值。只要這個值不是空字符\0循環(huán)就繼續(xù)。這里有一個非常重要的點這個條件判斷發(fā)生在每次復制之前。這意味著如果src一開始就指向\0即空字符串循環(huán)體一次都不會執(zhí)行直接跳到后面復制\0的步驟。*dest *src;這是復制的核心語句。把src指向的字符值賦值給dest指向的內(nèi)存位置。注意這里操作的是字符值不是指針。dest;和src;這是指針算術(shù)。dest表示將dest指針向前移動指向下一個char類型元素的內(nèi)存地址。因為char占1字節(jié)所以這里dest的值內(nèi)存地址實際增加了1。src同理。這兩行代碼驅(qū)動著指針遍歷整個字符串。循環(huán)結(jié)束后*dest \0;當while循環(huán)因為*src \0而退出時我們已經(jīng)復制了\0之前的所有字符。但請注意此時src指向的是\0這個字符本身而我們還沒有執(zhí)行*dest *src;來復制它。所以我們需要在循環(huán)體外手動將\0復制到dest的當前位置。此時dest指針正好指向目標緩沖區(qū)中該放置結(jié)束符的位置。return origin_dest;返回我們一開始保存的起始地址滿足函數(shù)原型約定。3.2 邏輯推演與邊界測試讓我們在腦子里或者畫在紙上模擬一下這個過程假設(shè)src指向字符串Hi(內(nèi)存布局:H, i, \0)dest指向一塊足夠大的空緩沖區(qū)。初始origin_dest dest*src是H。第一輪循環(huán)H ! \0成立執(zhí)行*dest H然后dest,src。現(xiàn)在dest指向目標第二個位置src指向源字符串的i。第二輪循環(huán)i ! \0成立執(zhí)行*dest i然后dest,src。現(xiàn)在dest指向目標第三個位置src指向源字符串的\0。第三輪循環(huán)判斷*src現(xiàn)在是\0條件*src ! \0為假循環(huán)結(jié)束。循環(huán)外執(zhí)行*dest \0將結(jié)束符復制到目標緩沖區(qū)的第三個位置。返回origin_dest。最終目標緩沖區(qū)包含了H, i, \0復制完成。對于空字符串src一開始就指向\0循環(huán)直接跳過循環(huán)外執(zhí)行*dest \0結(jié)果也是正確的。注意一個常見的思維誤區(qū)有人可能會想為什么不在循環(huán)條件里寫成while ((*dest *src) ! \0)這種更緊湊的形式這確實是更經(jīng)典的寫法我們會在下一個版本看到。但在第一版中我們刻意拆解開是為了讓“判斷”、“賦值”、“指針后移”這三個步驟清晰可見這對于理解底層機制至關(guān)重要。在初學階段清晰性比簡潔性更重要。4. 第二版實現(xiàn)追求極致的“表達式濃縮法”如果你看過一些經(jīng)典的C語言庫源碼或者資深工程師的代碼你會發(fā)現(xiàn)他們很少寫像我們第一版那樣“啰嗦”的strcpy。他們追求的是在保證正確性的前提下極致的簡潔和效率。這就是我們的第二版實現(xiàn)我稱之為“表達式濃縮法”。它不僅是代碼風格的變化更體現(xiàn)了對C語言表達式和運算符優(yōu)先級的深刻理解。4.1 經(jīng)典的單行實現(xiàn)char *my_strcpy_v2(char *dest, const char *src) { char *origin_dest dest; while ((*dest *src) ! \0) ; // 空循環(huán)體 return origin_dest; }甚至連保存起始地址的變量都可以省去直接操作參數(shù)副本但為了清晰我們保留origin_dest。這段代碼極其緊湊信息密度很高。我們來徹底解析這行核心的while條件(*dest *src) ! \0這行代碼同時完成了賦值、指針后移和條件判斷三件事。它的執(zhí)行順序由C語言的運算符優(yōu)先級和結(jié)合性決定子表達式*dest和*src后綴的優(yōu)先級高于解引用*。所以dest先被求值但它的值是dest遞增之前的值即當前地址。然后這個值舊地址被用來進行解引用操作*。最后dest指針本身的值被加1指向下一個位置。src同理。簡單記*p的意思是“取得p當前指向的值然后讓p指向下一個位置”。賦值操作將*src源字符值賦給*dest目標內(nèi)存位置。賦值表達式本身也有一個值它的值就是被賦值后的左操作數(shù)的值也就是賦值后*dest舊地址處的值的值。不等于比較! \0將上一步賦值表達式的值即剛剛復制到dest的那個字符與\0進行比較。如果這個字符不是\0則循環(huán)條件為真繼續(xù)下一輪如果這個字符就是\0則條件為假循環(huán)終止。4.2 執(zhí)行過程推演還是以src Hi為例第一輪*src得到Hsrc后移*dest H將H賦值dest后移賦值表達式的值為H。H ! \0為真循環(huán)繼續(xù)。第二輪*src得到isrc后移*dest i將i賦值dest后移賦值表達式的值為i。i ! \0為真循環(huán)繼續(xù)。第三輪*src得到\0src后移*dest \0將\0賦值dest后移賦值表達式的值為\0。\0 ! \0為假循環(huán)終止。妙處在于當復制到\0時賦值操作已經(jīng)完成\0已經(jīng)被復制并且循環(huán)條件判斷為假使得循環(huán)自然結(jié)束不需要在循環(huán)體外再單獨復制\0。代碼邏輯和第一版完全等價但更加精煉。4.3 空循環(huán)體與代碼風格注意while后面直接跟了一個分號;這是一個“空語句”null statement作為循環(huán)體。它表示“循環(huán)條件中已經(jīng)完成了所有工作循環(huán)體不需要做任何額外操作”。這是一種常見的C語言 idiom慣用法。有些編碼規(guī)范建議將空語句單獨放在一行或者用{ }括起來以避免歧義但這種寫法在系統(tǒng)編程中非常普遍。經(jīng)驗之談簡潔與清晰的權(quán)衡。第二版代碼是C語言技巧性的體現(xiàn)深受有經(jīng)驗的開發(fā)者喜愛。但對于團隊協(xié)作或代碼可維護性要求高的項目第一版那樣邏輯清晰的寫法可能更受歡迎尤其是在給初學者閱讀或調(diào)試時。知道如何寫第二版證明你理解了語言特性懂得在何時使用第一版則體現(xiàn)了你的工程素養(yǎng)。5. 第三版實現(xiàn)貼近硬件的“地址偏移法”前兩個版本我們都聚焦在指針本身的操作上。還有一種理解角度是把指針看作一個內(nèi)存地址通過數(shù)組下標的方式來進行訪問。這就是我們的第三版實現(xiàn)“地址偏移法”。它雖然不常見于strcpy的標準實現(xiàn)但對于理解指針和數(shù)組的等價性以及從另一個視角看待內(nèi)存訪問非常有幫助。5.1 使用下標遍歷char *my_strcpy_v3(char *dest, const char *src) { int i 0; // 循環(huán)復制直到遇到src[i]為結(jié)束符 do { dest[i] src[i]; } while (src[i] ! \0); // 注意判斷的是剛剛復制過去的那個字符 return dest; // 因為dest指針本身沒有移動所以可以直接返回 }這個版本看起來和指針版本很不一樣它使用了一個整數(shù)索引i。dest[i]在編譯器看來完全等價于*(dest i)。也就是說它先計算dest向后偏移i個char單位后的地址然后解引用。src[i]同理。5.2 do...while循環(huán)的玄機這里我特意使用了do...while循環(huán)而不是while。為什么如果使用while(src[i] ! \0)那么循環(huán)開始前會先判斷src[0]。如果src是空字符串src[0]就是\0循環(huán)體一次都不會執(zhí)行dest[0]就不會被賦值為\0導致錯誤。使用do...while循環(huán)則先執(zhí)行一次循環(huán)體再判斷條件。這樣即使src是空字符串也會先執(zhí)行dest[0] src[0]即dest[0] \0然后判斷src[0] ! \0為假循環(huán)結(jié)束。這完美地處理了空字符串的情況并且保證\0被復制。這個版本的邏輯是復制一個字符然后判斷這個剛被復制的字符是不是\0如果不是就繼續(xù)。這和前兩版“判斷下一個字符是不是\0不是就復制”的邏輯在結(jié)果上是等價的但執(zhí)行順序略有不同。5.3 版本對比與思維轉(zhuǎn)換特性指針移動法 (V1)表達式濃縮法 (V2)地址偏移法 (V3)核心思想顯式移動指針邏輯步驟分離利用表達式副作用高度濃縮將指針視為基地址用索引偏移循環(huán)類型while(前測試)while(前測試)do...while(后測試)\0處理循環(huán)外顯式復制在循環(huán)條件中復制并判斷在循環(huán)體中復制后判斷指針狀態(tài)dest/src最終指向\0后dest/src最終指向\0后dest/src始終指向起始位置代碼風格清晰易懂適合教學簡潔高效常見于源碼另類視角強調(diào)指針/數(shù)組等價性空字符串正確處理正確處理正確處理 (因do-while)通過實現(xiàn)這個版本你會更深刻地認識到在C語言中array[index]和*(array index)本質(zhì)上是同一回事。指針的加法運算就是計算偏移后的地址。這種理解對于后續(xù)學習更復雜的數(shù)據(jù)結(jié)構(gòu)如動態(tài)數(shù)組、字符串處理函數(shù)strchr,strstr等至關(guān)重要。踩坑點數(shù)組越界的視角。用下標法時我們更容易直觀地想到“i不能超過緩沖區(qū)大小”。這提醒我們無論哪種實現(xiàn)緩沖區(qū)溢出的危險始終存在。dest[i]的訪問越界和*(dest i)的越界是同一個問題。6. 深入測試驗證我們的模擬實現(xiàn)代碼寫完了但絕不能相信它一次就能完美工作。我們需要設(shè)計一套全面的測試用例像“鐵面判官”一樣審視我們的my_strcpy。測試不僅要覆蓋正常情況更要主動去觸碰那些邊界和極端情況。6.1 基礎(chǔ)功能測試首先我們搭建一個簡單的測試框架#include stdio.h #include string.h // 用于和標準庫函數(shù)對比 // 這里插入我們實現(xiàn)的 my_strcpy 函數(shù) (以V2版為例) char *my_strcpy_v2(char *dest, const char *src) { char *origin_dest dest; while ((*dest *src) ! \0) ; return origin_dest; } void test_case(const char *test_name, const char *src) { char std_dest[100] {0}; // 標準庫用的緩沖區(qū) char my_dest[100] {0}; // 我們函數(shù)用的緩沖區(qū) // 使用標準庫函數(shù) strcpy(std_dest, src); // 使用我們的函數(shù) my_strcpy_v2(my_dest, src); // 比較結(jié)果 if (strcmp(std_dest, my_dest) 0) { printf([PASS] %s: \%s\\n, test_name, src); } else { printf([FAIL] %s\n, test_name); printf( Expected: \%s\\n, std_dest); printf( Got: \%s\\n, my_dest); } } int main() { printf( 開始測試 my_strcpy \n); // 測試1: 普通字符串 test_case(普通ASCII字符串, Hello, World!); // 測試2: 空字符串 test_case(空字符串, ); // 測試3: 單個字符 test_case(單個字符, A); // 測試4: 長字符串 test_case(長字符串, This is a relatively longer string to test the function.); // 測試5: 包含空格、標點 test_case(帶空格標點, Hello, Dr. Smith! How are you?); printf( 測試結(jié)束 \n); return 0; }這些測試能確保我們的函數(shù)在常規(guī)輸入下行為和標準庫一致。6.2 邊界與陷阱測試基礎(chǔ)測試通過只是第一步下面這些測試才是真正考驗代碼健壯性的地方。我們需要單獨設(shè)計測試函數(shù)因為它們可能引發(fā)程序崩潰不適合放在自動對比框架里。void test_boundary() { printf(\n 邊界與陷阱測試 \n); // 測試6: 目標緩沖區(qū)恰好夠大危險邊緣 char exact_buffer[6]; // 剛好能容納 Hello \0 const char *src_exact Hello; my_strcpy_v2(exact_buffer, src_exact); printf(測試‘恰好夠大’緩沖區(qū): dest\%s\ (應等于\Hello\)\n, exact_buffer); // 手動檢查是否復制正確且沒有越界寫入這需要內(nèi)存檢查工具如Valgrind // 測試7: 源字符串是字面量目標緩沖區(qū)足夠大 char large_dest[100]; my_strcpy_v2(large_dest, String Literal); printf(測試字面量源字符串: dest\%s\\n, large_dest); // 測試8: 重疊內(nèi)存測試 (未定義行為觀察現(xiàn)象) char overlap[50] abcdefghijk; printf(重疊內(nèi)存測試前: %s\n, overlap); // 嘗試將 overlap3 復制到 overlap。這是未定義行為 // my_strcpy_v2(overlap, overlap 3); // 注釋掉因為結(jié)果不可預測可能死循環(huán)或錯誤 // printf(重疊內(nèi)存測試后: %s\n, overlap); printf(注意標準strcpy不支持內(nèi)存重疊此測試已跳過。\n); }6.3 內(nèi)存安全與未定義行為UB警示上面的測試中我們刻意避開了“目標緩沖區(qū)太小”這個最經(jīng)典的陷阱。為什么因為一旦我們傳入一個小于源字符串長度的目標緩沖區(qū)我們的my_strcpy和標準的strcpy一樣會毫不猶豫地繼續(xù)寫入覆蓋緩沖區(qū)之后的內(nèi)存。這可能導致覆蓋其他變量數(shù)據(jù)引發(fā)程序邏輯錯誤。破壞函數(shù)調(diào)用棧如返回地址導致程序崩潰或被利用進行攻擊緩沖區(qū)溢出攻擊。屬于C語言標準中的“未定義行為”Undefined Behavior程序可以做任何事情包括看似正常地工作但埋下深坑。這就是strcpy被詬病“不安全”的根本原因。我們的模擬實現(xiàn)完美地復現(xiàn)了這個“特性”——或者說這個“缺陷”。它忠實地反映了標準庫函數(shù)的行為信任調(diào)用者不做任何邊界檢查。重要心得測試的維度。測試一個函數(shù)尤其是底層函數(shù)不能只測“它應該做什么”更要測“當輸入不符合約定時它會做什么”。我們的測試表明my_strcpy在合法輸入下行為正確在非法輸入緩沖區(qū)不足下它和原版一樣危險。這提醒我們在使用任何不檢查邊界的字符串函數(shù)時緩沖區(qū)大小的計算是調(diào)用者的首要責任。在實際項目中我們應優(yōu)先使用strncpy、snprintf或更安全的字符串庫。7. 從模擬到思考strcpy的缺陷與安全替代方案通過親手實現(xiàn)我們不僅知道了strcpy怎么工作更真切地感受到了它的“鋒利”與“危險”。它是一把沒有護手的刀用好了效率極高用錯了傷人傷己。在現(xiàn)代軟件開發(fā)中尤其是對安全性要求高的領(lǐng)域直接使用strcpy往往被視為不良實踐。那么我們該如何應對7.1 strcpy的核心缺陷絕對的信任strcpy的設(shè)計哲學是“信任調(diào)用者”。它假設(shè)dest指向的空間一定足夠大。這個假設(shè)在簡單的、受控的上下文中可能成立但在復雜的、處理外部輸入如網(wǎng)絡(luò)數(shù)據(jù)、用戶輸入、文件內(nèi)容的系統(tǒng)中幾乎無法保證。一旦假設(shè)被違反緩沖區(qū)溢出就發(fā)生了這是無數(shù)安全漏洞的根源。7.2 經(jīng)典“安全”替代strncpy及其陷阱最常被提及的替代者是strncpy。它的原型是char *strncpy(char *dest, const char *src, size_t n);它多了一個參數(shù)n用于指定最多復制多少個字符到dest。看起來安全了對嗎大錯特錯strncpy的行為非常反直覺是著名的“坑王”如果src的長度小于n它會將src的所有字符包括\0復制過去然后用\0填充dest中剩余的空間直到寫滿n個字符。這常常導致性能浪費。如果src的長度大于或等于n它會精確地復制n個字符到dest并且不會在末尾添加\0這意味著dest可能不是一個有效的C字符串沒有終止符。這是最危險的一點很多程序員因為忘記手動添加\0而引入bug。strncpy最初的設(shè)計目的是用于固定長度的字段如Unix文件系統(tǒng)早期的目錄項而不是用來制作安全的字符串副本。用它來替代strcpy你必須非常小心char buf[10]; strncpy(buf, source, sizeof(buf) - 1); // 最多復制9個字符 buf[sizeof(buf) - 1] \0; // 手動確保終止符你必須手動添加\0并且n通常是緩沖區(qū)大小-1。7.3 更現(xiàn)代的方案snprintf對于簡單的字符串復制一個更安全、更直觀的選擇是使用snprintfchar buf[10]; snprintf(buf, sizeof(buf), %s, source);snprintf的第二個參數(shù)是目標緩沖區(qū)的大小函數(shù)會保證寫入的字符數(shù)不超過這個大小包括結(jié)尾的\0。如果源字符串太長它會被截斷但目標字符串始終是以\0結(jié)尾的有效字符串。這幾乎是我們想要的安全復制行為。雖然它比strcpy慢因為要解析格式字符串但在大多數(shù)場景下安全性的提升遠勝于微小的性能損失。7.4 平臺/編譯器提供的安全版本許多編譯器和運行庫提供了更安全的函數(shù)如Windows的strcpy_s或GCC/Clang通過_FORTIFY_SOURCE宏對strcpy等函數(shù)進行的加強編譯檢查。這些函數(shù)通常要求明確傳入目標緩沖區(qū)大小并在運行時檢查。例如// 示例并非所有環(huán)境都有 errno_t strcpy_s(char *dest, rsize_t dest_size, const char *src);使用這些函數(shù)可以增強安全性但會犧牲一定的可移植性。7.5 終極建議建立自己的安全字符串處理習慣明確緩沖區(qū)大小任何時候分配字符數(shù)組都要清楚它的大小。使用sizeof(buffer)而不是硬編碼數(shù)字。優(yōu)先使用帶長度限制的函數(shù)如snprintf,strlcpy某些系統(tǒng),strncpy但務必記得手動加\0。計算可用空間復制前動態(tài)計算目標緩沖區(qū)的剩余空間。徹底棄用strcpy/strcat在新項目中可以考慮通過代碼審查規(guī)則或靜態(tài)分析工具禁止直接使用這些危險函數(shù)。我們模擬strcpy是為了理解底層機制從而更深刻地認識到為什么這些安全準則如此重要。知其然亦知其所以然方能寫出既高效又安全的代碼。8. 舉一反三基于strcpy實現(xiàn)其他字符串函數(shù)掌握了strcpy的核心——指針遍歷和復制我們就可以輕松地實現(xiàn)C標準庫中的其他字符串函數(shù)。這就像學會了加減法乘除也就有了基礎(chǔ)。這里我們嘗試實現(xiàn)兩個最相關(guān)的函數(shù)strcat字符串連接和strcmp字符串比較。8.1 實現(xiàn)strcat先找到尾巴再接上新頭strcat(dest, src)的功能是將src字符串追加到dest字符串的末尾。它的內(nèi)部可以看作是兩個步驟找到dest字符串的結(jié)束符\0的位置。從這個位置開始執(zhí)行一次strcpy將src復制過來。char *my_strcat(char *dest, const char *src) { // 步驟1找到dest字符串的末尾 char *ptr dest; while (*ptr ! \0) { // 遍歷dest直到找到\0 ptr; } // 此時ptr指向dest末尾的\0 // 步驟2從ptr開始復制src字符串包括\0 while ((*ptr *src) ! \0) ; return dest; }看我們自己的my_strcpy的邏輯被完美復用了。第一個while循環(huán)是字符串遍歷第二個while循環(huán)就是strcpy的核心。這里同樣沒有檢查目標緩沖區(qū)是否足夠大它繼承了strcpy的“信任”哲學因此也有同樣的安全隱患。安全的版本需要調(diào)用者確保dest有足夠空間容納dest和src連接后的結(jié)果。8.2 實現(xiàn)strcmp逐字符比武定勝負strcmp(s1, s2)比較兩個字符串。它從第一個字符開始逐個比較對應位置的字符的ASCII值如果所有字符都相同直到遇到\0則返回0相等。如果發(fā)現(xiàn)不同的字符則返回*s1 - *s2第一個不匹配字符的差值。如果其中一個字符串先遇到\0而另一個還沒結(jié)束則較短的字符串被認為“更小”。int my_strcmp(const char *s1, const char *s2) { // 循環(huán)比較直到字符不同或遇到\0 while (*s1 ! \0 *s1 *s2) { s1; s2; } // 循環(huán)結(jié)束后有兩種可能 // 1. *s1 ! *s2 (包括*s2是\0的情況) // 2. *s1 *s2 \0 (兩字符串完全相等) // 無論是哪種返回差值都符合標準 return (*(unsigned char *)s1 - *(unsigned char *)s2); }注意一個關(guān)鍵細節(jié)類型轉(zhuǎn)換(unsigned char *)。為什么需要它因為strcmp比較的是字符的無符號值。在C語言中char類型可能是有符號的取值范圍-128到127也可能是無符號的這取決于編譯器和平臺。如果char是有符號的一個大于127的字符如某些擴展ASCII或UTF-8多字節(jié)序列的一部分會被當作負數(shù)。直接相減*s1 - *s2如果s1是負數(shù)而s2是正數(shù)結(jié)果可能不符合“字典序”比較的預期。轉(zhuǎn)換為unsigned char后所有字符值都在0-255之間比較就與平臺無關(guān)了。這是標準庫實現(xiàn)中的一個重要技巧我們的模擬也必須復現(xiàn)。8.3 觸類旁通通過這三個函數(shù)strcpy,strcat,strcmp的實現(xiàn)你會發(fā)現(xiàn)C語言字符串處理的模式非常統(tǒng)一基于指針的循環(huán)遍歷在\0處停止在循環(huán)體內(nèi)進行核心操作復制、比較等。基于這個模式你可以嘗試實現(xiàn)strlen遍歷字符串直到\0計數(shù)。strchr遍歷字符串尋找第一個匹配給定字符的位置。strstr在字符串中尋找子串稍復雜涉及嵌套循環(huán)。親手實現(xiàn)這些函數(shù)是理解指針和內(nèi)存操作最有效的練習。每一次實現(xiàn)都是對“指針即地址字符串即字符數(shù)組”這一核心概念的鞏固。當你不再懼怕手動操作指針去處理字符串時你對C語言的理解就上了一個堅實的臺階。