試優(yōu)化到混合編程實(shí)戰(zhàn))
1. 項(xiàng)目概述為什么在STM32時(shí)代還要啃匯編“都202X年了STM32用C語言開發(fā)不香嗎為什么還要去碰晦澀難懂的匯編指令” 這恐怕是很多剛接觸STM32甚至一些有經(jīng)驗(yàn)的嵌入式開發(fā)者看到這個(gè)標(biāo)題時(shí)的第一反應(yīng)。我剛開始接觸單片機(jī)時(shí)也這么想直到后來在調(diào)試一個(gè)電機(jī)驅(qū)動(dòng)的死區(qū)時(shí)間問題時(shí)C語言層面的調(diào)試信息一切正常但電機(jī)就是有異常的嘯叫聲。最后在萬般無奈下打開了反匯編窗口一行一行地對(duì)照機(jī)器碼才發(fā)現(xiàn)編譯器在優(yōu)化某個(gè)臨界循環(huán)時(shí)偷偷“挪動(dòng)”了兩條指令的順序?qū)е乱粋€(gè)關(guān)鍵寄存器的寫入時(shí)機(jī)比預(yù)期早了半個(gè)時(shí)鐘周期。就是這幾十納秒的偏差讓整個(gè)控制環(huán)路出現(xiàn)了微小的相位錯(cuò)誤。從那一刻起我徹底明白了匯編不是用來寫整個(gè)項(xiàng)目的而是用來“看懂”和“控制”底層究竟發(fā)生了什么的“透視鏡”和“手術(shù)刀”。對(duì)于STM32單片機(jī)尤其是基于ARM Cortex-M內(nèi)核的系列其匯編指令集ARM/Thumb指令集是我們與芯片硬件直接對(duì)話的“方言”。學(xué)習(xí)它絕不是為了炫技或回到“刀耕火種”的編程時(shí)代而是為了達(dá)成幾個(gè)非常實(shí)際的目標(biāo)第一深度調(diào)試。當(dāng)程序跑飛、HardFault硬件錯(cuò)誤發(fā)生時(shí)查看調(diào)用棧和反匯編代碼是定位根因的唯一途徑。第二極致優(yōu)化。在對(duì)時(shí)序要求苛刻的場(chǎng)合如高速ADC采樣、精確PWM生成、軟件模擬特定協(xié)議用內(nèi)聯(lián)匯編或純匯編編寫核心片段可以消除編譯器優(yōu)化的不確定性確保指令執(zhí)行周期絕對(duì)可控。第三理解本質(zhì)。通過匯編你能真正理解“變量”是如何變成“寄存器”和“內(nèi)存訪問”的“函數(shù)調(diào)用”背后是怎樣的入棧出棧操作“中斷”又是如何打斷和恢復(fù)現(xiàn)場(chǎng)。這種理解能讓你在架構(gòu)設(shè)計(jì)時(shí)做出更明智的決策。所以無論你是正在學(xué)習(xí)STM32的學(xué)生還是希望技術(shù)深度更進(jìn)一步的工程師花點(diǎn)時(shí)間了解其匯編指令都是一筆穩(wěn)賺不賠的投資。它不會(huì)讓你立刻成為高手但會(huì)給你一雙看透代碼底層運(yùn)行的眼睛。接下來我將從一個(gè)實(shí)際從業(yè)者的角度帶你拆解STM32以最常見的Cortex-M3/M4為例匯編指令的核心要點(diǎn)、實(shí)操場(chǎng)景以及那些手冊(cè)里不會(huì)寫的“坑”。2. 核心概念與開發(fā)環(huán)境搭建在動(dòng)手寫或看任何一行匯編之前我們必須先統(tǒng)一“戰(zhàn)場(chǎng)”和“語言”。STM32采用的ARM Cortex-M內(nèi)核主要使用兩種指令集Thumb指令集和Thumb-2指令集。對(duì)于STM32F1Cortex-M3及之后的M4、M7等我們打交道的基本都是Thumb-2指令集。它是Thumb指令集的增強(qiáng)版混合了16位和32位指令在保持高代碼密度節(jié)省Flash空間的同時(shí)又能實(shí)現(xiàn)接近32位ARM指令集的性能。這是理解STM32匯編的第一個(gè)關(guān)鍵點(diǎn)你看到的指令長(zhǎng)度可能不統(tǒng)一。2.1 開發(fā)與查看匯編代碼的環(huán)境你并不需要一個(gè)專門的“匯編開發(fā)環(huán)境”。我們主要在兩個(gè)場(chǎng)景下與匯編互動(dòng)查看與分析主要場(chǎng)景在MDK-Keil、IAR或STM32CubeIDE基于GCC等集成開發(fā)環(huán)境IDE中都有強(qiáng)大的反匯編功能。在調(diào)試模式下你可以輕松地在C源代碼、匯編代碼和內(nèi)存/寄存器視圖之間切換。編寫與嵌入特定場(chǎng)景在C語言工程中使用內(nèi)聯(lián)匯編Inline Assembly或單獨(dú)的匯編文件.s文件來編寫關(guān)鍵函數(shù)。環(huán)境搭建的核心是配置好一個(gè)你熟悉的IDE的調(diào)試器。以STM32CubeIDE免費(fèi)且官方推薦為例在成功編譯一個(gè)C語言工程例如一個(gè)點(diǎn)燈程序后進(jìn)入調(diào)試模式Debug Perspective。在這里你可以找到“Disassembly”窗口它實(shí)時(shí)顯示當(dāng)前PC程序計(jì)數(shù)器指向的地址所對(duì)應(yīng)的匯編指令。旁邊通常還有“Registers”窗口顯示所有核心寄存器的值“Memory”窗口查看任意內(nèi)存地址的數(shù)據(jù)。這三個(gè)窗口就是我們的“匯編調(diào)試三板斧”。注意不同編譯器ARMCC、GCC、IAR生成的匯編助記符可能略有差異。例如GCC匯編中注釋用或/* */而ARMCC可能用;。本文將以GCC風(fēng)格為主進(jìn)行講解因?yàn)檫@是開源和跨平臺(tái)的大趨勢(shì)但核心指令是相同的。2.2 ARM Cortex-M核心寄存器精講如果說匯編指令是“動(dòng)詞”那么寄存器就是“名詞”或“賓語”。Cortex-M內(nèi)核有一套固定的寄存器組理解它們是讀懂匯編的前提。下表是其中最核心的部分寄存器別名主要用途在C/匯編中的重要性R0-R7低寄存器通用數(shù)據(jù)存儲(chǔ)、函數(shù)參數(shù)傳遞R0-R3、臨時(shí)計(jì)算。最常用所有指令均可訪問。R8-R12高寄存器通用數(shù)據(jù)存儲(chǔ)、函數(shù)調(diào)用時(shí)的臨時(shí)變量需被調(diào)用者保存。部分Thumb指令無法訪問需注意。R13SP(Stack Pointer)棧指針。M內(nèi)核有兩個(gè)SPMSP主棧指針用于異常和PSP進(jìn)程棧指針用于任務(wù)。生命線任何函數(shù)調(diào)用、局部變量、中斷都依賴它。錯(cuò)誤操作直接導(dǎo)致崩潰。R14LR(Link Register)鏈接寄存器。保存函數(shù)調(diào)用的返回地址。函數(shù)調(diào)用和返回的核心。BL指令自動(dòng)填充LR。R15PC(Program Counter)程序計(jì)數(shù)器。指向下一條要執(zhí)行的指令地址。直接修改PC可以實(shí)現(xiàn)絕對(duì)跳轉(zhuǎn)類似C的goto到函數(shù)指針。xPSR程序狀態(tài)寄存器包含APSR標(biāo)志位、IPSR異常號(hào)、EPSR執(zhí)行狀態(tài)。N, Z, C, V標(biāo)志位是條件執(zhí)行如循環(huán)、判斷的基石。實(shí)操心得1關(guān)于SP棧指針的“坑”在系統(tǒng)啟動(dòng)文件如startup_stm32fxxx.s中第一件事就是初始化SP。這個(gè)值來源于鏈接腳本中定義的堆棧頂部地址。絕對(duì)不要在應(yīng)用程序中隨意修改SP的值除非你在進(jìn)行非常底層的操作系統(tǒng)上下文切換。我曾見過有新手在匯編函數(shù)里為了“騰地方”而手動(dòng)調(diào)整SP結(jié)果函數(shù)返回時(shí)地址錯(cuò)亂直接進(jìn)入HardFault。記住棧操作入棧PUSH出棧POP是修改SP的唯一安全方式。實(shí)操心得2LR的微妙之處當(dāng)使用BL帶鏈接的跳轉(zhuǎn)即函數(shù)調(diào)用指令時(shí)CPU會(huì)自動(dòng)將返回地址PC4或PC2等存入LR。但在中斷服務(wù)程序ISR中硬件會(huì)自動(dòng)將一組寄存器包括PC和LR壓棧并將LR更新為一個(gè)特殊的EXC_RETURN值用于標(biāo)識(shí)返回模式和使用的棧指針。如果你在ISR中又用BL調(diào)用了另一個(gè)函數(shù)那么原始的EXC_RETURN值會(huì)被覆蓋導(dǎo)致無法正確退出中斷。這就是為什么在中斷處理函數(shù)中要盡量避免多層函數(shù)調(diào)用或者需要非常小心地處理LR。3. 指令集精講與實(shí)戰(zhàn)拆解ARM Thumb-2指令集看似龐大但用于理解和編寫關(guān)鍵代碼的核心指令可以歸納為幾類。我們結(jié)合實(shí)例來講解而不是羅列手冊(cè)。3.1 數(shù)據(jù)傳輸指令數(shù)據(jù)的搬運(yùn)工這是最基礎(chǔ)的指令負(fù)責(zé)在寄存器與寄存器、寄存器與內(nèi)存之間移動(dòng)數(shù)據(jù)。MOVMove寄存器間或立即數(shù)到寄存器的移動(dòng)。MOVS R0, #0x55 將立即數(shù)0x55送入R0并更新標(biāo)志位S后綴。注意Thumb指令中MOV能使用的立即數(shù)有限制。 MOV R1, R0 將R0的值復(fù)制到R1。注意MOV不能直接訪問內(nèi)存。給寄存器賦一個(gè)大的常數(shù)如0x12345678通常編譯器會(huì)使用LDR指令從文字池加載來實(shí)現(xiàn)而不是MOV。LDR/STRLoad/Store內(nèi)存訪問的絕對(duì)核心。格式為L(zhǎng)DR Rd, [Rn, #offset]或STR Rd, [Rn, #offset]。LDR R0, [R1] 從R1寄存器值作為地址的內(nèi)存中加載一個(gè)字32位到R0。 STR R2, [R3, #4] 將R2的值存儲(chǔ)到R3值加4作為地址的內(nèi)存中。 LDRB R0, [R1] 加載一個(gè)字節(jié)8位到R0高24位補(bǔ)零。 STRH R2, [R3, #-8] 將R2的低16位半字存儲(chǔ)到R3值減8作為地址的內(nèi)存中。這里有一個(gè)關(guān)鍵細(xì)節(jié)尋址模式。[Rn]基址尋址。[Rn, #offset]基址加偏移。偏移可以是正負(fù)且在某些模式下偏移可以是另一個(gè)寄存器Rm。[Rn, #offset]!前變址尋址。先更新Rn為Rnoffset再用新地址存取。!表示回寫。[Rn], #offset后變址尋址。先用Rn地址存取再更新Rn為Rnoffset。 后兩種在循環(huán)處理數(shù)組或緩沖區(qū)時(shí)極其高效。例如用C語言寫for(i0; i10; i) buf[i]0;優(yōu)化后的匯編很可能就是用R0指向buf然后循環(huán)STR R1, [R0], #4。實(shí)戰(zhàn)拆解1一個(gè)簡(jiǎn)單的變量賦值與訪問看一段C代碼及其可能生成的匯編// C代碼 int a 100; int b a 5; 假設(shè)a的地址被分配在某個(gè)靜態(tài)存儲(chǔ)區(qū) LDR R0, a 這不是一條真實(shí)指令是偽指令。編譯器會(huì)將其轉(zhuǎn)換為PC相關(guān)的LDR指令將a的地址加載到R0。 MOVS R1, #100 將立即數(shù)100放入R1 STR R1, [R0] 將R1的值100存儲(chǔ)到R0指向的地址即變量a LDR R2, [R0] 再次從a的地址加載值到R2此時(shí)R2100 ADDS R2, R2, #5 R2 R2 5 LDR R3, b 獲取b的地址到R3 STR R2, [R3] 將計(jì)算結(jié)果105存儲(chǔ)到b從這個(gè)簡(jiǎn)單的例子可以看到即使是局部變量如果優(yōu)化等級(jí)低可能放在棧里其本質(zhì)也是通過LDR/STR配合SP進(jìn)行內(nèi)存訪問。3.2 算術(shù)與邏輯指令CPU的算盤ADD/SUB/ADC/SBC加減法。ADC帶進(jìn)位加和SBC帶借位減用于多精度如64位計(jì)算。ADDS R0, R1, R2 R0 R1 R2并更新標(biāo)志位S后綴。 SUBS R0, R0, #1 R0 R0 - 1并更新標(biāo)志位。常用作循環(huán)計(jì)數(shù)器遞減。AND/ORR/EOR/BIC按位與、或、異或、位清除BIC Rd, Rn, Rm即Rd Rn (~Rm)。AND R0, R0, #0xFF 將R0的高24位清零保留低8位。這是掩碼操作。 ORR R1, R1, #(13) 將R1的第3位置1常用于設(shè)置寄存器特定位。 BIC R2, R2, #(15) 將R2的第5位清零常用于清除寄存器特定位。在操作STM32外設(shè)寄存器如GPIO的ODR、IDR時(shí)這種“讀-改-寫”模式非常常見但要注意原子性問題。在中斷可能打斷的場(chǎng)合簡(jiǎn)單的LDR-AND/ORR-STR序列可能導(dǎo)致錯(cuò)誤此時(shí)需要關(guān)中斷或使用位帶別名區(qū)Bit-Banding操作。3.3 移位與循環(huán)指令數(shù)據(jù)的整形師LSL/LSR/ASR/ROR邏輯左移、邏輯右移、算術(shù)右移、循環(huán)右移。移位操作不僅用于乘除2的冪次更是數(shù)據(jù)打包、解包、位域提取的核心。LSLS R0, R1, #2 R0 R1 2 (相當(dāng)于 R1 * 4) ASR R2, R3, #31 將R3算術(shù)右移31位。如果R3是有符號(hào)數(shù)結(jié)果是-1負(fù)數(shù)或0正數(shù)常用于求符號(hào)位。一個(gè)經(jīng)典應(yīng)用從32位數(shù)據(jù)中提取多個(gè)位域。例如一個(gè)32位狀態(tài)寄存器第[15:8]位是錯(cuò)誤碼A第[5:3]位是狀態(tài)B。LDR R0, [R1] 加載狀態(tài)寄存器值到R0 UBFX R2, R0, #8, #8 無符號(hào)位域提取從R0的第8位開始提取8位到R2即錯(cuò)誤碼A。這是Thumb-2的高效指令。 UBFX R3, R0, #3, #3 從第3位開始提取3位到R3即狀態(tài)B。 如果沒有UBFX你可能需要LSR R2, R0, #8; AND R2, R2, #0xFF3.4 比較與分支指令程序流程的舵手這是實(shí)現(xiàn)if、for、while等控制邏輯的基礎(chǔ)。CMPCompare比較兩個(gè)數(shù)本質(zhì)是做減法并更新標(biāo)志位但不保存結(jié)果。CMP R0, #10 計(jì)算 R0 - 10更新N,Z,C,V標(biāo)志。之后可以根據(jù)標(biāo)志位進(jìn)行條件分支。條件后綴與分支指令B是分支跳轉(zhuǎn)可以加上條件后綴如EQ相等、NE不等、GT大于、LT小于等。CMP R0, #0 BEQ label_zero 如果 R0 0 (Z flag 1)跳轉(zhuǎn)到label_zero BGT label_positive 如果 R0 0跳轉(zhuǎn) BLT label_negative 如果 R0 0跳轉(zhuǎn)無條件跳轉(zhuǎn)與函數(shù)調(diào)用B label無條件跳轉(zhuǎn)類似C的goto。BL label帶鏈接的跳轉(zhuǎn)這是函數(shù)調(diào)用的核心。它先將下一條指令的地址返回地址存入LR寄存器然后跳轉(zhuǎn)到label。被調(diào)函數(shù)通過BX LR或MOV PC, LR返回。BX Rm跳轉(zhuǎn)到Rm寄存器指定的地址并可根據(jù)地址最低位切換指令集狀態(tài)ARM/Thumb。BX LR就是最常見的函數(shù)返回方式。實(shí)戰(zhàn)拆解2一個(gè)for循環(huán)的匯編真面目// C代碼 for(int i0; i10; i) { sum i; } 假設(shè) sum 在 R0 i 在 R1 MOVS R0, #0 sum 0 MOVS R1, #0 i 0 loop_start: CMP R1, #10 比較 i 和 10 BGE loop_end 如果 i 10跳轉(zhuǎn)到循環(huán)結(jié)束 ADDS R0, R0, R1 sum i ADDS R1, R1, #1 i B loop_start 無條件跳回循環(huán)開始 loop_end: ... 循環(huán)結(jié)束后的代碼在開啟較高優(yōu)化等級(jí)如-O2后編譯器可能會(huì)進(jìn)行循環(huán)展開、強(qiáng)度削弱等優(yōu)化生成的匯編可能和這個(gè)簡(jiǎn)單的版本大相徑庭但基本邏輯不變。4. 函數(shù)調(diào)用與棧幀深度解析這是理解程序運(yùn)行和調(diào)試復(fù)雜問題的關(guān)鍵。一個(gè)標(biāo)準(zhǔn)的函數(shù)調(diào)用Calling ConventionAAPCS for ARM過程是怎樣的調(diào)用者Caller的責(zé)任將前4個(gè)參數(shù)如果有放入R0-R3寄存器。更多參數(shù)則通過棧傳遞。使用BL function_name指令調(diào)用函數(shù)。此時(shí)返回地址被自動(dòng)存入LR。被調(diào)用者Callee即函數(shù)本身的責(zé)任序言 Prologue保護(hù)現(xiàn)場(chǎng)將需要保存的寄存器通常是R4-R11以及LR如果本函數(shù)還會(huì)調(diào)用其他函數(shù)壓入棧中。常見指令是PUSH {R4-R6, LR}。分配棧空間如果局部變量較多或者需要傳遞大量參數(shù)給更深層的函數(shù)會(huì)調(diào)整SP指針來分配棧空間如SUB SP, SP, #16分配16字節(jié)。執(zhí)行函數(shù)體。恢復(fù)現(xiàn)場(chǎng)與返回尾聲 Epilogue釋放棧空間如果有將之前保存的寄存器從棧中彈出最后用BX LR或POP {R4-R6, PC}直接將返回地址彈入PC同時(shí)恢復(fù)R4-R6返回。一個(gè)具體的棧幀Stack Frame示例假設(shè)函數(shù)func有一個(gè)局部變量數(shù)組int arr[3]并調(diào)用了另一個(gè)函數(shù)helper。func: PUSH {R4, LR} 保存R4和LR。因?yàn)閒unc要用R4且會(huì)調(diào)用helperLR會(huì)被覆蓋。 SUB SP, SP, #12 為局部數(shù)組arr[3]3*412字節(jié)在棧上分配空間。 ... 函數(shù)體可能會(huì)使用[SP, #0], [SP, #4], [SP, #8]來訪問arr[0], arr[1], arr[2] MOV R0, SP 將arr的地址作為參數(shù)傳給helper假設(shè)是第一個(gè)參數(shù) BL helper 調(diào)用helperLR被更新為helper的返回地址 ... ADD SP, SP, #12 釋放局部變量占用的棧空間 POP {R4, PC} 恢復(fù)R4并將之前保存的LR即func的返回地址彈入PC實(shí)現(xiàn)返回。在調(diào)試HardFault時(shí)查看SP指向的棧內(nèi)存并理解這些壓棧的數(shù)據(jù)結(jié)構(gòu)是回溯調(diào)用鏈的唯一方法。MDK和IAR的調(diào)試器有“Call Stack Locals”窗口其原理就是解析這個(gè)棧幀信息。實(shí)操心得3HardFault調(diào)試的“三板斧”當(dāng)程序陷入HardFault首先別慌按以下步驟停住調(diào)試器查看PC和LR寄存器。此時(shí)的LR保存了一個(gè)特殊的EXC_RETURN值可以告訴你進(jìn)入異常前是用的MSP還是PSP以及返回的處理器模式。查看SCB-CFSR可配置故障狀態(tài)寄存器。這個(gè)寄存器會(huì)告訴你具體是什么故障是訪問非法地址IMPRECISERR或PRECISERR還是未對(duì)齊訪問UNALIGNED或者是除零DIVBYZERO某些M4/M7支持。回溯棧幀。找到當(dāng)前的SP在Memory窗口中查看其附近的內(nèi)存。根據(jù)AAPCS規(guī)則棧里應(yīng)該依次是R0-R3, R12, LR, PC, xPSR在異常進(jìn)入時(shí)硬件自動(dòng)壓棧的。找到這個(gè)被硬件保存的PC它就是導(dǎo)致故障的指令地址。去Disassembly窗口查看這個(gè)地址附近的代碼結(jié)合C源代碼基本就能定位問題。常見原因空指針解引用、數(shù)組越界、棧溢出遞歸太深或局部變量太大。5. 內(nèi)聯(lián)匯編與混合編程實(shí)戰(zhàn)我們很少寫純匯編文件更多的是在C代碼中嵌入?yún)R編片段以實(shí)現(xiàn)極致優(yōu)化或操作特殊指令。5.1 GCC內(nèi)聯(lián)匯編基礎(chǔ)語法GCC內(nèi)聯(lián)匯編的通用模板如下asm volatile ( 匯編指令模板 : 輸出操作數(shù)列表 /* 將匯編結(jié)果輸出到C變量 */ : 輸入操作數(shù)列表 /* 將C變量作為輸入傳給匯編 */ : 破壞列表 /* 告訴編譯器哪些寄存器或內(nèi)存被修改了 */ );volatile告訴編譯器不要優(yōu)化這段匯編必須原樣保留。操作數(shù)約束用r表示寄存器m表示內(nèi)存i表示立即數(shù)等。表示可讀可寫表示早期破壞輸出操作數(shù)在指令早期就被修改不能與輸入共用寄存器。實(shí)例1開關(guān)全局中斷// 使用內(nèi)聯(lián)匯編實(shí)現(xiàn)開關(guān)總中斷以Cortex-M為例操作PRIMASK寄存器 void disable_irq(void) { __asm volatile (cpsid i : : : memory); // cpsid i 是關(guān)閉所有可屏蔽中斷的指令 // memory 破壞告訴編譯器內(nèi)存可能被更改防止編譯器進(jìn)行不安全的優(yōu)化重排 } void enable_irq(void) { __asm volatile (cpsie i : : : memory); }實(shí)例2精確延時(shí)循環(huán)當(dāng)需要納秒或微秒級(jí)的極短延時(shí)時(shí)用C循環(huán)受編譯器優(yōu)化影響大用匯編可以精確控制周期。void delay_cycles(uint32_t cycles) { // 假設(shè)一個(gè)循環(huán)體大約消耗3個(gè)周期SUBCBNZB __asm volatile ( 1: \n // 本地標(biāo)簽 subs %0, %0, #1 \n // %0 代表第一個(gè)操作數(shù)即cycles變量 cycles cycles - 1 bne 1b \n // 如果結(jié)果不為零Z flag 0跳回標(biāo)簽1b表示向后跳 : r (cycles) // 輸入輸出操作數(shù)r表示既是輸入又是輸出的寄存器變量 : // 無純輸入 : cc // 破壞條件碼寄存器即APSR ); } // 調(diào)用 delay_cycles(SystemCoreClock/1000000); 大約延時(shí)1微秒需根據(jù)實(shí)際指令周期校準(zhǔn)5.2 單獨(dú)匯編文件的使用對(duì)于更復(fù)雜或更長(zhǎng)的匯編函數(shù)可以創(chuàng)建單獨(dú)的.s文件。在STM32CubeIDE或Keil工程中直接添加即可。文件開頭需要用.syntax unified聲明使用統(tǒng)一的匯編語法然后用.global導(dǎo)出函數(shù)名用.type指定函數(shù)類型。示例一個(gè)用匯編優(yōu)化的內(nèi)存塊填充函數(shù)類似memset File: fast_memset.s .syntax unified .cpu cortex-m4 .thumb .global fast_memset .type fast_memset, %function 函數(shù)原型void fast_memset(void *s, uint32_t c, size_t n); R0: s (目標(biāo)地址), R1: c (填充值), R2: n (字節(jié)數(shù)) fast_memset: PUSH {R4} 保存R4 ANDS R1, R1, #0xFF 確保填充值只在低8位memset標(biāo)準(zhǔn)行為 ORR R1, R1, R1, LSL #8 將字節(jié)復(fù)制到16位 ORR R1, R1, R1, LSL #16 將16位復(fù)制到32位現(xiàn)在R1是4個(gè)相同的字節(jié) MOV R3, R0 保存起始地址 MOVS R4, #3 ANDS R4, R4, R0 R4 地址的低2位對(duì)齊檢查 BEQ aligned_loop 如果已經(jīng)對(duì)齊跳轉(zhuǎn) unaligned_head: 處理開頭未對(duì)齊的字節(jié) CMP R2, #0 ITT NE STRBNE R1, [R0], #1 存儲(chǔ)一個(gè)字節(jié)地址1 SUBNE R2, R2, #1 計(jì)數(shù)-1 ADDNE R4, R4, #-1 對(duì)齊計(jì)數(shù)器-1 CMPNE R4, #0 BNE unaligned_head aligned_loop: CMP R2, #4 BCC trailing_bytes 如果剩余字節(jié)數(shù)4跳去處理尾部 STR R1, [R0], #4 以字32位為單位存儲(chǔ)效率更高 SUBS R2, R2, #4 B aligned_loop trailing_bytes: 處理尾部不足4字節(jié)的部分 CMP R2, #0 BEQ memset_end STRB R1, [R0], #1 SUBS R2, R2, #1 B trailing_bytes memset_end: POP {R4} BX LR這個(gè)函數(shù)展示了匯編如何優(yōu)化內(nèi)存操作處理非對(duì)齊起始地址、使用32位存儲(chǔ)提高吞吐量。在C代碼中只需聲明extern void fast_memset(void *, uint32_t, size_t);即可調(diào)用。6. 常見問題排查與高級(jí)調(diào)試技巧掌握了基本指令和概念后我們來看看那些讓人頭疼的匯編級(jí)問題。6.1 鏈接腳本與啟動(dòng)文件一切開始的源頭很多底層問題尤其是關(guān)于內(nèi)存和初始化的根源在鏈接腳本.ld文件和啟動(dòng)文件.s。鏈接腳本定義了Flash和RAM的布局代碼.text放哪里已初始化數(shù)據(jù).data放哪里未初始化數(shù)據(jù).bss放哪里堆棧_stack_top又在哪里。啟動(dòng)文件則是芯片上電后執(zhí)行的第一段代碼匯編它負(fù)責(zé)初始化棧指針SP。將.data段從Flash復(fù)制到RAM因?yàn)槿肿兞砍踔荡嬖贔lash運(yùn)行時(shí)要搬到RAM。將.bss段清零。調(diào)用SystemInit函數(shù)初始化時(shí)鐘。跳轉(zhuǎn)到main函數(shù)。一個(gè)典型問題全局變量值不對(duì)或?yàn)?。可能原因啟動(dòng)文件中的復(fù)制循環(huán)CopyDataInit或清零循環(huán)ZeroBss沒有正確執(zhí)行。檢查鏈接腳本中_sdata,_edata,_sbss,_ebss這些符號(hào)的地址是否正確以及啟動(dòng)文件中的循環(huán)邏輯。有時(shí)優(yōu)化等級(jí)過高如果這些變量沒有被顯式使用編譯器可能會(huì)認(rèn)為它們無用而優(yōu)化掉對(duì)它們的訪問導(dǎo)致你以為初始化失敗了其實(shí)可能是C代碼優(yōu)化問題。用volatile修飾或關(guān)閉優(yōu)化測(cè)試。6.2 中斷服務(wù)程序ISR的匯編視角中斷是異步事件其入口和出口由硬件嚴(yán)格定義。以Cortex-M的NVIC嵌套向量中斷控制器為例當(dāng)一個(gè)中斷發(fā)生時(shí)硬件自動(dòng)將xPSR, PC, LR, R12, R3, R2, R1, R0依次壓入當(dāng)前使用的棧MSP或PSP。硬件將LR設(shè)置為特殊的EXC_RETURN值如0xFFFFFFF9。從中斷向量表位于Flash起始位置加載新的PC值跳轉(zhuǎn)到ISR。在ISR中你寫的C語言ISR函數(shù)編譯器會(huì)自動(dòng)為其生成匯編序言和尾聲處理寄存器保存。關(guān)鍵點(diǎn)ISR函數(shù)必須用__attribute__((interrupt))修飾GCC或使用特定的關(guān)鍵字如Keil的__irq以確保編譯器生成正確的返回指令BX LR而LR是EXC_RETURN從而觸發(fā)硬件異常返回序列恢復(fù)之前壓棧的上下文。常見錯(cuò)誤在ISR中調(diào)用了一個(gè)大量使用棧的庫函數(shù)如printf導(dǎo)致棧溢出。因?yàn)镮SR通常使用MSP而主程序可能使用PSP但棧空間是共享的。需要仔細(xì)規(guī)劃棧大小。6.3 性能分析與指令周期在優(yōu)化核心算法時(shí)你需要知道關(guān)鍵指令的執(zhí)行周期。Cortex-M內(nèi)核通常有1-3級(jí)流水線大多數(shù)16位Thumb指令是單周期32位Thumb-2指令可能是單周期或多周期。具體需要查閱對(duì)應(yīng)內(nèi)核的《Technical Reference Manual (TRM)》。例如Cortex-M4的UDIV無符號(hào)除法指令可能需要2-12個(gè)周期遠(yuǎn)多于加法指令。因此在循環(huán)中將除法移出、用移位代替乘除2的冪次是常見的優(yōu)化手段。使用調(diào)試器的性能分析器Profiler或指令跟蹤ETM/ITM功能可以更直觀地看到熱點(diǎn)代碼和指令執(zhí)行流。對(duì)于沒有硬件跟蹤單元的芯片可以手動(dòng)在關(guān)鍵代碼段前后讀取SysTick或Cycle CounterDWT-CYCCNT寄存器來測(cè)量周期數(shù)。最后的小技巧讀懂編譯器生成的匯編在IDE中有一個(gè)功能叫“生成匯編列表文件”Generate Assembly Listing。以GCC為例編譯時(shí)加上-S選項(xiàng)會(huì)生成.s文件里面是C代碼和生成的匯編指令的混合列表。這是學(xué)習(xí)編譯器如何將高級(jí)語言翻譯成機(jī)器指令的絕佳材料。你可以嘗試用不同的優(yōu)化等級(jí)-O0,-O1,-O2,-Os編譯同一段代碼對(duì)比生成的匯編你會(huì)對(duì)編譯器的優(yōu)化策略有更深的理解比如循環(huán)展開、指令重排、冗余代碼消除等。這能讓你在寫C代碼時(shí)潛意識(shí)里就知道編譯器可能會(huì)怎么做從而寫出對(duì)編譯器更友好的高效代碼。這才是學(xué)習(xí)匯編的終極目的——不是為了寫它而是為了理解它從而更好地駕馭C語言和編譯器寫出真正高效、可靠的嵌入式代碼。