
服務監控Actuator Prometheus Grafana線上服務就像一輛行駛中的汽車——沒有儀表盤你不知道油量、不知道速度、不知道發動機溫度等真拋錨了才發現問題那就晚了。一、為什么需要監控線上服務跑著跑著突然卡了、內存滿了、響應慢了——如果沒監控你只能靠用戶投訴來發現問題。被動救火永遠慢半拍。監控的核心價值線上問題無感知→提前預警CPU飆到90%就告警而不是等服務掛了才知道性能瓶頸定位哪個接口慢慢在哪是GC停頓還是數據庫查詢容量規劃QPS趨勢分析什么時候該加機器、加多少數據說話故障復盤出問題后回溯監控曲線快速定位根因完整的監控體系分三層指標監控Metrics→日志收集Logging→鏈路追蹤Tracing即所謂的可觀測性三支柱。本文聚焦指標監控。二、SpringBoot ActuatorActuator是SpringBoot自帶的監控模塊提供了一系列HTTP端點開箱即用。2.1 引入依賴dependencygroupIdorg.springframework.boot/groupIdartifactIdspring-boot-starter-actuator/artifactId/dependency2.2 核心端點一覽端點路徑說明health/actuator/health應用健康狀態探活用info/actuator/info應用基本信息metrics/actuator/metrics各類指標數據loggers/actuator/loggers日志級別查看與動態修改env/actuator/env環境變量配置threaddump/actuator/threaddump線程轉儲信息heapdump/actuator/heapdump堆內存轉儲文件下載2.3 端點安全配置默認只暴露/health需要手動開啟其他端點的Web訪問management:endpoints:web:exposure:include:*# 暴露所有端點生產環境按需選擇exclude:env,beans# 排除敏感端點base-path:/actuator# 基礎路徑endpoint:health:show-details:always# 顯示健康詳情默認NEVER不顯示shutdown:enabled:false# 禁止遠程關機千萬別開訪問/actuator/health返回示例{status:UP,components:{db:{status:UP,details:{database:MySQL}},diskSpace:{status:UP,details:{total:500107862016,free:198656831488}},ping:{status:UP}}}三、Micrometer — 監控門面Actuator本身的指標格式不夠通用Micrometer作為監控門面類似SLF4J之于日志將指標數據適配為不同監控系統的格式。dependencygroupIdio.micrometer/groupIdartifactIdmicrometer-registry-prometheus/artifactId/dependency引入后訪問/actuator/prometheus即可看到Prometheus格式的指標文本# HELP jvm_memory_used_bytes The amount of used memory # TYPE jvm_memory_used_bytes gauge jvm_memory_used_bytes{areaheap,idG1 Eden Space} 2.5165824E7 jvm_memory_used_bytes{areaheap,idG1 Survivor Space} 1048576.0 # HELP http_server_requests_seconds HTTP請求耗時 # TYPE http_server_requests_seconds summary http_server_requests_seconds_count{methodGET,status200,uri/api/user/{id}} 1523 http_server_requests_seconds_sum{methodGET,status200,uri/api/user/{id}} 12.345四、Prometheus — 時序數據庫Prometheus是CNCF旗下的開源監控系統采用Pull模式主動從目標服務抓取指標數據。4.1 核心概念時序數據每個指標按時間戳存儲形成時間序列Pull模式Prometheus主動去拉取數據而非被推送PromQL專用查詢語言靈活聚合分析指標4.2 配置抓取目標# prometheus.ymlglobal:scrape_interval:15s# 每15秒抓取一次scrape_configs:-job_name:springboot-appmetrics_path:/actuator/prometheusstatic_configs:-targets:[localhost:8080]labels:application:my-appenv:dev4.3 常用PromQL查詢# HTTP請求QPS每秒請求數 rate(http_server_requests_seconds_count[1m]) # 接口平均響應時間 rate(http_server_requests_seconds_sum[1m]) / rate(http_server_requests_seconds_count[1m]) # JVM堆內存使用率 jvm_memory_used_bytes{areaheap} / jvm_memory_max_bytes{areaheap} * 100五、Grafana — 可視化儀表盤Grafana是一個開源的數據可視化平臺支持多種數據源配合Prometheus做指標展示再合適不過。5.1 配置流程添加數據源Settings → Data Sources → Add Prometheus填寫地址http://localhost:9090導入儀表盤Dashboards → Import輸入模板ID或上傳JSON常用模板ID4701— JVM Micrometer監控面板12900— SpringBoot 2.1 Statistics11378— Node Exporter服務器監控5.2 儀表盤核心面板一個完整的SpringBoot監控面板通常包含面板指標說明JVM內存heap/non-heap used/max堆/非堆內存使用情況JVM線程threads_live/daemon/peak活躍線程數GC統計gc_pause_secondsGC停頓時間和頻率HTTP請求QPS/響應時間/錯誤率接口性能指標CPU使用process_cpu_usage進程CPU占用六、監控指標分類6.1 JVM層面內存堆/非堆使用量、各內存區使用詳情線程活躍線程數、守護線程數、線程狀態分布GCGC次數、GC耗時、各代GC統計6.2 應用層面HTTP請求QPS、響應時間分布、錯誤率線程池活躍線程數、隊列積壓數、拒絕任務數數據庫連接池活躍連接數、等待線程數6.3 自定義業務指標通過Micrometer的MeterRegistry注冊自定義指標ComponentpublicclassOrderMetrics{privatefinalCounterorderCreateCounter;privatefinalCounterorderFailCounter;privatefinalGaugeorderPendingGauge;publicOrderMetrics(MeterRegistryregistry,OrderServiceorderService){// Counter只增不減的計數器this.orderCreateCounterCounter.builder(order.create.total).description(訂單創建總數).tag(type,all).register(registry);this.orderFailCounterCounter.builder(order.create.fail).description(訂單創建失敗數).register(registry);// Gauge瞬時值this.orderPendingGaugeGauge.builder(order.pending.count,()-orderService.getPendingCount()).description(待處理訂單數).register(registry);}publicvoidincrementCreate(){orderCreateCounter.increment();}publicvoidincrementFail(){orderFailCounter.increment();}}// Timer耗時統計ServicepublicclassPaymentService{AutowiredprivateMeterRegistryregistry;publicvoidpay(Orderorder){Timer.SamplesampleTimer.start(registry);try{// 支付邏輯doPay(order);}finally{sample.stop(Timer.builder(payment.duration).description(支付耗時).tag(channel,order.getChannel()).register(registry));}}}三種核心指標類型類型說明場景Counter只增不減請求總數、錯誤總數Gauge可增可減的瞬時值隊列長度、內存使用量Timer耗時統計接口響應時間、方法執行時間七、完整搭建流程1. SpringBoot應用引入actuator micrometer-prometheus 2. 配置management.endpoints暴露prometheus端點 3. 啟動Prometheus配置scrape_configs抓取應用指標 4. 啟動Grafana添加Prometheus數據源 5. 導入JVM儀表盤模板ID: 4701 6. 創建自定義業務監控面板 7. 配置告警規則Alertmanager告警規則示例# alert_rules.ymlgroups:-name:springboot-alertsrules:-alert:HighErrorRateexpr:rate(http_server_requests_seconds_count{status~5..}[5m])0.1for:2mlabels:severity:criticalannotations:summary:接口錯誤率過高description:{{ $labels.uri }} 5xx錯誤率超過10%-alert:HighMemoryUsageexpr:jvm_memory_used_bytes{areaheap}/ jvm_memory_max_bytes{areaheap}0.85for:5mlabels:severity:warningannotations:summary:JVM堆內存使用率超過85%Actuator采集指標Prometheus存儲和查詢Grafana展示和告警——三件套配合起來線上服務的健康狀況就盡在掌握了。這套監控體系不需要寫復雜的代碼主要是配置工作但帶來的運維價值是巨大的。