0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

Linux系統(tǒng)CPU 100%打滿了!

dyquk4xk2p3d ? 來源:良許Linux ? 2023-04-04 09:42 ? 次閱讀

昨天下午突然收到運維郵件報警,顯示數據平臺服務器cpu利用率達到了98.94%,而且最近一段時間一直持續(xù)在70%以上,看起來像是硬件資源到瓶頸需要擴容了,但仔細思考就會發(fā)現咱們的業(yè)務系統(tǒng)并不是一個高并發(fā)或者CPU密集型的應用,這個利用率有點太夸張,硬件瓶頸應該不會這么快就到了,一定是哪里的業(yè)務代碼邏輯有問題。

2、排查思路

2.1定位高負載進程pid

首先登錄到服務器使用top命令確認服務器的具體情況,根據具體情況再進行分析判斷。

c3ec84fe-d278-11ed-bfe3-dac502259ad0.png

通過觀察load average,以及負載評判標準(8核),可以確認服務器存在負載較高的情況;

c3fa4c06-d278-11ed-bfe3-dac502259ad0.jpg

觀察各個進程資源使用情況,可以看出進程id為682的進程,有著較高的CPU占比

2.2定位具體的異常業(yè)務

這里咱們可以使用 pwdx 命令根據 pid 找到業(yè)務進程路徑,進而定位到負責人和項目:

c40b800c-d278-11ed-bfe3-dac502259ad0.jpg

可得出結論:該進程對應的就是數據平臺的web服務。

2.3定位異常線程及具體代碼行

傳統(tǒng)的方案一般是4步:

1、top oder by with P:1040 // 首先按進程負載排序找到 maxLoad(pid)

2、top -Hp 進程PID:1073 // 找到相關負載 線程PID

3、printf “0x%x ”線程PID:0x431 // 將線程PID轉換為 16進制,為后面查找 jstack 日志做準備

4、jstack 進程PID | vim +/十六進制線程PID - // 例如:jstack 1040|vim +/0x431 -

但是對于線上問題定位來說,分秒必爭,上面的 4 步還是太繁瑣耗時了,之前介紹過淘寶的oldratlee 同學就將上面的流程封裝為了一個工具:show-busy-java-threads.sh,可以很方便的定位線上的這類問題:

c41cfcc4-d278-11ed-bfe3-dac502259ad0.jpg

可得出結論:是系統(tǒng)中一個時間工具類方法的執(zhí)行cpu占比較高,定位到具體方法后,查看代碼邏輯是否存在性能問題。

※如果線上問題比較緊急,可以省略 2.1、2.2 直接執(zhí)行 2.3,這里從多角度剖析只是為了給大家呈現一個完整的分析思路。

3、根因分析

經過前面的分析與排查,最終定位到一個時間工具類的問題,造成了服務器負載以及cpu使用率的過高。

異常方法邏輯:是把時間戳轉成對應的具體的日期時間格式;

上層調用:計算當天凌晨至當前時間所有秒數,轉化成對應的格式放入到set中返回結果;

邏輯層:對應的是數據平臺實時報表的查詢邏輯,實時報表會按照固定的時間間隔來,并且在一次查詢中有多次(n次)方法調用。

那么可以得到結論,如果現在時間是當天上午10點,一次查詢的計算次數就是 10*60*60*n次=36,000*n次計算,而且隨著時間增長,越接近午夜單次查詢次數會線性增加。由于實時查詢、實時報警等模塊大量的查詢請求都需要多次調用該方法,導致了大量CPU資源的占用與浪費。

4、解決方案

定位到問題之后,首先考慮是要減少計算次數,優(yōu)化異常方法。排查后發(fā)現,在邏輯層使用時,并沒有使用該方法返回的set集合中的內容,而是簡單的用set的size數值。確認邏輯后,通過新方法簡化計算(當前秒數-當天凌晨的秒數),替換調用的方法,解決計算過多的問題。上線后觀察服務器負載和cpu使用率,對比異常時間段下降了30倍,恢復至正常狀態(tài),至此該問題得已解決。

c42f055e-d278-11ed-bfe3-dac502259ad0.jpg

5、總結

在編碼的過程中,除了要實現業(yè)務的邏輯,也要注重代碼性能的優(yōu)化。一個業(yè)務需求,能實現,和能實現的更高效、更優(yōu)雅其實是兩種截然不同的工程師能力和境界的體現,而后者也是工程師的核心競爭力。

在代碼編寫完成之后,多做 review,多思考是不是可以用更好的方式來實現。

線上問題不放過任何一個小細節(jié)!細節(jié)是魔鬼,技術的同學需要有刨根問題的求知欲和追求卓越的精神,只有這樣,才能不斷的成長和提升。

審核編輯 :李倩

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • cpu
    cpu
    +關注

    關注

    68

    文章

    10870

    瀏覽量

    211901
  • 服務器
    +關注

    關注

    12

    文章

    9184

    瀏覽量

    85489
  • PID
    PID
    +關注

    關注

    35

    文章

    1472

    瀏覽量

    85554

原文標題:我去,Linux 系統(tǒng) CPU 100% 打滿了!

文章出處:【微信號:良許Linux,微信公眾號:良許Linux】歡迎添加關注!文章轉載請注明出處。

收藏 人收藏

    評論

    相關推薦

    嵌入式Linux系統(tǒng)CPU控制常見辦法測試

    01 測試環(huán)境 Xilinx ZCU106 單板 Xilinx VCU TRD2020.1 02 介紹 嵌入式Linux系統(tǒng)中,Linux直接管理所有CPU。默認情況下,
    的頭像 發(fā)表于 11-26 14:17 ?5121次閱讀

    怎么在Linux系統(tǒng)中查看CPU信息

    CPU也稱為微處理器或簡稱為處理器。就像大腦如何控制人體一樣,CPU 控制著計算機的所有部分。因此CPU被認為是計算機的大腦。那我們怎么在Linux
    發(fā)表于 09-15 09:12 ?7597次閱讀

    Linux系統(tǒng)CPU占用率100%的排查思路

    今天浩道跟大家分享linux硬核干貨,工作中當你服務器CPU達到100%時,干著急是沒有用的,該查問題還得自己去查。本文將給大家羅列排查異常故障思路,并且文末附上相關shell腳本,去實際一番,你會發(fā)現原來解決問題的方法如此之簡
    的頭像 發(fā)表于 01-23 10:26 ?5988次閱讀
    <b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>占用率<b class='flag-5'>100</b>%的排查思路

    關于系統(tǒng)實時補丁,以及linux&u-boot移植方面的問題

    由于開發(fā)板要應用在機器人控制系統(tǒng)的實時通信環(huán)節(jié),因此需要對linux打上xenomai的實時補丁。咱們z-turn板光盤里的linux版本時3.15.0,在xenomai的官網上找不到對于這
    發(fā)表于 06-16 10:19

    請問Linux系統(tǒng)發(fā)現占用CPU100%的進程如何處理?

    Linux系統(tǒng)發(fā)現占用CPU100%的進程并處理
    發(fā)表于 11-10 08:12

    嵌入式Linux系統(tǒng)驅動hp1020印機的方法步驟

    一、開發(fā)環(huán)境硬件環(huán)境:am3354印機型號:hp1020plus虛假機系統(tǒng):Ubuntu12.04交叉編譯工具版本:arm-linux-gcc version 4.5.1二、詳細步驟1、li
    發(fā)表于 11-05 07:54

    嵌入式linux磁盤被寫滿了再寫會出現什么后果

    ),結果日志缺東少西,斷斷續(xù)續(xù);不騰挪磁盤,再次運行應用,依舊可以正常工作一段時間;==待解釋參見:linux的硬盤滿了會導致哪些系統(tǒng)調用受影響...
    發(fā)表于 11-05 07:03

    CPU占用率100%的故障解決

      相信很多朋友都遇到過CPU占用率100%的情況,那會導致系統(tǒng)慢如蝸牛。半小時前,筆者正在玩游戲,電腦突然行動遲緩,打開任務管理器,發(fā)現CPU占用率
    發(fā)表于 08-29 10:24 ?989次閱讀

    Linux CPU的性能應該如何優(yōu)化

    Linux系統(tǒng)中,由于成本的限制,往往會存在資源上的不足,例如 CPU、內存、網絡、IO 性能。本文,就對 Linux 進程和 CPU
    的頭像 發(fā)表于 01-18 08:52 ?3387次閱讀

    Linux系統(tǒng)下使用top命令查看CPU使用情況

    Linux系統(tǒng)下,使用top命令查看CPU使用情況。
    發(fā)表于 07-10 11:46 ?4410次閱讀
    在<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b>下使用top命令查看<b class='flag-5'>CPU</b>使用情況

    如何用腳本來獲取linux系統(tǒng)CPU、內存、磁盤IO,及原理解釋

    今天主要分享一個shell腳本,用來獲取linux系統(tǒng)CPU、內存、磁盤IO等信息。
    的頭像 發(fā)表于 04-08 14:40 ?2996次閱讀
    如何用腳本來獲取<b class='flag-5'>linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>、內存、磁盤IO,及原理解釋

    嵌入式Linux系統(tǒng)驅動hp1020印機

    一、開發(fā)環(huán)境硬件環(huán)境:am3354印機型號:hp1020plus虛假機系統(tǒng):Ubuntu12.04交叉編譯工具版本:arm-linux-gcc version 4.5.1二、詳細步驟1、li
    發(fā)表于 11-01 17:59 ?15次下載
    嵌入式<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b>驅動hp1020<b class='flag-5'>打</b>印機

    分享排查Linux系統(tǒng)CPU占用的一個Shell腳本

    眾所周知,Linux系統(tǒng)CPU占用100%這個異?,F象還是經常遇到的,因此分析其導致異常原因是解決問題的根本。
    的頭像 發(fā)表于 09-04 09:17 ?1848次閱讀
    分享排查<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>占用的一個Shell腳本

    如何在Linux系統(tǒng)中檢查CPU使用率

    首先在Linux系統(tǒng)中檢查CPU使用率??梢酝ㄟ^在命令行中輸入top或htop命令來查看當前系統(tǒng)中各個進程的CPU使用率。如果
    發(fā)表于 01-06 10:42 ?1329次閱讀
    如何在<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b>中檢查<b class='flag-5'>CPU</b>使用率

    Linux服務器CPU飆升的原因

    首先在Linux系統(tǒng)中檢查CPU使用率。可以通過在命令行中輸入top或htop命令來查看當前系統(tǒng)中各個進程的CPU使用率。如果
    發(fā)表于 02-28 11:00 ?1934次閱讀
    <b class='flag-5'>Linux</b>服務器<b class='flag-5'>CPU</b>飆升的原因