0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

Linux系統(tǒng)CPU 100%異常排查實踐與總結(jié)

jf_TEuU2tls ? 來源:浩道linux ? 2023-02-23 09:54 ? 次閱讀

今天浩道跟大家分享linux硬核干貨,工作中當(dāng)你服務(wù)器CPU達(dá)到100%時,該如何排查異常故障呢?

昨天下午突然收到運維郵件報警,顯示數(shù)據(jù)平臺服務(wù)器cpu利用率達(dá)到了98.94%,而且最近一段時間一直持續(xù)在70%以上,看起來像是硬件資源到瓶頸需要擴容了,但仔細(xì)思考就會發(fā)現(xiàn)咱們的業(yè)務(wù)系統(tǒng)并不是一個高并發(fā)或者CPU密集型的應(yīng)用,這個利用率有點太夸張,硬件瓶頸應(yīng)該不會這么快就到了,一定是哪里的業(yè)務(wù)代碼邏輯有問題。

2、排查思路

2.1定位高負(fù)載進(jìn)程pid

首先登錄到服務(wù)器使用top命令確認(rèn)服務(wù)器的具體情況,根據(jù)具體情況再進(jìn)行分析判斷。

7682e9d2-b30c-11ed-bfe3-dac502259ad0.png

通過觀察load average,以及負(fù)載評判標(biāo)準(zhǔn)(8核),可以確認(rèn)服務(wù)器存在負(fù)載較高的情況;

76a18068-b30c-11ed-bfe3-dac502259ad0.jpg

觀察各個進(jìn)程資源使用情況,可以看出進(jìn)程id為682的進(jìn)程,有著較高的CPU占比

2.2定位具體的異常業(yè)務(wù)

這里咱們可以使用 pwdx 命令根據(jù) pid 找到業(yè)務(wù)進(jìn)程路徑,進(jìn)而定位到負(fù)責(zé)人和項目:

76c7b288-b30c-11ed-bfe3-dac502259ad0.jpg

可得出結(jié)論:該進(jìn)程對應(yīng)的就是數(shù)據(jù)平臺的web服務(wù)。

2.3定位異常線程及具體代碼行

傳統(tǒng)的方案一般是4步:

1、top oder by with P:1040 // 首先按進(jìn)程負(fù)載排序找到 maxLoad(pid)

2、top -Hp 進(jìn)程PID:1073 // 找到相關(guān)負(fù)載 線程PID

3、printf “0x%x ”線程PID:0x431 // 將線程PID轉(zhuǎn)換為 16進(jìn)制,為后面查找 jstack 日志做準(zhǔn)備

4、jstack 進(jìn)程PID | vim +/十六進(jìn)制線程PID - // 例如:jstack 1040|vim +/0x431 -

但是對于線上問題定位來說,分秒必爭,上面的 4 步還是太繁瑣耗時了,之前介紹過淘寶的oldratlee 同學(xué)就將上面的流程封裝為了一個工具:show-busy-java-threads.sh,可以很方便的定位線上的這類問題:

76f8a582-b30c-11ed-bfe3-dac502259ad0.jpg

可得出結(jié)論:是系統(tǒng)中一個時間工具類方法的執(zhí)行cpu占比較高,定位到具體方法后,查看代碼邏輯是否存在性能問題。

※如果線上問題比較緊急,可以省略 2.1、2.2 直接執(zhí)行 2.3,這里從多角度剖析只是為了給大家呈現(xiàn)一個完整的分析思路。

3、根因分析

經(jīng)過前面的分析與排查,最終定位到一個時間工具類的問題,造成了服務(wù)器負(fù)載以及cpu使用率的過高。

  • 異常方法邏輯:是把時間戳轉(zhuǎn)成對應(yīng)的具體的日期時間格式;

  • 上層調(diào)用:計算當(dāng)天凌晨至當(dāng)前時間所有秒數(shù),轉(zhuǎn)化成對應(yīng)的格式放入到set中返回結(jié)果;

  • 邏輯層:對應(yīng)的是數(shù)據(jù)平臺實時報表的查詢邏輯,實時報表會按照固定的時間間隔來,并且在一次查詢中有多次(n次)方法調(diào)用。

那么可以得到結(jié)論,如果現(xiàn)在時間是當(dāng)天上午10點,一次查詢的計算次數(shù)就是 10*60*60*n次=36,000*n次計算,而且隨著時間增長,越接近午夜單次查詢次數(shù)會線性增加。由于實時查詢、實時報警等模塊大量的查詢請求都需要多次調(diào)用該方法,導(dǎo)致了大量CPU資源的占用與浪費。

4、解決方案

定位到問題之后,首先考慮是要減少計算次數(shù),優(yōu)化異常方法。排查后發(fā)現(xiàn),在邏輯層使用時,并沒有使用該方法返回的set集合中的內(nèi)容,而是簡單的用set的size數(shù)值。確認(rèn)邏輯后,通過新方法簡化計算(當(dāng)前秒數(shù)-當(dāng)天凌晨的秒數(shù)),替換調(diào)用的方法,解決計算過多的問題。上線后觀察服務(wù)器負(fù)載和cpu使用率,對比異常時間段下降了30倍,恢復(fù)至正常狀態(tài),至此該問題得已解決。

772c5ed6-b30c-11ed-bfe3-dac502259ad0.jpg

5、總結(jié)

  • 在編碼的過程中,除了要實現(xiàn)業(yè)務(wù)的邏輯,也要注重代碼性能的優(yōu)化。一個業(yè)務(wù)需求,能實現(xiàn),和能實現(xiàn)的更高效、更優(yōu)雅其實是兩種截然不同的工程師能力和境界的體現(xiàn),而后者也是工程師的核心競爭力。

  • 在代碼編寫完成之后,多做 review,多思考是不是可以用更好的方式來實現(xiàn)。

  • 線上問題不放過任何一個小細(xì)節(jié)!細(xì)節(jié)是魔鬼,技術(shù)的同學(xué)需要有刨根問題的求知欲和追求卓越的精神,只有這樣,才能不斷的成長和提升。

附上show-busy-java-threads.sh腳本:

#!/bin/bash
# @Function
# Find out the highest cpu consumed threads of java, and print the stack of these threads.
#
# @Usage
#   $ ./show-busy-java-threads.sh
#
# @author Jerry Lee


readonly PROG=`basename $0`
readonly -a COMMAND_LINE=("$0" "$@")


usage() {
    cat <
Usage: ${PROG} [OPTION]...
Find out the highest cpu consumed threads of java, and print the stack of these threads.
Example: ${PROG} -c 10


Options:
    -p, --pid       find out the highest cpu consumed threads from the specifed java process,
                    default from all java process.
    -c, --count     set the thread count to show, default is 5
    -h, --help      display this help and exit
EOF
    exit $1
}


readonly ARGS=`getopt -n "$PROG" -a -o ch -l count:,pid:,help -- "$@"`
[ $? -ne 0 ] && usage 1
eval set -- "${ARGS}"


while true; do
    case "$1" in
    -c|--count)
        count="$2"
        shift 2
        ;;
    -p|--pid)
        pid="$2"
        shift 2
        ;;
    -h|--help)
        usage
        ;;
    --)
        shift
        break
        ;;
    esac
done
count=${count:-5}


redEcho() {
    [ -c /dev/stdout ] && {
        # if stdout is console, turn on color output.
        echo -ne "33[1;31m"
        echo -n "$@"
        echo -e "33[0m"
    } || echo "$@"
}


yellowEcho() {
    [ -c /dev/stdout ] && {
        # if stdout is console, turn on color output.
        echo -ne "33[1;33m"
        echo -n "$@"
        echo -e "33[0m"
    } || echo "$@"
}


blueEcho() {
    [ -c /dev/stdout ] && {
        # if stdout is console, turn on color output.
        echo -ne "33[1;36m"
        echo -n "$@"
        echo -e "33[0m"
    } || echo "$@"
}


# Check the existence of jstack command!
if ! which jstack &> /dev/null; then
    [ -z "$JAVA_HOME" ] && {
        redEcho "Error: jstack not found on PATH!"
        exit 1
    }
    ! [ -f "$JAVA_HOME/bin/jstack" ] && {
        redEcho "Error: jstack not found on PATH and $JAVA_HOME/bin/jstack file does NOT exists!"
        exit 1
    }
    ! [ -x "$JAVA_HOME/bin/jstack" ] && {
        redEcho "Error: jstack not found on PATH and $JAVA_HOME/bin/jstack is NOT executalbe!"
        exit 1
    }
    export PATH="$JAVA_HOME/bin:$PATH"
fi


readonly uuid=`date +%s`_${RANDOM}_$$


cleanupWhenExit() {
    rm /tmp/${uuid}_* &> /dev/null
}
trap "cleanupWhenExit" EXIT


printStackOfThreads() {
    local line
    local count=1
    while IFS=" " read -a line ; do
        local pid=${line[0]}
        local threadId=${line[1]}
        local threadId0x="0x`printf %x ${threadId}`"
        local user=${line[2]}
        local pcpu=${line[4]}


        local jstackFile=/tmp/${uuid}_${pid}


        [ ! -f "${jstackFile}" ] && {
            {
                if [ "${user}" == "${USER}" ]; then
                    jstack ${pid} > ${jstackFile}
                else
                    if [ $UID == 0 ]; then
                        sudo -u ${user} jstack ${pid} > ${jstackFile}
                    else
                        redEcho "[$((count++))] Fail to jstack Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user})."
                        redEcho "User of java process($user) is not current user($USER), need sudo to run again:"
                        yellowEcho "    sudo ${COMMAND_LINE[@]}"
                        echo
                        continue
                    fi
                fi
            } || {
                redEcho "[$((count++))] Fail to jstack Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user})."
                echo
                rm ${jstackFile}
                continue
            }
        }
        blueEcho "[$((count++))] Busy(${pcpu}%) thread(${threadId}/${threadId0x}) stack of java process(${pid}) under user(${user}):"
        sed "/nid=${threadId0x} /,/^$/p" -n ${jstackFile}
    done
}




ps -Leo pid,lwp,user,comm,pcpu --no-headers | {
    [ -z "${pid}" ] &&
    awk '$4=="java"{print $0}' ||
    awk -v "pid=${pid}" '$1==pid,$4=="java"{print $0}'
} | sort -k5 -r -n | head --lines "${count}" | printStackOfThreads

審核編輯 :李倩


聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • cpu
    cpu
    +關(guān)注

    關(guān)注

    68

    文章

    10878

    瀏覽量

    212162
  • Linux
    +關(guān)注

    關(guān)注

    87

    文章

    11319

    瀏覽量

    209828
  • 服務(wù)器
    +關(guān)注

    關(guān)注

    12

    文章

    9231

    瀏覽量

    85625

原文標(biāo)題:Linux 系統(tǒng) CPU 100% 異常排查實踐與總結(jié)

文章出處:【微信號:浩道linux,微信公眾號:浩道linux】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關(guān)推薦

    Linux系統(tǒng)CPU占用率100%的排查思路

    今天浩道跟大家分享linux硬核干貨,工作中當(dāng)你服務(wù)器CPU達(dá)到100%時,干著急是沒有用的,該查問題還得自己去查。本文將給大家羅列排查異常
    的頭像 發(fā)表于 01-23 10:26 ?6039次閱讀
    <b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>占用率<b class='flag-5'>100</b>%的<b class='flag-5'>排查</b>思路

    設(shè)計與總結(jié)報告寫作基本要求

    設(shè)計與總結(jié)報告寫作基本要求
    發(fā)表于 08-01 01:01

    Flink Checkpoint 問題排查實用指南

    Checkpoint 失敗,或者 Checkpoint 慢的情況,本文會統(tǒng)一聊一聊Flink 中 Checkpoint 異常的情況(包括失敗和慢),以及可能的原因和排查思路。1. Checkpoint 流程
    發(fā)表于 09-17 16:25

    Linux驅(qū)動之基本理論常識總結(jié)

    0 引言前面Linux專題中關(guān)于Linux系統(tǒng)編程總結(jié)了17篇博文,主要是為了提高Linux下的C編程應(yīng)用能力,熟悉
    發(fā)表于 07-01 10:38

    CPU PG異常檢修

    CPU PG異常檢修 一、CPU PG信號示例圖              
    發(fā)表于 04-26 16:29 ?2385次閱讀
    <b class='flag-5'>CPU</b> PG<b class='flag-5'>異常</b>檢修

    PIC單片機的一些學(xué)習(xí)心得與總結(jié)

    PIC單片機的一些學(xué)習(xí)心得與總結(jié)
    發(fā)表于 01-14 12:33 ?12次下載

    直放站干擾排查實錄分析

    干擾的排查表面上是一項技術(shù)工作,實際情況卻并不完全是這樣,還有許多技術(shù)外的東西起著主導(dǎo)性的作用。精細(xì)的管理、完善的臺站資料數(shù)據(jù)庫,可以使根據(jù)現(xiàn)象結(jié)合資料線索從理論上推斷干擾源地點成為可能。技術(shù)上
    發(fā)表于 12-13 05:47 ?2310次閱讀

    cpu利用率異常排查實踐與總結(jié)

    昨天下午突然收到運維郵件報警,顯示數(shù)據(jù)平臺服務(wù)器cpu利用率達(dá)到了98.94%,而且最近一段時間一直持續(xù)在70%以上,看起來像是硬件資源到瓶頸需要擴容了,但仔細(xì)思考就會發(fā)現(xiàn)這個利用率有點太夸張,一定是哪里的業(yè)務(wù)代碼邏輯有問題。
    的頭像 發(fā)表于 11-15 15:33 ?3817次閱讀

    Linux CPU的性能應(yīng)該如何優(yōu)化

    Linux系統(tǒng)中,由于成本的限制,往往會存在資源上的不足,例如 CPU、內(nèi)存、網(wǎng)絡(luò)、IO 性能。本文,就對 Linux 進(jìn)程和 CPU
    的頭像 發(fā)表于 01-18 08:52 ?3393次閱讀

    Linux系統(tǒng)命令及shell腳本實踐指南

    Linux系統(tǒng)命令及shell腳本實踐指南資料下載。
    發(fā)表于 06-01 14:47 ?28次下載

    在Kubernetes集群發(fā)生網(wǎng)絡(luò)異常時如何排查

    本文將引入一個思路:“在 Kubernetes 集群發(fā)生網(wǎng)絡(luò)異常時如何排查”。文章將引入 Kubernetes 集群中網(wǎng)絡(luò)排查的思路,包含網(wǎng)絡(luò)異常模型,常用工具,并且提出一些案例以供學(xué)
    的頭像 發(fā)表于 09-02 09:45 ?4822次閱讀

    分享排查Linux系統(tǒng)CPU占用的一個Shell腳本

    眾所周知,Linux系統(tǒng)CPU占用100%這個異常現(xiàn)象還是經(jīng)常遇到的,因此分析其導(dǎo)致異常原因是解
    的頭像 發(fā)表于 09-04 09:17 ?1856次閱讀
    分享<b class='flag-5'>排查</b><b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>占用的一個Shell腳本

    Java怎么排查oom異常

    據(jù)量的應(yīng)用中。要排查OOM異常,需要經(jīng)過以下幾個步驟: 理解OOM異常的原因:OOM異常通常有以下幾個原因:內(nèi)存泄露、內(nèi)存溢出、內(nèi)存不足以容納所需的數(shù)據(jù)等。理解OOM
    的頭像 發(fā)表于 12-05 13:47 ?1262次閱讀

    如何在Linux系統(tǒng)中檢查CPU使用率

    首先在Linux系統(tǒng)中檢查CPU使用率。可以通過在命令行中輸入top或htop命令來查看當(dāng)前系統(tǒng)中各個進(jìn)程的CPU使用率。如果
    發(fā)表于 01-06 10:42 ?1339次閱讀
    如何在<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b>中檢查<b class='flag-5'>CPU</b>使用率

    Linux服務(wù)器CPU飆升的原因

    首先在Linux系統(tǒng)中檢查CPU使用率??梢酝ㄟ^在命令行中輸入top或htop命令來查看當(dāng)前系統(tǒng)中各個進(jìn)程的CPU使用率。如果
    發(fā)表于 02-28 11:00 ?1940次閱讀
    <b class='flag-5'>Linux</b>服務(wù)器<b class='flag-5'>CPU</b>飆升的原因