0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

如何解決優(yōu)化過(guò)程中遇到的問(wèn)題

Linux愛(ài)好者 ? 來(lái)源:SegmentFault ? 作者:Leoython ? 2021-09-30 16:59 ? 次閱讀

前言

這篇文章的主題是記錄一次程序的性能優(yōu)化,在優(yōu)化的過(guò)程中遇到的問(wèn)題,以及如何去解決的。

為大家提供一個(gè)優(yōu)化的思路,首先要聲明的一點(diǎn)是,我的方式不是唯一的,大家在性能優(yōu)化之路上遇到的問(wèn)題都絕對(duì)不止一個(gè)解決方案。

如何優(yōu)化

首先大家要明確的一點(diǎn)是,脫離需求談優(yōu)化都是耍流氓。所以,有誰(shuí)跟你說(shuō)在 xx 機(jī)器上實(shí)現(xiàn)了百萬(wàn)并發(fā),基本上可以認(rèn)為是不懂裝懂了,單純的并發(fā)數(shù)完全是無(wú)意義的。

其次,我們優(yōu)化之前必須要有一個(gè)目標(biāo)。需要優(yōu)化到什么程度,沒(méi)有明確目標(biāo)的優(yōu)化是不可控的。再然后,我們必須明確的找出性能瓶頸在哪里,而不能漫無(wú)目的的一通亂搞。

需求描述

這個(gè)項(xiàng)目是我在上家公司負(fù)責(zé)一個(gè)單獨(dú)的模塊。本來(lái)是集成在主站代碼中的,后來(lái)因?yàn)椴l(fā)太大,為了防止出現(xiàn)問(wèn)題后拖累主站服務(wù),所有由我一個(gè)人負(fù)責(zé)拆分出來(lái)。

對(duì)這個(gè)模塊的拆分要求是,壓力測(cè)試 QPS 不能低于 3 萬(wàn),數(shù)據(jù)庫(kù)負(fù)責(zé)不能超過(guò) 50%,服務(wù)器負(fù)載不能超過(guò) 70%,單次請(qǐng)求時(shí)長(zhǎng)不能超過(guò) 70ms,錯(cuò)誤率不能超過(guò) 5%。

環(huán)境的配置如下:

服務(wù)器:4 核 8G 內(nèi)存,CentOS 7 系統(tǒng),SSD 硬盤(pán)

數(shù)據(jù)庫(kù):MySQL 5.7,最大連接數(shù) 800

緩存:Redis,1G容量。以上環(huán)境都是購(gòu)買(mǎi)自騰訊云的服務(wù)。

壓測(cè)工具:Locust,使用騰訊的彈性伸縮實(shí)現(xiàn)分布式的壓測(cè)。

需求描述如下:

用戶(hù)進(jìn)入首頁(yè),從數(shù)據(jù)庫(kù)中查詢(xún)是否有合適的彈窗配置。

如果沒(méi)有,則繼續(xù)等待下一次請(qǐng)求、如果有合適的配置,則返回給前端。

這里開(kāi)始則有多個(gè)條件分支:

如果用戶(hù)點(diǎn)擊了彈窗,則記錄用戶(hù)點(diǎn)擊,并且在配置的時(shí)間內(nèi)不再返回配置;

如果用戶(hù)未點(diǎn)擊,則24小時(shí)后繼續(xù)返回本次配置;

如果用戶(hù)點(diǎn)擊了,但是后續(xù)沒(méi)有配置了,則接著等待下一次。

重點(diǎn)分析

根據(jù)需求,我們知道了有幾個(gè)重要的點(diǎn):

需要找出合適用戶(hù)的彈窗配置,

需要記錄用戶(hù)下一次返回配置的時(shí)間并記錄到數(shù)據(jù)庫(kù)中,

需要記錄用戶(hù)對(duì)返回的配置執(zhí)行了什么操作并記錄到數(shù)據(jù)庫(kù)中。

調(diào)優(yōu)

我們可以看到,上述三個(gè)重點(diǎn)都存在數(shù)據(jù)庫(kù)的操作,不只有讀庫(kù),還有寫(xiě)庫(kù)操作。

從這里我們可以看到,如果不加緩存的話,所有的請(qǐng)求都?jí)旱綌?shù)據(jù)庫(kù),勢(shì)必會(huì)占滿(mǎn)全部連接數(shù),出現(xiàn)拒絕訪問(wèn)的錯(cuò)誤。同時(shí)因?yàn)?SQL 執(zhí)行過(guò)慢,導(dǎo)致請(qǐng)求無(wú)法及時(shí)返回。

所以,我們首先要做的就是將寫(xiě)庫(kù)操作剝離開(kāi)來(lái)。提升每一次請(qǐng)求響應(yīng)速度,優(yōu)化數(shù)據(jù)庫(kù)連接。

整個(gè)系統(tǒng)的架構(gòu)圖如下:

將寫(xiě)庫(kù)操作放到一個(gè)先進(jìn)先出的消息隊(duì)列中來(lái)做。為了減少?gòu)?fù)雜度,使用了 Redis 的 list 來(lái)做這個(gè)消息隊(duì)列。

然后進(jìn)行壓測(cè),結(jié)果如下:

QPS 在 6000 左右 502 錯(cuò)誤大幅上升至 30%;

服務(wù)器 CPU 在 60%-70% 之間來(lái)回跳動(dòng);

數(shù)據(jù)庫(kù)連接數(shù)被占滿(mǎn) TCP 連接數(shù)為 6000 左右。

很明顯,問(wèn)題還是出在數(shù)據(jù)庫(kù)。

經(jīng)過(guò)排查 SQL 語(yǔ)句,查詢(xún)到原因就是:找出合適用戶(hù)的配置操作時(shí)每次請(qǐng)求都要讀取數(shù)據(jù)庫(kù)所導(dǎo)致的連接數(shù)被用完。

因?yàn)槲覀兊倪B接數(shù)只有 800,一旦請(qǐng)求過(guò)多勢(shì)必會(huì)導(dǎo)致數(shù)據(jù)庫(kù)瓶頸。好了,問(wèn)題找到了,我們繼續(xù)優(yōu)化。

我們將全部的配置都加載到緩存中,只有在緩存中沒(méi)有配置的時(shí)候才會(huì)去讀取數(shù)據(jù)庫(kù)。

接下來(lái)我們?cè)俅螇簻y(cè),結(jié)果如下:

QPS 壓到 2 萬(wàn)左右的時(shí)候就上不去了;

服務(wù)器 CPU 在 60%-80% 之間跳動(dòng);

數(shù)據(jù)庫(kù)連接數(shù)為 300 個(gè)左右,每秒 TCP 連接數(shù)為 1.5 萬(wàn)左右。

這個(gè)問(wèn)題是困擾我比較久的一個(gè)問(wèn)題。因?yàn)槲覀兛梢钥吹?,我?2 萬(wàn)的 QPS,但是 TCP 連接數(shù)卻并沒(méi)有達(dá)到 2 萬(wàn)。

我猜測(cè),TCP 連接數(shù)就是引發(fā)瓶頸的問(wèn)題,但是因?yàn)槭裁丛蛩l(fā)的暫時(shí)無(wú)法找出來(lái)。

這個(gè)時(shí)候猜測(cè),既然是無(wú)法建立 TCP 連接,是否有可能是服務(wù)器限制了 socket 連接數(shù)。

驗(yàn)證猜測(cè),我們看一下,在終端輸入 ulimit -n 命令,顯示的結(jié)果為 65535??吹竭@里,覺(jué)得 socket 連接數(shù)并不是限制我們的原因,為了驗(yàn)證猜測(cè),將 socket 連接數(shù)調(diào)大為100001。

再次進(jìn)行壓測(cè),結(jié)果如下:

QPS 壓到 2.2 萬(wàn)左右的時(shí)候就上不去了;

服務(wù)器 CPU 在 60%-80% 之間跳動(dòng);

數(shù)據(jù)庫(kù)連接數(shù)為 300 個(gè)左右,每秒 TCP 連接數(shù)為 1.7 萬(wàn)左右。

雖然有一點(diǎn)提升,但是并沒(méi)有實(shí)質(zhì)性的變化。

接下來(lái)的幾天時(shí)間,我發(fā)現(xiàn)都無(wú)法找到優(yōu)化的方案。那幾天確實(shí)很難受,找不出來(lái)優(yōu)化的方案,過(guò)了幾天再次將問(wèn)題梳理了一遍,發(fā)現(xiàn)雖然 socket 連接數(shù)足夠,但是并沒(méi)有全部被用上。猜測(cè)每次請(qǐng)求過(guò)后,TCP 連接并沒(méi)有立即被釋放,導(dǎo)致 socket 無(wú)法重用。

經(jīng)過(guò)查找資料,找到了問(wèn)題所在:

TCP 鏈接在經(jīng)過(guò)四次握手結(jié)束連接后并不會(huì)立即釋放,而是處于 timewait 狀態(tài)。會(huì)等待一段時(shí)間,以防止客戶(hù)端后續(xù)的數(shù)據(jù)未被接收。

好了,問(wèn)題找到了,我們要接著優(yōu)化。

首先想到的就是調(diào)整 TCP 鏈接結(jié)束后等待時(shí)間。但是 Linux并沒(méi)有提供這一內(nèi)核參數(shù)的調(diào)整,如果要改必須要自己重新編譯內(nèi)核。幸好還有另一個(gè)參數(shù)net.ipv4.tcp_max_tw_buckets, timewait 的數(shù)量。默認(rèn)是 180000。我們調(diào)整為6000。然后打開(kāi) timewait 快速回收和開(kāi)啟重用。

完整的參數(shù)優(yōu)化如下:

#timewait 的數(shù)量,默認(rèn)是 180000。net.ipv4.tcp_max_tw_buckets = 6000

net.ipv4.ip_local_port_range = 1024 65000

#啟用 timewait 快速回收。net.ipv4.tcp_tw_recycle = 1

#開(kāi)啟重用。允許將 TIME-WAIT sockets 重新用于新的 TCP 連接。net.ipv4.tcp_tw_reuse = 1

我們?cè)俅螇簻y(cè),結(jié)果顯示:

QPS 5萬(wàn),服務(wù)器 CPU 70%;

數(shù)據(jù)庫(kù)連接正常,TCP 連接正常;

響應(yīng)時(shí)間平均為 60ms,錯(cuò)誤率為 0%。

結(jié)語(yǔ)

到此為止,整個(gè)服務(wù)的開(kāi)發(fā)、調(diào)優(yōu)、和壓測(cè)就結(jié)束了?;仡欉@一次調(diào)優(yōu),得到了很多經(jīng)驗(yàn)。最重要的是,深刻理解了Web 開(kāi)發(fā)不是一個(gè)獨(dú)立的個(gè)體,而是網(wǎng)絡(luò)、數(shù)據(jù)庫(kù)、編程語(yǔ)言、操作系統(tǒng)等多門(mén)學(xué)科結(jié)合的工程實(shí)踐。這就要求 Web 開(kāi)發(fā)人員有牢固的基礎(chǔ)知識(shí),否則出現(xiàn)了問(wèn)題還不知道怎么分析查找。

轉(zhuǎn)自:Leoython

鏈接:segmentfault.com/a/1190000018075241

責(zé)任編輯:haq

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 內(nèi)存
    +關(guān)注

    關(guān)注

    8

    文章

    3025

    瀏覽量

    74060
  • SQL
    SQL
    +關(guān)注

    關(guān)注

    1

    文章

    764

    瀏覽量

    44134
  • 程序
    +關(guān)注

    關(guān)注

    117

    文章

    3787

    瀏覽量

    81060

原文標(biāo)題:記一次性能優(yōu)化,單臺(tái) 4 核 8G 機(jī)器支撐 5 萬(wàn) QPS

文章出處:【微信號(hào):LinuxHub,微信公眾號(hào):Linux愛(ài)好者】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏

    評(píng)論

    相關(guān)推薦

    錫膏印刷機(jī)印刷過(guò)程中有哪些不良及解決方法

    PCB制作工藝基本上都需要用到SMT工藝,因此在PCBA的加工工藝普遍用到錫膏印刷機(jī),在使用錫膏印刷機(jī)的過(guò)程中有時(shí)候會(huì)遇到各種問(wèn)題,這些不良應(yīng)該如何解決呢?下面深圳佳金源錫膏廠家給大
    的頭像 發(fā)表于 12-19 16:40 ?243次閱讀
    錫膏印刷機(jī)印刷<b class='flag-5'>過(guò)程中</b>有哪些不良及解決方法

    PLC數(shù)據(jù)采集在實(shí)施過(guò)程中存在的問(wèn)題及解決方案

    PLC數(shù)據(jù)采集在工業(yè)自動(dòng)化領(lǐng)域的實(shí)施過(guò)程中,遇到了一系列顯著的挑戰(zhàn)與痛點(diǎn),這些痛點(diǎn)直接影響了數(shù)據(jù)采集的效率、準(zhǔn)確性和成本效益。
    的頭像 發(fā)表于 11-30 14:38 ?220次閱讀

    使用TPL0501可編程電阻的過(guò)程中,發(fā)現(xiàn)上單默認(rèn)阻值好像會(huì)變化,為什么?如何解決?

    在使用TPL0501可編程電阻的過(guò)程中,發(fā)現(xiàn)上單默認(rèn)阻值好像會(huì)變化,但是在手冊(cè)好像沒(méi)有相關(guān)的描述? 應(yīng)用的場(chǎng)景為在電源電路中使用TPL0501作為分壓電阻,使用程序來(lái)控制輸出電壓。剛開(kāi)始
    發(fā)表于 11-26 06:58

    使用ADS1299的過(guò)程中遇到的疑問(wèn)求解

    我在使用ADS1299的過(guò)程中有一點(diǎn)疑問(wèn),需要您的幫助。 這是一張關(guān)于BIAS反饋回路的示意圖,在我的理解里這可以看作一個(gè)加減運(yùn)算電路,我想知道的是,只關(guān)注它的反向輸入時(shí),且暫時(shí)忽略1.5nF的電容,外部只加1M的電阻,它的放大倍數(shù)是多少? 期待您的回復(fù)!
    發(fā)表于 11-15 06:35

    使用pahomqtt啟動(dòng)過(guò)程中pipe_fops_open時(shí)出現(xiàn)rt_condvar_timedwait ,如何解決?

    在使用pahomqtt 啟動(dòng)過(guò)程中pipe_fops_open 時(shí)出現(xiàn)rt_condvar_timedwait 死等,而RTT 5.0則可以。請(qǐng)問(wèn)該如何解決?
    發(fā)表于 09-26 07:11

    使用VCA810過(guò)程中遇到的一些問(wèn)題求解

    我在使用VCA810過(guò)程中遇到一些問(wèn)題,請(qǐng)各位大神指點(diǎn),具體如下: 1、控制電壓最小只能加到-1.7V,再減小的話輸出信號(hào)消失或者放大倍數(shù)驟然減小。 2、輸入端出現(xiàn)一個(gè)疊加在信號(hào)上的直流,輸出端直
    發(fā)表于 08-30 07:11

    DRV2700EVM-HV500在測(cè)試的過(guò)程中發(fā)現(xiàn)輸出紋波很大如何解決?

    在測(cè)試的過(guò)程中發(fā)現(xiàn)輸出紋波很大大概20V,請(qǐng)問(wèn)改如何解
    發(fā)表于 08-15 06:25

    設(shè)備運(yùn)行過(guò)程中,調(diào)用云端接口后報(bào)status500的原因?如何解決?

    在設(shè)備運(yùn)行過(guò)程中出現(xiàn),調(diào)用云端接口后,報(bào)500,設(shè)備接收到了云端發(fā)過(guò)來(lái)數(shù)據(jù),并執(zhí)行了動(dòng)作! 想問(wèn)導(dǎo)致status500錯(cuò)誤具體可能的情況和原因是什么?如何解決?
    發(fā)表于 07-18 06:48

    電容充放電過(guò)程中電壓的變化規(guī)律

    電容充放電過(guò)程中電壓的變化規(guī)律是一個(gè)非常重要的電子學(xué)課題,涉及到電容器的基本工作原理和特性。在這篇文章,我們將詳細(xì)探討電容充放電過(guò)程中電壓的變化規(guī)律,包括電容的基本特性、充電過(guò)程、放
    的頭像 發(fā)表于 07-11 09:43 ?5662次閱讀

    使用PSoC5LP的過(guò)程中,遇到PSoC5LP在EFT干擾時(shí)復(fù)位的問(wèn)題怎么解決?

    在我使用 PSoC5LP 的過(guò)程中(>8 年),我曾多次在驗(yàn)證測(cè)試遇到 PSoC5LP 在 EFT 干擾時(shí)復(fù)位的問(wèn)題。 大多數(shù)情況下,這取決于 XRES 引腳,因?yàn)?EFT 可以改變
    發(fā)表于 07-05 07:26

    燒錄ESP RainMaker的例程時(shí),遇到這種版本問(wèn)題如何解決?

    我在燒錄ESP RainMaker的例程時(shí),遇到這種版本問(wèn)題,應(yīng)該如何解決呀。 ESP-IDF是5.2.1 ,下載esp-rainmaker時(shí)使用的是$ git clone --recursive https://github
    發(fā)表于 06-05 06:44

    IGBT模塊封裝過(guò)程中的技術(shù)詳解

    IGBT 模塊封裝采用了膠體隔離技術(shù),防止運(yùn)行過(guò)程中發(fā)生爆炸;第二是電極結(jié)構(gòu)采用了彈簧結(jié)構(gòu),可以緩解安裝過(guò)程中對(duì)基板上形成開(kāi)裂,造成基板的裂紋;第三是對(duì)底板進(jìn)行加工設(shè)計(jì),使底板與散熱器緊密接觸,提高了模塊的熱循環(huán)能力。
    發(fā)表于 04-02 11:12 ?1145次閱讀
    IGBT模塊封裝<b class='flag-5'>過(guò)程中</b>的技術(shù)詳解

    STM32F405RG在做500K DATA對(duì)FLASH燒寫(xiě),燒寫(xiě)過(guò)程中FLASH會(huì)全部變成0XFFFFF如何解決?

    STM32F405RG 芯片在做500K的DATA對(duì)FLASH燒寫(xiě)的時(shí)候,在過(guò)程中,F(xiàn)LASH會(huì)出現(xiàn)突然全部變成0XFFFFF....這個(gè)問(wèn)題該如何解決?
    發(fā)表于 03-27 06:57

    何解決連接國(guó)外大帶寬服務(wù)器時(shí)可能遇到的問(wèn)題

     相信很多小白用戶(hù)會(huì)對(duì)如何解決連接國(guó)外大帶寬服務(wù)器時(shí)可能遇到的問(wèn)題感興趣,RAK部落小編就為您整理發(fā)布如何解決連接國(guó)外大帶寬服務(wù)器時(shí)可能遇到的問(wèn)題。
    的頭像 發(fā)表于 03-19 12:00 ?505次閱讀

    何解決開(kāi)關(guān)電源調(diào)試遇到的問(wèn)題?

    一般在使用電氣設(shè)備之前都會(huì)調(diào)試,以便及時(shí)發(fā)現(xiàn)問(wèn)題并采取措施解決。開(kāi)關(guān)電源也一樣會(huì)進(jìn)行調(diào)試,那么在調(diào)試開(kāi)關(guān)電源的過(guò)程中會(huì)遇到哪些問(wèn)題呢?又該如何解決呢?
    的頭像 發(fā)表于 01-29 16:39 ?637次閱讀