0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

Pandas DataFrame的存儲(chǔ)格式性能對(duì)比

科技綠洲 ? 來源:Python數(shù)據(jù)科學(xué) ? 作者:Python數(shù)據(jù)科學(xué) ? 2023-11-03 09:58 ? 次閱讀

Pandas 支持多種存儲(chǔ)格式,在本文中將對(duì)不同類型存儲(chǔ)格式下的Pandas Dataframe的讀取速度、寫入速度和大小的進(jìn)行測(cè)試對(duì)比。

創(chuàng)建測(cè)試Dataframe

首先創(chuàng)建一個(gè)包含不同類型數(shù)據(jù)的測(cè)試Pandas Dataframe。

import pandas as pd
import random
import string
import numpy as np

# Config DF
df_length= 10**6
start_date= '2023-01-01'
all_string= list(string.ascii_letters + string.digits)
string_length= 10**1
min_number= 0
max_number= 10**3

# Create Columns
date_col= pd.date_range(start= start_date, periods= df_length, freq= 'H')
str_col= [''.join(np.random.choice(all_string, string_length)) for i in range(df_length)]
float_col= np.random.rand(df_length)
int_col= np.random.randint(min_number,max_number, size = df_length)

# Create DataFrame
df= pd.DataFrame({'date_col' : date_col,
'str_col' : str_col,
'float_col' : float_col,
'int_col' : int_col})
df.info()
df.head()

以不同的格式存儲(chǔ)

接下來創(chuàng)建測(cè)試函數(shù),以不同的格式進(jìn)行讀寫。

import time
import os

def check_read_write_size(df, file_name, compression= None) :
format= file_name.split('.')[-1]
# Write
begin= time.time()
if file_name.endswith('.csv') : df.to_csv(file_name, index= False, compression= compression)
elif file_name.endswith('.parquet') : df.to_parquet(file_name, compression= compression)
elif file_name.endswith('.pickle') : df.to_pickle(file_name, compression= compression)
elif file_name.endswith('.orc') : df.to_orc(file_name)
elif file_name.endswith('.feather') : df.to_feather(file_name)
elif file_name.endswith('.h5') : df.to_hdf(file_name, key= 'df')
write_time= time.time() - begin
# Read
begin= time.time()
if file_name.endswith('.csv') : pd.read_csv(file_name, compression= compression)
elif file_name.endswith('.parquet') : pd.read_parquet(file_name)
elif file_name.endswith('.pickle') : pd.read_pickle(file_name, compression= compression)
elif file_name.endswith('.orc') : pd.read_orc(file_name)
elif file_name.endswith('.h5') : pd.read_hdf(file_name)
read_time= time.time() - begin
# File Size
file_size_mb = os.path.getsize(file_name) / (1024 * 1024)
return [format, compression, read_time, write_time, file_size_mb]

然后運(yùn)行該函數(shù)并將結(jié)果存儲(chǔ)在另一個(gè)Pandas Dataframe中。

test_case= [
['df.csv','infer'],
['df.csv','gzip'],
['df.pickle','infer'],
['df.pickle','gzip'],
['df.parquet','snappy'],
['df.parquet','gzip'],
['df.orc','default'],
['df.feather','default'],
['df.h5','default'],
]

result= []
for i in test_case :
result.append(check_read_write_size(df, i[0], compression= i[1]))

result_df= pd.DataFrame(result, columns= ['format','compression','read_time','write_time','file_size'])
result_df

測(cè)試結(jié)果

下面的圖表和表格是測(cè)試的結(jié)果。

圖片

我們對(duì)測(cè)試的結(jié)果做一個(gè)簡(jiǎn)單的分析:

CSV

  • 未壓縮文件的大小最大
  • 壓縮后的尺寸很小,但不是最小的
  • CSV的讀取速度和寫入速度是最慢的

Pickle

  • 表現(xiàn)得很平均
  • 但壓縮寫入速度是最慢的

Feather(再見 CSV,速度提升 150 倍!

  • 最快的讀寫速度,文件的大小也是中等,非常的平均

ORC

  • 所有格式中最小的
  • 讀寫速度非???,幾乎是最快的

Parquet

  • 總的來說,快速并且非常小,但是并不是最快也不是最小的

總結(jié)

從結(jié)果來看,我們應(yīng)該使用ORC或Feather,而不再使用CSV了,是嗎?

這取決于需求。

如果你正在做一些單獨(dú)的項(xiàng)目,那么使用最快或最小的格式肯定是有意義的。

但大多數(shù)時(shí)候,我們必須與他人合作。所以,除了速度和大小,還有更多的因素。

未壓縮的CSV可能很慢,而且最大,但是當(dāng)需要將數(shù)據(jù)發(fā)送到另一個(gè)系統(tǒng)時(shí),它非常容易。

ORC作為傳統(tǒng)的大數(shù)據(jù)處理格式(來自Hive)對(duì)于速度的和大小的優(yōu)化是做的最好的,Parquet比ORC更大、更慢,但是它卻是在速度和大小中取得了最佳的平衡,并且支持他的生態(tài)也多,所以在需要處理大文件的時(shí)候可以優(yōu)先選擇Parquet。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 數(shù)據(jù)
    +關(guān)注

    關(guān)注

    8

    文章

    7080

    瀏覽量

    89174
  • 存儲(chǔ)
    +關(guān)注

    關(guān)注

    13

    文章

    4328

    瀏覽量

    85942
  • 函數(shù)
    +關(guān)注

    關(guān)注

    3

    文章

    4338

    瀏覽量

    62738
收藏 人收藏

    評(píng)論

    相關(guān)推薦

    Python利用pandas讀寫Excel文件

    使用pandas模塊讀取Excel文件可以更為方便和快捷。pandas可以將Excel文件讀取為一個(gè)DataFrame對(duì)象,方便進(jìn)行數(shù)據(jù)處理和分析。
    的頭像 發(fā)表于 12-16 11:22 ?1370次閱讀
    Python利用<b class='flag-5'>pandas</b>讀寫Excel文件

    Nanopi系列板子資源性能對(duì)比

    Nanopi系列板子資源性能對(duì)比對(duì)比性能 選擇適合你的板子
    發(fā)表于 08-05 14:21

    在PyODPS DataFrame自定義函數(shù)中使用pandas、scipy和scikit-learn

    背景PyODPS DataFrame 提供了類似 pandas 的接口,來操作 ODPS 數(shù)據(jù),同時(shí)也支持在本地使用 pandas,和使用數(shù)據(jù)庫來執(zhí)行。PyODPS DataFrame
    發(fā)表于 05-17 19:48

    SparkRDMA基于BigDataBench的性能對(duì)比測(cè)試

    SparkRDMA基于BigDataBench 性能對(duì)比測(cè)試
    發(fā)表于 05-04 13:16

    Linux下AWTK與Qt的性能對(duì)比

    為了比較直觀的看到AWTK的基本性能,我們對(duì)產(chǎn)品開發(fā)者比較關(guān)心GUI的一些參數(shù)做了測(cè)試,如界面刷新幀數(shù)、啟動(dòng)時(shí)間等。讓我們從參數(shù)上直觀了解Linux下AWTK與Qt的性能對(duì)比。
    發(fā)表于 10-29 08:26

    Arm Cortex-A35性能對(duì)比分析

    Arm Cortex-A35性能對(duì)比
    發(fā)表于 01-19 07:44

    步進(jìn)電機(jī)和交流伺服電機(jī)性能對(duì)比分析哪個(gè)好?

    步進(jìn)電機(jī)和交流伺服電機(jī)性能對(duì)比分析哪個(gè)好?
    發(fā)表于 10-09 06:03

    常用無線收發(fā)芯片性能對(duì)比分析哪個(gè)好?

    常用無線收發(fā)芯片性能對(duì)比分析哪個(gè)好?選擇收發(fā)芯片時(shí)有哪些注意事項(xiàng)?
    發(fā)表于 10-21 06:14

    步進(jìn)電機(jī)和交流伺服電機(jī)性能對(duì)比分析哪個(gè)好?

    步進(jìn)電機(jī)和交流伺服電機(jī)性能對(duì)比分析哪個(gè)好?
    發(fā)表于 11-15 07:25

    arduino和stm32性能對(duì)比究竟誰更厲害?

    一些DIY和各種小項(xiàng)目?arduino和stm32性能對(duì)比究竟誰更厲害呢?我們一起來討論一下。比較兩者之前首先我們來了解下arduino和stm32的特點(diǎn):Arduino:Arduino UNO-DFRobot商城1. Arduino更傾向于創(chuàng)意,它弱化了具體的硬件的操作,它的函數(shù)...
    發(fā)表于 01-24 07:14

    關(guān)于STM32各系列MCU性能對(duì)比及測(cè)試說明

    STM32各系列MCU性能對(duì)比及測(cè)試說明
    的頭像 發(fā)表于 03-04 10:20 ?1.3w次閱讀

    高頻型直流充電機(jī)性能對(duì)比檢驗(yàn)試驗(yàn)總結(jié)報(bào)告

    高頻型直流充電機(jī)性能對(duì)比檢驗(yàn)試驗(yàn)總結(jié)報(bào)告(開關(guān)電源技術(shù)課程設(shè)計(jì))-高頻型直流充電機(jī)性能對(duì)比檢驗(yàn)試驗(yàn)總結(jié)報(bào)告? ? ? ? ? ?
    發(fā)表于 08-31 19:55 ?19次下載
    高頻型直流充電機(jī)<b class='flag-5'>性能對(duì)比</b>檢驗(yàn)試驗(yàn)總結(jié)報(bào)告

    什么格式是保存Pandas數(shù)據(jù)的最好格式

    在數(shù)據(jù)分析相關(guān)項(xiàng)目工作時(shí),我通常使用Jupyter筆記本和pandas庫來處理和傳遞我的數(shù)據(jù)。對(duì)于中等大小的數(shù)據(jù)集來說,這是一個(gè)非常直接的過程,你甚至可以將其存儲(chǔ)為純文本文件而沒有太多的開銷。 然而
    的頭像 發(fā)表于 10-30 15:05 ?741次閱讀
    什么<b class='flag-5'>格式</b>是保存<b class='flag-5'>Pandas</b>數(shù)據(jù)的最好<b class='flag-5'>格式</b>

    如何實(shí)現(xiàn)PandasDataFrame轉(zhuǎn)換交互式表格

    Pivottablejs是一個(gè)通過IPython widgets集成到Python中的JavaScript庫,允許用戶直接從DataFrame數(shù)據(jù)創(chuàng)建交互式和靈活的匯總報(bào)表??梢赃M(jìn)行高效、清晰的數(shù)據(jù)分析和表示,幫助將數(shù)據(jù)從Pandas
    的頭像 發(fā)表于 11-21 16:15 ?897次閱讀
    如何實(shí)現(xiàn)<b class='flag-5'>Pandas</b>的<b class='flag-5'>DataFrame</b>轉(zhuǎn)換交互式表格

    ICL5101與ICL5102性能對(duì)比

    ICL5101與ICL5102性能對(duì)比-中文
    發(fā)表于 06-17 14:26 ?1次下載