パンダの文字列操作を高速化する

高速化するパンダの文字列操作

このチュートリアルでは、文字列の操作を高速化することに焦点を当てています。

私は飽きたので、文字列の操作方法とそれらがパンダのデータフレームのパフォーマンスにどのように影響するかをベンチマークしました。よく知られているように、パンダのデータフレームはある限界を超えると奇妙な振る舞いをします。主にメモリの圧力に依存しており、また複数の行からの要素を一度に操作する際にもオーバーヘッドが発生します。

さて、ここで実験内容です。

Fakerを使用してデータフレームを作成しました。ベースデータは10万行のフェイクデータです。

セットアップ

!pip install faker

import pandas as pd
import numpy as np
def gen_data(x):
  from faker import Faker
  fake = Faker()
  outdata = {}
  for i in range(0,x):
    outdata[i] = fake.profile()
  return pd.DataFrame(outdata).T
n = 100000
basedata = gen_data(n)

出力をGoogleドライブに保存しました。

from google.colab import drive
drive.mount('/content/drive')

2つの文字列を連結するさまざまな方法をテストするために非常にシンプルな関数を作成しました。

def process(a,b):
  return ''.join([a,b])
def process(a,b):
  return a+b
def process(a,b):
  return f"{a}{b}"
def process(a,b):
  return f"{a}{b}"*100

次に、空のデータフレームを作成し、%%timeitの出力を行としてデータフレームに追加する関数を作成しました。

# %%timeitの出力を行としてデータフレームに追加する
def add_to_df(n, m, x, outputdf):
  outputdf.loc[len(outputdf.index)] = [m, n, x]
# 出力フレーム
outputdf = pd.DataFrame(columns=['method', 'n', 'timing'])
outputdf

以下は、各関数を実行し、データをパンダのデータフレームにエクスポートするためのコードのサンプルです。

# データのサンプルを取得
n = 10000
suffix = 'fstring_100x'
data = basedata.copy().sample(n).reset_index()

%%timeit -r 7 -n 1 -o
data['newcol'] = ''
for row in range(len(data)):
  data.at[row ,'newcol'] = process(data.at[row, 'job'], data.at[row, 'company'])
# 451 ms ± 34 ms per loop (mean ± std. dev. of 7 runs, 1 loop each)
# <TimeitResult : 451 ms ± 34 ms per loop (mean ± std. dev. of 7 runs, 1 loop each)>

m = "行を反復処理する"
add_to_df(n = n, m = m, x = vars(_), outputdf = outputdf)

実験

We will continue to update VoAGI; if you have any questions or suggestions, please contact us!

Share:

Was this article helpful?

93 out of 132 found this helpful

Discover more

人工知能

「ジャスティン・マクギル、Content at Scaleの創設者兼CEO - インタビューシリーズ」

ジャスティンは2008年以来、起業家、イノベーター、マーケターとして活動しています彼は15年以上にわたりSEOマーケティングを...

人工知能

エンテラソリューションズの創設者兼CEO、スティーブン・デアンジェリス- インタビューシリーズ

スティーブン・デアンジェリスは、エンタラソリューションズの創設者兼CEOであり、自律的な意思決定科学(ADS®)技術を用いて...

人工知能

「Ntropyの共同創設者兼CEO、ナレ・ヴァルダニアンについて - インタビューシリーズ」

「Ntropyの共同創設者兼CEOであるナレ・ヴァルダニアンは、超人的な精度で100ミリ秒以下で金融取引を解析することを可能にす...

データサイエンス

「David Smith、TheVentureCityの最高データオフィサー- インタビューシリーズ」

デビッド・スミス(別名「デビッド・データ」)は、TheVentureCityのチーフデータオフィサーであり、ソフトウェア駆動型のス...

AIニュース

OpenAIのCEOであるSam Altman氏:AIの力が証明されるにつれて、仕事に関するリスクが生じる

OpenAIのCEOであるSam Altmanは、特に彼の作品であるChatGPTに関するAIの潜在的な危険性について公言してきました。最近のイ...

人工知能

「Ami Hever、UVeyeの共同創設者兼CEO - インタビューシリーズ」

עמיר חבר הוא המנכל והמייסד של UVeye, סטארט-אפ ראיה ממוחשבת בלמידה עמוקה, המציבה את התקן הגלובלי לבדיקת רכבים עם זיהוי...