【问题标题】:pure python faster than numpy for data type conversion纯python的数据类型转换比numpy快
【发布时间】:2020-03-16 14:31:33
【问题描述】:

请原谅我的无知。

如果 numpy 提供了使计算速度更快的向量化操作,那么对于数据类型转换,纯 python 的速度如何提高近 8 倍?

例如

a = np.random.randint(0,500,100).astype(str)
b = np.random.randint(0,500,100).astype(str)
c = np.random.randint(0,500,100).astype(str)

def A(a,b,c):
    for i,j,k in zip(a,b,c):
        d,e,f = int(i), int(j), int(k)
        r = d+e-f
    return 

def B(a,b,c):
    for i,j,k in zip(a,b,c):
        d,e,f  = np.array([i,j,k]).astype(int)
        r = d+e-f
    return 

那么,

%%timeit 
A(a,b,c)

每个循环 249 µs ± 3.13 µs(7 次运行的平均值 ± 标准偏差,每次 1000 个循环)

%%timeit
B(a,b,c)

每个循环 1.87 ms ± 4.08 µs(平均值 ± 标准偏差,7 次运行,每次 1000 个循环)

谢谢你, 爱丽儿

【问题讨论】:

  • 这大错特错。如果其他人没有加入,我会在我进入桌面时进行解释。
  • 你在这里把苹果比作网球

标签: python performance numpy vectorization


【解决方案1】:

是的,NumPy 确实提供了矢量化操作,使计算速度比普通 Python 代码更快。但是,您并没有使用它们。

NumPy 旨在跨整个数据集执行操作,而不是跨数据集块的重复操作。后者导致在 Python 级别完成迭代,这将增加运行时间。

您的主要问题是您使用的唯一“矢量化”操作是astype,但您一次将它应用于三个元素,并且仍然像天真的 Python 解决方案一样循环。再加上您在循环的每次迭代中创建 numpy 数组会产生额外的开销,难怪您尝试使用 numpy 会更慢。

在小型数据集上,Python 可以更快,因为 NumPy 在创建数组、将对象传入和传出低级库等方面有开销。让我们看看你正在执行的转换操作一次使用三个元素:

%timeit np.array(['1', '2', '3']).astype(int)
5.25 µs ± 89.3 ns per loop (mean ± std. dev. of 7 runs, 100000 loops each)

%timeit np.array(['1', '2', '3'])
1.62 µs ± 42.9 ns per loop (mean ± std. dev. of 7 runs, 1000000 loops each)

超过四分之一的运行时间来自分配数组!将此与您的纯 Python 版本进行比较:

%timeit a, b, c = int('1'), int('2'), int('3')
659 ns ± 50.7 ns per loop (mean ± std. dev. of 7 runs, 1000000 loops each)

因此,如果您只对这种大小的块进行操作,Python 将击败 NumPy。


但是你的元素不止三个,所以 NumPy 可以用来显着加速你的代码,但是你需要改变你处理问题的心态。与其关注如何将操作应用于单个标量,不如考虑如何将其应用于数组


将这个问题向量化,大致思路是:

  • 创建一个包含所有值的数组
  • 使用单个 astype 调用将整个数组转换为 int
  • 提前进行元素运算,将所需的算术应用于数组。

它最终看起来像这样:

def vectorized(a, b, c):
    u = np.array([a, b, c]).astype(int)
    return u[0] + u[1] - u[2]

在比较正确使用 NumPy 的两种方法后,您将开始看到性能大幅提升。

def python_loop(a, b, c):
    out = []
    for i,j,k in zip(a,b,c):
        d,e,f = int(i), int(j), int(k)
        out.append(d+e-f)
    return out

a, b, c = np.random.randint(0, 500, (3, 100_000)).astype(str)

In [255]: %timeit vectorized(a, b, c)
181 ms ± 6.07 ms per loop (mean ± std. dev. of 7 runs, 10 loops each)

In [256]: %timeit python_loop(a, b, c)
206 ms ± 7.97 ms per loop (mean ± std. dev. of 7 runs, 10 loops each)

>>> np.array_equal(python_loop(a, b, c), vectorized(a, b, c))
True

从字符串转换为整数并不是 NumPy 做的比纯 Python 快得多的事情,从时间上可以看出,两者相当接近。但是,通过应用矢量化方法,比较至少要公平得多。

【讨论】:

    猜你喜欢
    • 2014-03-06
    • 1970-01-01
    • 2010-12-25
    • 2013-09-05
    • 1970-01-01
    • 2019-04-30
    • 2012-09-20
    • 1970-01-01
    • 2020-10-20
    相关资源
    最近更新 更多