【发布时间】:2015-05-25 15:38:44
【问题描述】:
我对 Python 比较陌生,对 C 完全一无所知(不幸的是),所以我很难正确理解使用 Cython 的某些方面。
在分析了一个 Python 程序并发现它只是几个大部分时间都在占用的循环之后,我决定考虑将它们转储到 Cython 中。最初,我只是让 Cython 按原样解释 Python,结果是(显着!)~2 倍的速度提升。酷!
在 Python 主程序中,我向函数传递了两个二维数组(“a”和“b”)和一个浮点数“d”,它返回一个列表“newlist”。举例:
a =[[12.7, 13.5, 1.0],[23.4, 43.1, 1.0],...]
b =[[0.46,0.95,0],[4.56,0.92,0],...]
d = 0.1
这是原始代码,只是为 Cython 添加了 cdef:
def loop(a, b, d):
cdef int i, j
cdef double x, y
newlist = []
for i in range(len(a)):
if b[i][2] != 1:
for j in range(i+1,len(a)):
if a[i] == a[j] and b[j][2] != 1:
x = b[i][0]+b[j][0]
y = b[i][1]+b[j][1]
b[i][2],b[j][2] = 1,1
if abs(y)/abs(x) > d:
if y > 0: newlist.append([a[i][0],a[i][1],y])
return newlist
在“纯 Python”中,这在大约 12.5 秒内运行(有数万次循环)。在 Cython 中,它的运行时间约为 6.3 秒。近乎为零的工作取得了巨大进展!
但是,稍微阅读一下,很明显可以做很多很多事情,所以我开始尝试应用一些类型更改以使事情进展得更快,遵循 Cython 文档,here(也被引用在 cmets 中)。
以下是收集的修改,旨在模仿 Cython 文档:
import numpy as np
cimport numpy as np
DtypeA = np.float
DtypeB = np.int
ctypedef np.float_t DtypeA_t
ctypedef np.int_t DtypeB_t
def loop(np.ndarray[DtypeA_t, ndim=2] A,
np.ndarray[DtypeA_t, ndim=2] B,
np.ndarray[DtypeB_t, ndim=1] C,
float D):
cdef Py_ssize_t i, j
cdef float x, y
cdef np.ndarray[DtypeA_t, ndim=2] NEW_ARRAY = np.zeros((len(C),3), dtype=DtypeA)
for i in range(len(C)):
if C[i] != 1:
for j in range(i+1,len(C)):
if A[i][0]==A[j][0] and A[i][1]==A[j][1] and C[j]!= 1:
x = B[i][0]+B[j][0]
y = B[i][1]+B[j][1]
C[i],C[j] = 1,1
if abs(y)/abs(x) > D:
if y > 0: NEW_ARRAY[i]=([A[i][0],A[i][1],y])
return NEW_ARRAY
除此之外,我将先前的数组“b”拆分为两个不同的输入数组“B”和“C”,因为“b”的每一行包含 2 个浮点元素和一个仅用作标志的整数。所以我删除了标志整数并将它们放在一个单独的一维数组“C”中。所以,输入现在看起来像这样:
A =[[12.7, 13.5, 1.0],[23.4, 43.1, 1.0],...]
B =[[0.46,0.95],[4.56,0.92],...]
C =[0,0,...]
D = 0.1
理想情况下,现在输入所有变量时,这应该会更快(?)...但显然我做错了什么,因为函数现在在 35.3s 的时间出现...更糟糕的是比“纯 Python”!!
我搞砸了什么?感谢阅读!
【问题讨论】:
-
是的,我尽我所能模仿那里的建议,但我不确定如何处理附加列表...
-
我会试着弄清楚代码到底做了什么,但我现在猜测使用向量化的 numpy 操作可能会有所帮助
-
你能把你的数据发布到某个地方吗?
-
我建议进行一些算法改进。例如,按字典顺序对
a进行排序将显示a的哪些行相等,从而避免代价高昂的双循环,并可能让您摆脱似乎用来标记行的b列已处理。