【发布时间】:2020-03-02 12:38:44
【问题描述】:
我想在我的课堂上演示使用预先排序的概率进行抽样可以缩短执行时间。在下面的代码中,sample() 函数是工作的马。相同的随机变量分布以两种形式存储:未排序的概率(数组p 和x)和排序的概率(数组p1 和x1) - 请参阅main() 函数。循环迭代的计数器变量计数。
结果:使用(p,x) 输入,sample() 花费的时间是(p1, x1) 的两倍,但经过的执行时间相同甚至更长。我在家用笔记本电脑 Kubuntu 18.04 上尝试了 g++ 7.4.0 编译器,并在 (wandbox dot org) 尝试了不同的 g++ 版本,结果基本相同。
我不明白这怎么可能:更少的恒定时间迭代需要更长的时间。
代码:
#include <iostream>
#include <vector>
#include <cmath>
#include <cstdlib>
#include <ctime>
#include <chrono>
using namespace std;
inline double runif(){return rand()/double(RAND_MAX);}
double sample(double* p, double* x, int N, double u, unsigned long* count)
{
int k;
for(k=0; (k<N) && (u>p[k]); k++, (*count)++)
u -= p[k];
return x[k];
}
double sample_alias(double* p, double* x, int N, double u)
{
double u1 = u * N;
int K = floor(u1);
double u2 = u1 - K;
return (u2<p[K]) ? *(x+2*K) : *(x+2*K+1);
}
int main()
{
double p[] = {0.2, 0.05, 0.125, 0.5, 0.125};
double x[] = {0, -3, 1, -2, 3};
double p1[] = {0.5, 0.2, 0.125, 0.125, 0.05};
double x1[] = {-2, 0, 3, 1, -3};
double sum;
unsigned long counter;
#define NN 4000000
double *u;
u = (double*)calloc(NN, sizeof(double));
if(u==NULL) perror("Not enough mem!");
srand(5647892);
for (int i=0; i<NN; i++) u[i]=runif();
cout << "Test 1 (unsorted)" << endl;
sum=0.0; counter = 0;
auto begt = std::chrono::steady_clock::now();
for(int i=0; i<NN; i++) sum+=sample(p,x,5,u[i], &counter);
auto endt = std::chrono::steady_clock::now();
auto elapsed = endt - begt;
cout<<sum/double(NN)<<endl<<"Run took "<<elapsed.count()<<", total loop: "<< counter<<endl;
cout << "Test 1 (sorted)" << endl;
sum=0.0; counter = 0;
begt = std::chrono::steady_clock::now();
for(int i=0; i<NN; i++) sum+=sample(p1,x1,5,u[i],&counter);
endt = std::chrono::steady_clock::now();
elapsed = endt - begt;
cout<<sum/double(NN)<<endl<<"Run took "<<elapsed.count()<<", total loop: "<< counter<<endl;
free(u);
return 0;
}
我的测试输出:
Test 1 (unsorted)
-0.650426
Run took 32114525, total loop: 9205058
Test 1 (sorted)
-0.649237
Run took 40915156, total loop: 4101917
【问题讨论】:
-
你使用什么构建标志?
-
在获取
u的部分时,测试可能是外部循环上的内存绑定。内循环运行的速度有多快并不重要。 -
sample调用是否会为两个版本产生非常不同的结果? -
你好,弗朗索瓦!内存获取瓶颈听起来很可能。我已经在我的程序上尝试过 Perf 实用程序。以下是它的输出: './sample' 的性能计数器统计信息:374827383 个周期 664657 缓存引用 619055 缓存未命中 # 93,139 % of all cache-refs 我猜这种高速缓存未命中率意味着什么(究竟是什么? )。那么,如何才能绕过这个瓶颈呢?
-
我在
perf stat -ddd下运行它,它说排序后的版本会导致多出 50% 的分支未命中。