关于cuda拷贝的速度测试

由于没有使用profiler,仅仅通过简单的传输函数测试，如下测试了10000个点，1000000个点，100000000个点的速度：

均按时钟周期来计时，通过MAX调整数据

int main(){
    clock_t start,finish;

    int *d_data,*h_data;
    h_data = (int *)calloc(MAX, sizeof(int));
    memset(h_data,0,MAX*sizeof(int));
    cudaMalloc((void **) &d_data,MAX*sizeof(int));


    start = clock();
    cudaMemcpy(d_data,h_data,MAX*sizeof(int),cudaMemcpyHostToDevice);
    cudaMemcpy(h_data,d_data,MAX*sizeof(int),cudaMemcpyDeviceToHost);
    finish = clock();


    cudaFree(d_data);
    free(h_data);
    cout<<"time is "<<finish-start<<endl;
    getchar();
return 0;
}

测试结果

测试结果	10,000个节点	1,000,000个节点	100,000,000个节点
第一次测试	0	7	822
第二次测试	0	8	715
第三次测试	1	7	696

测试图表如下：

所以在小批量数组的情况下，完全可以在cpu中完成数据操作，然后device上面做简单的加和或者乘积运算。

posted @ 2013-10-30 16:51 xingoo 阅读(1231) 评论(0) 编辑收藏举报

刷新页面返回顶部

xingoo

关于cuda拷贝的速度测试

公告