• 使用SIMD指令加速计算


    SIMD即单指令多数据流(Single Instruction Multiple Data)指令集,是通过一条指令同时对多个数据进行运算的硬件加速技术,在传统计算,中使用标量运算一次只能对一对数据执行乘法操作,但是如果使用了SIMD加速,可同时对多对数据进行执行操作,常见的有x86体系下的sse/avx等

    传统标量计算:

     SIMD加速计算:

     

    这个过程和现代GPU计算有着相通之处,极大的利用并行计算能力

    这个过程及其相似与向量计算过程,数据组织的时候,尽量将数据组织成纵向化或者向量化

     同样一条指令下面,并行进行了四个乘法计算,这一过程可以大大加速运算流程,在go语言源码中利用了大量该类计算方法

    间隔简单的使用方法:

    1. #include<stdio.h>
    2. #include<emmintrin.h>
    3. int main()
    4. {
    5. __m128 v1 = _mm_set_ps(1.0f, 2.0f, 3.0f, 4.0f);
    6. __m128 v2 = _mm_set_ps(5.0f, 6.0f, 7.0f, 8.0f);
    7. __m128 result = _mm_add_ps(v1, v2);
    8. printf("%f,%f,%f,%f",result[3],result[2],result[1],result[0]);
    9. }

    下面将举个例子利用流水线加速128组浮点数的加运算,来看看没有加速下的运行效率和使用SIMD优化下的效率

    传统方式实现10000次128组浮点数的加法:

    1. #include<iostream>
    2. #include <chrono>
    3. #define FNUM 128
    4. int main()
    5. {
    6. clock_t start,end;
    7. static_assert(FNUM%4==0, "error");
    8. float data0[FNUM];
    9. float data1[FNUM];
    10. float data2[FNUM];
    11. std::chrono::steady_clock::time_point now = std::chrono::steady_clock::now();
    12. for(int x=0;x<10000;++x)
    13. {
    14. for(int i=0;i<FNUM;++i)
    15. {
    16. data2[i]=data1[i]+data0[i];
    17. }
    18. }
    19. auto t2 = std::chrono::steady_clock::now();
    20. std::chrono::duration<double> time_span = std::chrono::duration_cast<std::chrono::duration<double>>(t2 - now);
    21. std::cout<<time_span.count()<<std::endl;
    22. }

    由于现代计算机速度非常快,所以将这个过程执行10000次,以获取更加准确的时间

    时间如下: 

    通过SIMD实现10000次128组浮点数的加法:

    1. #include<iostream>
    2. #include <chrono>
    3. #include<emmintrin.h>
    4. #define FNUM 128
    5. using namespace std;
    6. using namespace std::chrono;
    7. int main()
    8. {
    9. static_assert(FNUM%4==0, "error");
    10. float data0[FNUM];
    11. float data1[FNUM];
    12. float data2[FNUM];
    13. int step=FNUM/4;
    14. std::chrono::steady_clock::time_point now = std::chrono::steady_clock::now();
    15. for(int i=0;i<10000;i++)
    16. {
    17. for(int i=0;i<step;++i)
    18. {
    19. __m128 v1 = _mm_set_ps(data0[i*step+0],data0[i*step+1],data0[i*step+2],data0[i*step+3]);
    20. __m128 v2 = _mm_set_ps(data1[i*step+0],data1[i*step+1],data1[i*step+2],data1[i*step+3]);
    21. __m128 result = _mm_add_ps(v1, v2);
    22. }
    23. }
    24. auto t2 = std::chrono::steady_clock::now();
    25. std::chrono::duration<double> time_span = std::chrono::duration_cast<std::chrono::duration<double>>(t2 - now);
    26. std::cout<<time_span.count()<<std::endl;
    27. }

    时间如下:

    流水线加速和传统方法一样可能的原因:

    在一些情况下,使用了流水线加速后计算速度可能会一样变得比原来更慢,原因在于现代编译器完成了大量优化工作,可能一些计算被编译器已经处理为了SIMD,所以会变得非常快

  • 相关阅读:
    嵌入式分享合集105
    python - 内存池的机制
    R2DBC正式孵化成功,利好Spring Webflux
    正则验证用户名和跨域postmessage
    记一道前端高难度面试题
    考研复习之数据结构笔记(十四)查找(中)(动态查找树表:二叉排序树、平衡二叉树、B树、B+树)
    机器学习(第三章)—— 经典算法
    【Flutter】包管理(9)Flutter cached_network_image 解决网络图片加载和缓存问题的终极指南
    大数据从入门到精通(超详细版)之Hive的案例实战,ETL数据清洗!!!
    如何确认栈中申请的变量地址
  • 原文地址:https://blog.csdn.net/qq_36653924/article/details/126543185