c++ - 从四个 __m128i 变量的 64 高位或低位初始化 __m256i

标签 c++ sse simd avx avx2

假设我有四个 __m128i 变量,其中包含一些计算产生的数据。例如,让我们说:

__m128i a = _mm_set_epi64x(1, 11);
__m128i b = _mm_set_epi64x(2, 22);
__m128i c = _mm_set_epi64x(3, 33);
__m128i d = _mm_set_epi64x(4, 44);

我想初始化两个 __m256i 变量,其中第一个包含四个变量的所有高 64 位,第二个包含每个变量的低 64 位。所以我想要:

__m256i x = ...; // x = { 4, 3, 2, 1 };
__m256i y = ...; // y = { 44, 33, 22, 11 };

这样做的明显方法是使用 _mm256_set_epi64x_mm_extract_epi64。但是,它可能不是特别快。有更快的方法吗?特别是,对于访问高 64 位,我没有看到合适的负载(SSE2 中有低 64 位的负载)或随机播放指令(似乎没有“64 位随机播放”)。

最佳答案

如果我没听错的话,这是一个简单的 4x2 转置(或 2x4 转置?)。

这是对我有用的代码:

#include <iostream>
#include <immintrin.h>

using namespace std;
int main() {
    __m128i a = _mm_set_epi64x(1, 11);
    __m128i b = _mm_set_epi64x(2, 22);
    __m128i c = _mm_set_epi64x(3, 33);
    __m128i d = _mm_set_epi64x(4, 44);

    __m256i ac = _mm256_castsi128_si256(a);
    ac = _mm256_inserti128_si256(ac, c, 1); // {3, 33, 1, 11}

    __m256i bd = _mm256_castsi128_si256(b);
    bd = _mm256_inserti128_si256(bd, d, 1); // {4, 44, 2, 22}

    __m256i high = _mm256_unpackhi_epi64(ac, bd);
    __m256i low = _mm256_unpacklo_epi64(ac, bd);

    uint64_t t[4];

    _mm256_storeu_si256((__m256i*) t, high);

    for (int i = 0; i < 4; ++i) {
        cout << t[i] << endl;
    }

    _mm256_storeu_si256((__m256i*) t, low);

    for (int i = 0; i < 4; ++i) {
        cout << t[i] << endl;
    }

    return 0;
}

这应该编译成 4 条指令。

关于c++ - 从四个 __m128i 变量的 64 高位或低位初始化 __m256i,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/24594026/

相关文章:

java - 具有类 Java API 的 C++ 库

intel - x86 兼容加速器 Intel Xeon Phi 中是否有 SIMD(SSE/AVX)指令?

c - 是否有一个内部函数可以将 __m128i vector 的最后 n 个字节清零?

c - x86_64 SSE 对齐 : differences between GCC and Clang

c++ - 自动售货机c++

c++ - 在 C++ 程序中评估从 max 导出的 3d 样条曲线

c++ - 删除 vector 时出现段错误

c++ - 有效地矢量化图像 block 处理?

c++ - "SSE 4.2 insanity"提案文件中的 "if consteval"是什么意思?

c++ - 在 AVX 内在函数 vec 中填充常量 float