小数组循环赋值更快,因指令精简、无分支开销且缓存命中率高;中等规模(64b–4kb)memcpy占优,因其支持sse/avx加速和成熟预取;大数组性能取决于内存对齐、分块策略及避免伪共享。

数组拷贝是否缓存友好,关键不在“是不是数组”,而在于拷贝时的内存访问模式是否连续、是否对齐、是否匹配缓存行(通常64字节)。
小数组:循环赋值常比 memcpy 更快
当拷贝长度 ≤ 64 字节(一个缓存行),数据大概率全程驻留在 L1 缓存中。此时简单展开的循环赋值(如逐个 mov)反而有优势:
- 指令精简,几乎全在指令缓存中命中,无分支预测开销
- 源和目标地址都短,CPU 预取器能准确推测后续访问,一次加载即覆盖全部数据
- memcpy 的函数调用开销、参数检查、通用路径判断反而成了负担
中等规模(64B–4KB):memcpy 明显占优
这个区间已超出单个缓存行,但仍在 L1/L2 容量范围内。memcpy 的优势开始显现:
- 内建硬件加速(如 SSE/AVX 指令)可一次搬移 16–64 字节
- 预取逻辑成熟,能提前拉入后续缓存行,维持高命中率
- 避免了手写循环中可能引入的地址计算、边界检查等额外指令
大数组(>4KB):缓存局部性决定实际吞吐
此时拷贝性能不再由“用不用 memcpy”决定,而取决于内存布局与访问节奏:
- 若数组起始地址未对齐(如偏移 17 字节),首个缓存行读取会跨两个物理行,浪费带宽
- 连续拷贝本身天然友好,但若目标区域正在被其他线程频繁写入,可能引发伪共享(false sharing)
- 分块拷贝(如每次 2KB)比一次性大拷贝更利于 L3 缓存驻留,减少驱逐压力
真正影响缓存效率的实操细节
比起选 memcpy 还是 for 循环,以下几点对缓存友好度影响更大:
- 地址对齐:用 aligned_alloc 或 __attribute__((aligned(64))) 确保源/目标起始地址是 64 字节倍数
- 避免跨行结构体:若拷贝结构体数组,确保 sizeof(struct) 是 64 的整数倍或通过 padding 对齐
- 顺序优先:永远按内存物理顺序拷贝,不要跳读(如 stride=2)、不要 scatter 写入
- 控制并发干扰:多线程环境下,避免多个线程同时写同一缓存行内的不同字段











