核函数必须用__global__声明且返回类型为void;需手动计算线程索引;启动时用语法;数据须显式拷贝至gpu显存;执行后必须同步才能读取结果。

核函数必须用 __global__ 声明,且返回类型只能是 void
这是硬性语法限制,不是风格建议。nvcc 编译器在解析 .cu 文件时,只允许 __global__ 修饰的函数被 GPU 执行,且会拒绝编译任何非 void 返回类型的核函数。常见错误是照搬 CPU 函数写法,比如写成 __global__ int add(...),直接报错 error: return type of kernel function must be void。
核函数内不能调用标准 C++ I/O(如 std::cout),但可安全使用 printf(需配合 cudaDeviceSynchronize() 才能刷出输出);也不能用 new、malloc 或静态局部变量。
- 正确写法:
__global__ void vectorAdd(float* a, float* b, float* c, int n) - 错误写法:
__global__ float vectorAdd(...)、__device__ void helper()(没用__global__就不能被主机调用) - 线程索引计算必须手动写:
int idx = blockIdx.x * blockDim.x + threadIdx.x,别依赖循环变量
启动核函数要用 >> 语法,参数顺序不能颠倒
>> 是 CUDA 特有的执行配置语法,不是函数调用括号。第一个参数是 grid(线程块数量),第二个是 block(每块线程数)。写反了不会报错,但会导致大量线程越界或根本没执行——比如本该用 >> 处理 262144 个元素,若写成 >>,则每个块要启 1024 个线程,而多数消费级 GPU 单块最多支持 1024 线程,但实际 warp 对齐和资源限制会让部分线程失效。
组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。
- 常用配置:对 N 元素数组,设
blockSize = 256,gridSize = (N + blockSize - 1) / blockSize(向上取整) - 避免用
>>:单块 N 线程极易超限,且不满足 warp(32线程)对齐,性能极差 - 启动后立即检查错误:
cudaError_t err = cudaGetLastError(); if (err != cudaSuccess) printf("Kernel launch failed: %s\n", cudaGetErrorString(err));
数据必须显式拷贝到 GPU 显存,不能直接传 host 指针
GPU 无法直接访问 CPU 内存。把 float* h_a(主机指针)直接传给核函数 vectorAdd>>(h_a, ...) 不会崩溃,但读到的是垃圾值——因为核函数拿到的是 host 地址,而 GPU 去显存里找这个地址,结果是未定义行为。
- 正确流程:先
cudaMalloc(&d_a, size)分配设备内存 → 再cudaMemcpy(d_a, h_a, size, cudaMemcpyHostToDevice)拷贝 → 最后传d_a给核函数 - 方向参数必须匹配:
cudaMemcpyHostToDevice和cudaMemcpyDeviceToHost不能写错,否则数据“消失” - 小数组别图省事用统一内存(
cudaMallocManaged):首次访问会触发迁移,可能卡顿,且跨 CPU/GPU 访问有同步开销
执行完必须同步,否则 host 读到的是旧数据
核函数调用是异步的:CPU 发出启动指令后立刻往下走,不等 GPU 算完。如果紧接着就 cudaMemcpy 把结果拷回 host,或者直接打印 c[0],大概率拿到初始化值或上一轮结果——这不是 bug,是设计如此。
- 最简同步方式:
cudaDeviceSynchronize(),阻塞 CPU 直到所有 kernel 完成 - 更细粒度可用流(
cudaStream_t)+ 事件(cudaEvent_t),但初学者容易误用导致死锁 - 调试时加一句
assert(cudaGetLastError() == cudaSuccess)能提前暴露 kernel 内部越界等错误,比等结果错再排查快得多
核函数本身逻辑简单,真正容易出问题的是内存生命周期管理、同步时机和执行配置的组合效应——三个地方各错一点,现象可能是结果全零、程序卡死、或偶发崩溃,很难直接对应到某一行代码。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










