C++如何利用CUDA实现简单的数组并行加法

风磊君_4127

风磊君_4127

2026-07-26

298人浏览

原创

必须显式同步,否则 cudamemcpy 读到未计算的脏数据;加法 kernel 需用 global 标记、无返回值、通过线程索引计算并越界检查。

c++如何利用cuda实现简单的数组并行加法

为什么直接用 cudaMemcpy 传数组却得不到正确结果?

常见错误是只调用 cudaMemcpy 把数据从主机拷到设备,但没等 GPU 内核执行完就立刻把结果拷回主机——此时 cudaMemcpy 默认是同步的,但内核本身是异步的,结果就是读到未计算的脏数据。必须显式同步,或改用 cudaMemcpy 的同步变体(如 cudaMemcpyDeviceToHost)配合 cudaDeviceSynchronize()。

  • 别依赖“写完 kernel>>() 就算执行完了”,它只是启动请求
  • cudaMemcpy 从设备读回主机时,若没同步,可能读到旧值或随机内存
  • 简单验证:在 kernel 后加一句 cudaDeviceSynchronize();,再 memcpy,就能看到正确结果

怎么写一个能被 GPU 正确调用的加法 kernel?

GPU kernel 不是普通函数,它不能有返回值、不能递归、参数只能是基本类型或指针,且需用 __global__ 标记。每个线程处理一个数组元素,靠 threadIdx.x + blockIdx.x * blockDim.x 算出全局索引,还要检查是否越界——因为启动配置的线程数可能多于数组长度。

__global__ void add_arrays(float* a, float* b, float* c, int n) {
    int idx = threadIdx.x + blockIdx.x * blockDim.x;
    if (idx 
  • 必须加 if (idx ,否则当 <code>n 不是 block size 整数倍时,会越界写入
  • 不要在 kernel 里用 printf 调试,输出不可靠;可用 cudaGetLastError() 检查 launch 错误
  • 参数传的是指针,不是数组引用或 std::vector —— GPU 无法直接访问主机 STL 容器

block 和 grid 尺寸怎么选才不卡死也不浪费?

选太小(比如 blockDim = 1),线程太少,GPU 大量计算单元闲置;选太大(比如超硬件限制),launch 失败报错 too many resources requested for launch。主流 GPU 通常支持每 block 最多 1024 个线程,常用 256 或 512;grid size 则由数组长度和 block size 推导而来。

C++ Code Review Master
C++ Code Review Master

组合式C++代码评审方案,融合静态分析、AI推理、多轮迭代评审和C++专项检查,适用于PR审查、增量代码审查、全项目评审和代码质量评分,触发词包括review cpp、cpp代码评审、C++review、代码审查。

下载
  • 推荐写法:int blockSize = 256;,int gridSize = (n + blockSize - 1) / blockSize;
  • 别硬写 gridSize = n / blockSize,整除会丢掉余数线程
  • 用 cudaGetDeviceProperties() 可查具体卡的 maxThreadsPerBlock,但日常开发用 256 基本通用

为什么 malloc 分配的内存不能直接给 GPU 用?

malloc 返回的是主机端可分页内存,GPU 访问慢且不保证一致性;必须用 cudaMalloc 分配设备内存,或用 cudaMallocHost 分配“页锁定”主机内存(适合频繁传输的小数据)。混淆这两者会导致 cudaMemcpy 失败,报错 invalid argument 或 memory access violation。

  • 设备指针必须来自 cudaMalloc,主机指针必须来自 malloc 或 cudaMallocHost
  • 传错指针类型(比如把 host 指针传给 kernel)不会编译报错,但运行时崩溃
  • 记得配对释放:cudaFree 对应 cudaMalloc,free 对应 malloc

实际跑通的关键点就三个:用 cudaMalloc 分配设备内存、写带边界检查的 <strong>global</strong> kernel、kernel 后加 cudaDeviceSynchronize()。其余都是围绕这三件事做安全校验和资源管理。

C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!

相关文章

PHP速学视频免费教程(入门到精通)
PHP速学视频免费教程(入门到精通)

PHP怎么学习?PHP怎么入门?PHP在哪学?PHP怎么学才快?不用担心,这里为大家提供了PHP速学教程(入门到精通),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
c++和c语言的区别有哪些
c++和c语言的区别有哪些

c++和c语言的区别:1、面向对象编程(OOP)支持不同;2、新增特性不同;3、标准库不同;4、编译方式不同;5、命名空间不同等等。想了解更多c++的相关内容,可以阅读本专题下面的文章。

2024.03.14

2208

9

c++和python学习顺序推荐
c++和python学习顺序推荐

一般建议先学习C++,再学习Python,因为这样可以逐步从较为底层的编程语言向更高级的语言过渡。想了解更多python的相关内容,可以阅读本专题下面的文章。

2024.03.14

999

6

python和c++学习性价比分析
python和c++学习性价比分析

Python易于学习,广泛应用于Web开发、数据科学和人工智能等领域,但性能较低。C语言性能高,适用于对性能要求较高的场景,如游戏开发和系统编程,但学习曲线陡峭,错误处理复杂。想了解更多python的相关内容,可以阅读本专题下面的文章。

2024.03.14

407

5

c语言和c++一样吗
c语言和c++一样吗

c语言和c++是两种不同的编程语言,虽然有相似之处,但存在显著差异。c语言专注于过程式编程和系统级开发,以简洁、高效著称。c++作为c语言的超集,引入了面向对象编程,增强了代码组织和管理能力,但学习曲线也更陡峭。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.03.14

307

5

c语言和c++先学哪个好
c语言和c++先学哪个好

初学者选择学习c语言还是c++语言,需要根据个人学习目标、背景以及编程兴趣和预期应用方向来决定。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.03.14

386

5

c语言和c++的区别和联系
c语言和c++的区别和联系

c语言和c++是计算机科学领域应用广泛的编程语言。虽然它们有着相似的基础,但它们在语言类型、语法功能和内存管理方面存在着显著差异。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.03.14

580

5

c++软件中文更改教程
c++软件中文更改教程

对于 ide,可通过打开设置,找到语言设置,选择中文,并保存更改。对于非 ide 应用程序,可查找设置或选项,选择语言设置,更改为中文,并保存更改。想了解更多c++的相关内容,可以阅读本专题下面的文章。

2024.03.21

1389

9

python和java和c++学习性价比分析
python和java和c++学习性价比分析

Python以其易学性、丰富的库和活跃的社区而著称,适合数据科学、人工智能和Web开发。Java以其跨平台性、企业级应用开发和Android应用开发而闻名。C++以其底层控制能力、高效性能和游戏开发而著称。选择哪种语言取决于个人兴趣、职业方向和特定需求。想了解更多python和java和c++的相关内容,可以阅读本专题下面的文章。

2024.03.22

1197

7

c++和c语言学习顺序推荐
c++和c语言学习顺序推荐

对于初学者,建议先学习C语言,掌握编程基础后再转入C++,便于理解面向对象编程概念。有编程经验者可直接学习C++,快速接触高级编程技术。想了解更多c++和c语言的相关内容,可以阅读本专题下面的文章。

2024.03.25

1325

9

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Conan 2 Essentials 免费课程
Conan 2 Essentials 免费课程

共0课时 | 0人学习

CMake 与 Conan 集成实践
CMake 与 Conan 集成实践

共0课时 | 0人学习

Conan 2 高级依赖模型介绍
Conan 2 高级依赖模型介绍

共0课时 | 0人学习