CUDA编程 基础与实践 学习笔记(十)

线程束(warp)
一个GPU由多个SM组成,一个SM上可以放多个线程块,不同线程块之间并行或顺序执行。一个线程块分为多个线程束,一个线程束由32个线程(有连续的线程号)组成。从更细粒度来看,一个SM以一个线程束为单位产生、管理、调度、执行线程。

在这里插入图片描述
福特架构之前,每个warp只有一个程序计数器,需要注意分支发散问题。一些严重的分支发散会极大降低性能。
从福特架构开始,引入了独立线程调度机制。书里关于这个感觉没有讲的特别明白,没有太搞清楚和分支发散的逻辑关系。
https://baijiahao.baidu.com/s?id=1567082220106634&wfr=spider&for=pc
https://blog.youkuaiyun.com/javastart/article/details/117371228
读完大概明白了,加入了独立线程调度机制后,可以允许线程的同步和通信,粒度更细,操作更灵活。会牺牲一点寄存器。并没有使分支分散变快或怎么样。
福特架构之前:__synthreads()可以使线程块同步
福特架构及之后:__synwarp()线程束内同步。原型为void __synwarp(unsigned mask=oxffffffff),全1表示所有线程同步。这个比__synthreads更快。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值