ISSCC 2020Session 7AI / ML
该论文提出了一种名为GANPU的多DNN训练处理器,用于生成对抗网络(GAN)的训练,通过推测性双稀疏性开发实现了135TFLOPS/W的高能效。它解决了GAN训练中计算密集和内存访问频繁的问题,显著提升了移动设备上GAN应用的性能。
▸提出推测性双稀疏性开发技术,同时利用权重和激活值的稀疏性来减少计算和内存访问。
▸设计了一种多DNN训练架构,支持生成器和判别器的交替训练,优化了流水线效率。
ISSCC 2018Session 13AI / ML
提出了一种名为UNPU的统一深度神经网络加速器,支持1b到16b完全可变的权重位精度,能够高效加速卷积层、全连接层和循环层,解决了现有加速器仅支持部分层类型的问题,实现了50.6TOPS/W的高能效。
▸提出统一架构,同时支持卷积层、全连接层和循环层,无需分离处理单元。
▸实现1b到16b完全可变的权重位精度,灵活适应不同精度需求。