⚡ 本页包含 AI 生成的分析内容,仅供参考
本文提出QUEST,一种基于对数量化(log-quantized)的多用途DNN推理引擎,通过电感耦合技术堆叠在96MB 3D SRAM上,解决了传统DRAM堆叠方案中延迟过大的问题,实现了7.49TOPS的高性能推理。
Shinya Takamaeda-Yamazaki1, Junichiro Kadomoto2, Tomoki Miyata2, Mototsugu Hamada2, Tadahiro Kuroda2, Masato Motomura1 Hokkaido University, Sapporo, Japan Keio University, Yokohama, Japan 1 2 A key consideration for deep neural network (DNN) inference accelerators is the need for large and high-bandwidth external memories. Although an architectural concept for stacking a DNN accelerator with DRAMs has been proposed previously, long DRAM latency remains problematic and limits the performance
Kodai Ueyoshi1, Kota Ando1, Kazutoshi Hirose1,