技术领域

Digital Processors

268 篇

ISSCC 2015Session 14Digital Processors
Hyojun Kim1, Jinwoo Sang2, Hyunik Kim1, Youngwoo Jo1,
提出一种采用参考倍乘时间数字转换器的5GHz数字分数N锁相环,实现了-95dBc参考杂散和9.5mW功耗,解决了传统DPLL中量化噪声高和模块噪声要求严格的问题。
采用参考倍乘架构,提高ΔΣ调制器过采样率,将量化噪声推向高频,无需复杂噪声消除。
通过降低分频值,放宽PLL构建模块的噪声要求,实现低功耗设计。
ISSCC 2015Session 14Digital Processors
Anastacia Alvarez, Wenfeng Zhao, Massimo Alioto
该论文提出了一种静态物理不可克隆函数(PUF)用于安全芯片识别,通过利用本地工艺变化生成芯片特有的密钥,解决了芯片伪造和轻量级认证中的安全问题。实现了低于2%的原生比特不稳定性,并显著提高了能效。
提出了一种静态PUF设计,通过电路原理放大本地工艺变化并抑制全局PVT变化,实现高可靠性和低能耗。
实现了15fJ/b的超低能耗和140倍的能效提升,同时保持低于2%的原生比特不稳定性。
ISSCC 2015Session 14Digital Processors40nm CMOS
Kaiyuan Yang, Qing Dong, David Blaauw, Dennis Sylvester
该论文提出了一种基于振荡器崩溃的物理不可克隆函数(PUF),在40nm CMOS工艺中实现了低于10^-8的误码率(BER),用于鲁棒的芯片认证。通过利用振荡器崩溃现象,该PUF能够生成唯一且稳定的芯片响应,解决了传统PUF在环境变化下可靠性低的问题。
提出基于振荡器崩溃的新型PUF结构,利用振荡器在特定条件下的崩溃行为产生唯一响应,提高了PUF的稳定性和可靠性。
实现了低于10^-8的极低误码率,显著优于传统PUF,无需纠错码即可满足高可靠性芯片认证需求。
ISSCC 2015Session 14Digital Processors
Wei Deng, Dongsheng Yang, Aravind Tharayil Narayanan,
提出一种采用软注入锁定技术的全可综合分数-N PLL,面积仅0.048mm²,功耗3mW。解决了传统分数-N PLL需要时间数字转换器(TDC)而不利于数字综合流程的问题,实现了低功耗小面积的全数字设计。
采用软注入锁定技术实现分数-N操作,避免使用TDC,使得PLL完全可综合,便于SoC集成。
在极小的芯片面积(0.048mm²)和低功耗(3mW)下实现了分数-N锁相环,适合嵌入式应用。
ISSCC 2014Session 5Digital Processors22nm CMOS
Nasser Kurd, Muntaquim Chowdhury, Edward Burton,
本文介绍了Intel第四代Core处理器Haswell系列,基于22nm Tri-gate工艺,旨在实现平台集成和低功耗,以支持更小的设备形态。该处理器集成了CPU、内存控制器和平台控制器集线器(PCH)等多个模块。
采用22nm Tri-gate工艺,提升性能和能效
高度平台集成,将PCH、内存控制器等整合到处理器中,减小芯片组面积
ISSCC 2014Session 5Digital Processors
Alfred Yeung, Hamid Partovi, Qawi Harvard, Luca Ravezzi,
该论文提出了一款基于40nm Bulk CMOS工艺、主频达3GHz的64位ARM v8处理器Potenza,用于X-Gene服务器平台。通过模块化设计(PMD)实现可扩展性,每个PMD包含两个核心和256KB L2缓存,功耗为4.5W,解决了服务器级高性能与低功耗的平衡问题。
首次实现64位ARM v8架构的服务器级处理器,支持3GHz高频运行。
采用可扩展的模块化设计(PMD),每个模块集成双核与L2缓存,便于不同服务器配置复用。
ISSCC 2014Session 5Digital Processors22nm CMOS
Featuring Adaptive Clocking, Selective Boosting, and State-Retentive Sleep
论文提出了一种在22nm CMOS工艺中实现的图形执行核心,采用了自适应时钟、选择性升压和状态保持睡眠等电路技术,实现了从低电压高效运行到高性能需求的动态调整,解决了功耗与性能的平衡问题。
自适应时钟技术,根据工作负载动态调整时钟频率,以优化能效。
选择性升压技术,在需要高性能时局部提升电压,而其他部分保持低电压。
ISSCC 2014Session 5Digital Processors28nm CMOS
Aaron Grenat1, Sanjay Pant1, Ravinder Rachala1, Samuel Naffziger2
该论文提出了一种自适应时钟系统,用于应对高性能微处理器中因负载变化导致的电源电压波动问题。通过动态调整时钟频率,该系统减少了传统设计中为应对电压波动而预留的10-15%电压裕量,从而在28nm x86-64微处理器上显著提升了能效。
提出自适应时钟系统,根据实时电压波动动态调整时钟频率,替代传统固定电压裕量方法。
在28nm x86-64微处理器上实现,通过减少电压裕量提升能效,同时保证正确执行。
ISSCC 2014Session 5Digital Processors28nm CMOS
Kevin Gillespie1, Harry R. Fair III1, Carson Henrion2, Ravi Jotwani3,
本文介绍了AMD在28nm HKMG工艺下实现的x86-64双核CPU模块“Steamroller”,包含2.36亿晶体管,工作电压0.8-1.45V,模块面积29.47mm²,集成了独立整数核、指令解码单元、共享取指单元、浮点单元和2MB L2缓存,旨在提升能效和性能。
采用28nm高κ金属栅极(HKMG)工艺,实现低功耗与高性能的平衡。
模块化设计,包含两个独立整数核和共享浮点单元,优化了多核处理效率。
ISSCC 2014Session 5Digital Processors22nm high-κ metal-gate tri-gate CMOS
Stefan Rusu, Harry Muljono, David Ayers, Simon Tam, Wei Chen,
该论文介绍了基于22nm三栅极工艺的15核企业级Xeon处理器家族Ivytown,采用双线程64位Ivybridge核心和37.5MB共享L3缓存。通过环形总线设计和灵活的系统拓扑支持,实现了从40W到150W的宽功耗范围和1.4GHz至3.8GHz的频率覆盖,满足了多样化产品需求。
采用22nm高κ金属栅极三栅极CMOS工艺,集成4.31B晶体管,在功耗和性能间取得平衡。
通过环形总线优化布局和延迟,支持15核与37.5MB共享L3缓存的高效互连。
ISSCC 2014Session 5Digital Processors
Phillip Restle1, David Shan2, David Hogenmiller2, Yong Kim2,
本文为IBM POWER8微处理器设计了一种宽频范围谐振时钟,通过在线模式切换实现两种谐振模式和非谐振模式,在2.5GHz至5GHz以上频率范围内节省时钟功耗。该设计由12个chiplet组成,每个chiplet包含一个核心和L2缓存的谐振时钟网格,以及L3缓存的半频率非谐振时钟网格。
提出了一种支持两种谐振模式和一种非谐振模式的谐振时钟架构,能够根据频率需求在线切换模式,从而在宽频率范围内优化功耗。
采用多chiplet结构,每个chiplet独立管理其核心和L2缓存的谐振时钟网格,L3缓存使用半频率非谐振时钟,实现灵活的分区时钟管理。
ISSCC 2014Session 5Digital Processors
Zeynep Toprak-Deniz1, Michael Sperling2, John Bulzacchelli1,
本文提出了一种分布式数字控制微调节器系统,用于实现POWER8微处理器的每核动态电压频率缩放(DVFS),以优化多核处理器的功耗性能。该系统通过集成电压调节模块(iVRM)提供成本有效的每核DVFS方案。
提出分布式数字控制微调节器架构,实现每核独立的电压调节。
将iVRM系统集成到POWER8微处理器中,支持精细化的DVFS控制。
ISSCC 2014Session 5Digital Processors22nm SOI
Eric J. Fluhr1, Joshua Friedrich1, Daniel Dreps1, Victor Zyuban2,
该论文介绍了IBM POWER8处理器,一款采用22nm SOI eDRAM技术的12核服务器级芯片,面积为649mm²。它解决了高性能服务器处理中核间通信和片外带宽瓶颈问题,实现了7.6Tb/s的片外总带宽。
采用22nm SOI eDRAM技术,在649mm²芯片上集成12个核心,实现高密度和高性能。
提供7.6Tb/s的片外带宽,通过优化的I/O和内存接口满足服务器级数据处理需求。
ISSCC 2014Session 16Digital Processors28nm/65nm CMOS
Kaiyuan Yang, David Fick, Michael B. Henry, Yoonmyung Lee,
该论文提出了一种全合成设计的真随机数发生器(TRNG),利用物理随机性作为熵源,在28nm和65nm CMOS工艺中实现。通过异步时钟采样和RC滤波技术,实现了23Mb/s的高吞吐率和23pJ/b的低能耗,解决了传统TRNG设计复杂、功耗高的问题。
采用全合成设计流程,无需定制电路,提高了设计效率和可移植性
通过异步时钟采样和RC滤波技术抑制电源噪声,提升随机数质量
ISSCC 2014Session 16Digital Processors0.18μm CMOS
Sanu K. Mathew, Sudhir K. Satpathy, Mark A. Anders, Himanshu Kaul,
这篇论文提出了一种混合型物理不可克隆函数(PUF)电路,结合SRAM PUF和门级PUF,实现了对工艺、电压、温度(PVT)变化的鲁棒性,能够在0.18μm CMOS工艺下以0.19pJ/b的能量效率生成100%稳定的密钥,解决了传统PUF在不同环境下稳定性差的问题。
提出了一种混合PUF架构,融合了基于SRAM和基于逻辑门的PUF设计,提高了随机性和稳定性。
通过PVT变化容忍的电路设计,实现了在宽温度、电压范围内100%的密钥生成稳定性。
ISSCC 2014Session 16Digital Processors22nm Tri-Gate CMOS
Gregory Chen, Mark A. Anders, Himanshu Kaul, Sudhir K. Satpathy,
该论文提出了一种在22nm三栅CMOS工艺下实现的16×16网络片上系统,采用源同步混合包/电路交换架构,工作电压范围从340mV到0.9V,总带宽达到20.2Tb/s。旨在解决传统同步NoC因全局时钟或时钟域交叉FIFO带来的高功耗和面积开销问题,为百核级异构计算提供高能效通信基础。
提出源同步混合包/电路交换架构,结合两者优势,降低全局时钟的功耗和面积开销。
实现宽电压范围(340mV-0.9V)工作,支持动态电压频率调节,提升能效。
ISSCC 2014Session 10Digital Processors28nm CMOS
Michael Breschel1, Peter Almers1, Fredrik Angsmark1,
该论文介绍了一款支持2G/3G/4G多标准及载波聚合的蜂窝调制解调器,采用28nm CMOS工艺实现。通过可编程DSP架构和SIMD操作,解决了多标准兼容与高吞吐量需求之间的矛盾。
提出了一种可编程DSP架构,支持每时钟周期100次操作,频率达416MHz,通过SIMD技术实现高吞吐量。
实现了多标准(2G/3G/4G)和载波聚合的集成,提升了频谱利用率和数据速率。
ISSCC 2014Session 10Digital Processors
Benedikt Noethen, Oliver Arnold, Esther Pérez Adeva, Tobias Seifert,
本文提出了一款面向4G通信的异构软件定义无线电(SDR)多处理器系统芯片(MPSoC),集成了多种处理单元,通过能量感知动态调度和迭代检测解码技术,在36mm2芯片面积内实现了105GOPS的峰值性能,有效解决了移动通信系统对灵活性与低功耗的冲突需求。
提出了一种异构SDR MPSoC架构,结合多种处理器类型(如DSP、加速器)以兼顾灵活性和能效。
设计了能量感知动态调度策略,根据任务需求和功耗约束实时分配计算资源,降低整体能耗。
ISSCC 2014Session 10Digital Processors40nm LP-CMOS
Christian Bachmann, Gert-Jan van Schaik, Benjamin Busze,
本文提出了一款工作在0.74V电压、功耗仅200µW的多标准收发器数字基带芯片,采用40nm LP-CMOS工艺,支持2.4GHz频段的Bluetooth Smart、ZigBee和IEEE 802.15.4标准,解决了超低功耗短距无线连接中多标准兼容与能量效率的矛盾。
通过超低电压(0.74V)数字电路设计实现了极低的功耗(200µW),显著降低电池供电设备的能源消耗。
在单一数字基带中集成Bluetooth Smart、ZigBee和IEEE 802.15.4三种标准,提升了多协议兼容性和系统灵活性。
ISSCC 2014Session 10Digital Processors90nm CMOS
Noboru Sakimura1,2, Yukihide Tsuji1, Ryusuke Nebashi1, Hiroaki Honjo1,
提出了一种90nm工艺、20MHz的全非易失微控制器,用于待机功耗关键型应用。该芯片基于FeRAM技术,实现了零待机功耗和快速唤醒,解决了传感器节点等应用中对低功耗和高性能的双重需求。
采用全非易失性设计(FeRAM),实现零待机功耗,避免了传统SRAM/Flash的泄漏问题。
支持20MHz工作频率下的快速唤醒(亚微秒级),兼顾低功耗和高响应速度。
ISSCC 2014Session 10Digital Processors28nm
Dual-GPU Design for Optimal Performance, Power, and Thermal Tradeoffs in a 28nm Mobile Application
该论文提出了一种28nm工艺下的异构多处理四核CPU与双GPU设计,旨在通过任务调度和功耗管理优化性能、功耗和热平衡。解决了移动SoC中异构计算资源协同工作时的效率与散热问题。
创新点1:采用四核CPU与双GPU的异构架构,实现计算资源的灵活分配与负载均衡。
创新点2:提出动态功耗-热联合管理机制,在保证性能前提下降低峰值温度和功耗。
ISSCC 2014Session 10Digital Processors28nm HPM
Mitsuhiko Igarashi, Toshifumi Uemura, Ryo Mori, Noriaki Maeda,
提出了一种28nm HPM工艺的异构多核移动应用处理器,集成了2GHz高性能核心和1GHz低功耗核心,以平衡高性能与低功耗需求,适用于移动和车载信息娱乐系统。
采用异构CPU架构,结合高性能2GHz核与能效1GHz核,实现性能与功耗的灵活调度。
在28nm HPM工艺上实现2GHz高性能核心,同时保持低功耗核心的能效优势。
ISSCC 2014Session 10Digital Processors28nm CMOS
Martin Saint-Laurent1, Paul Bassett1, Ken Lin2, Yuhe Wang2, Son Le2,
该论文提出了一款采用28nm工艺的DSP,通过集成片上LDO供电,实现了高性能和能效的平衡,适用于移动应用。采用脉冲锁存器和统计优化技术,在宽工艺、电压和温度范围内保证鲁棒性,并显著降低时钟和数据功耗。
采用片上LDO供电DSP,优化高性能与能效的权衡
使用脉冲锁存器替代传统主从触发器,降低时钟和数据功耗,并提供更多数据透明性
ISSCC 2013Session 9Digital Processors
Junyoung Park, Injoon Hong, Gyeonghoon Kim, Youchang Kim,
该论文提出了一种基于类皮层架构的多分类器众核处理器,用于超分辨率识别任务,解决了传统单分类器系统在识别准确性和鲁棒性上的不足。通过集成多分类器系统并模拟人类视觉系统的层次结构,实现了646GOPS/W的高能效性能。
提出了一种类皮层架构,模拟人类视觉系统的层次化处理流程,提升识别准确率。
采用多分类器系统替代单分类器,增强了系统的鲁棒性和识别能力。
ISSCC 2013Session 9Digital Processors28nm CMOS
Dongsuk Jeon, Yejoong Kim, Inhee Lee, Zhengya Zhang, David Blaauw, Dennis Sylvester
该论文提出了一种用于微型自主车辆导航的特征提取加速器,采用28nm CMOS工艺,在470mV低电压下仅消耗2.7mW功率。解决了高精度特征提取算法在功耗受限嵌入式系统中无法高效运行的问题。
首次在亚0.5V电压下实现低功耗特征提取加速,适用于微型自主车辆导航。
通过优化的架构和电路设计,在极低功耗下保持足够的特征提取性能。
ISSCC 2013Session 9Digital Processors
Rahul Rithe1, Priyanka Raina1, Nathan Ickes1, Srikanth V. Tenneti2, Anantha P. Chandrakasan1
本文提出了一种面向能量可扩展计算摄影的可重构处理器,通过硬件加速实现高计算复杂度的非线性滤波(如双边滤波),解决了实时处理的计算需求。该处理器支持多种计算摄影应用,如高动态范围成像和低光增强。
提出了一种可重构处理器架构,能够针对计算摄影中的非线性滤波算法进行能量-性能权衡的硬件配置。
实现了能量可扩展性,允许根据应用需求动态调整计算精度和功耗,适用于移动设备。
ISSCC 2013Session 9Digital Processors
Chao-Tsung Huang1, Mehul Tikekar1, Chiraag Juvekar1, Vivienne Sze2, Anantha Chandrakasan1
本文提出了一款支持Quad Full HD (3840×2160) 分辨率的HEVC视频解码器芯片,实现了249Mpixel/s的吞吐量。该芯片针对HEVC标准中复杂的编码工具(如可变大小编码单元、大尺寸变换、长插值滤波器)带来的设计挑战,通过系统流水线、存储优化和硬件加速等技术,实现了高效解码。
提出了一种系统级流水线架构,有效处理HEVC的分层编码结构,解决了大尺寸编码单元和变换块带来的数据依赖和带宽问题。
通过自定义存储器层次结构和数据复用策略,减少了片内存储和外部带宽需求,适用于高分辨率视频解码。
ISSCC 2013Session 9Digital Processors
Yongha Park, Changhyo Yu, Kilwhan Lee, Hyunsuk Kim,
该论文提出了一款集成GPGPU、多格式视频编解码器和双核CPU的移动应用处理器,实现了72.5 GFLOPS的通用计算能力和240 Mpixel/s的图像信号处理性能,解决了移动设备中多媒体融合应用的高能效计算需求。
首次在移动应用处理器中集成GPGPU,实现10倍于传统方法的能效提升。
支持1080p 60fps多格式视频编解码,同时提供240 Mpixel/s的持续图像信号处理能力。
ISSCC 2013Session 9Digital Processors65nm CMOS
Tay-Jyi Lin1, Cheng-An Chien1, Pei-Yao Chang1, Ching-Wen Chen2,
本文提出了一款在65nm低功耗CMOS工艺下实现的视频录制SoC,集成了高效H.264编码器。该芯片在0.48V超低电压下工作,每像素能耗仅为0.57nJ,显著降低了视频录制的功耗。
采用0.48V超低电压工作,实现极低功耗视频录制
每像素能耗仅0.57nJ,达到高能效比
ISSCC 2013Session 9Digital Processors
Masaki Fujigaya1, Noriaki Sakamoto1, Takao Koike1, Takahiro Irita1,
该论文实现了一款采用28nm高k金属栅工艺的单芯片通信处理器,集成了1.5GHz双核应用处理器和LTE/HSPA+基带,旨在满足智能手机对高数据吞吐量的需求。通过工艺优化和架构设计,实现了高性能与低功耗的平衡。
ISSCC 2013Session 9Digital Processors28nm High-κ Metal-Gate
Youngmin Shin1, Ken Shin1, Prashant Kenkare2, Rajesh Kashyap2,
该论文实现了一款采用28nm高k金属栅极工艺的异构四核CPU,通过集成高性能核与高能效核,满足了移动设备对高性能和低功耗的需求。解决了传统同构多核在性能和能效平衡上的挑战。
采用28nm HKMG工艺,实现高性能与低漏电的兼顾。
异构四核架构(可能为big.LITTLE设计),根据负载动态切换核心以优化能效。
ISSCC 2013Session 3Digital Processors28nm HKMG CMOS
Ryuji Kan1, Tomohiro Tanaka1, Go Sugizaki1, Ryuichi Nishiyama1,
本文介绍了第10代SPARC64 X处理器,该处理器采用增强的28nm HKMG CMOS工艺,集成30亿晶体管和588mm²的die,包含16个核心。通过应力控制、SiGe改进和S/D优化实现了约10%的性能提升,面向关键任务UNIX服务器。
在28nm HKMG工艺上通过应力控制、SiGe改进和源漏优化实现性能提升约10%
集成16个核心和30亿晶体管的大规模多核架构
ISSCC 2013Session 3Digital Processors
Venkatram Krishnaswamy1, Dawei Huang2, Sebastian Turullols1, Jinuk Luke Shin1
该论文介绍了基于SPARC T5处理器的Oracle T系列系统,通过1跳无粘合连接实现从1到8个插槽的扩展,并优化了带宽和电源管理。系统集成了16个8线程核心、8MB L3缓存、4个片上内存控制器和2个PCIe Gen 3接口,解决了多核多线程设计中硬件与软件集成带来的带宽和功耗挑战。
采用1跳无粘合连接实现8插槽扩展,简化了系统架构并降低了延迟。
通过硬件与软件协同优化,有效管理多核多线程系统中的带宽和功耗。
ISSCC 2013Session 3Digital Processors65nm CMOS
Peng Ou, Jiajie Zhang, Heng Quan, Yi Li, Maofei He, Zheng Yu,
该论文设计了一款65nm工艺的24核处理器,用于多媒体和通信应用,核心特点是采用包控电路交换双层片上网络(NoC),实现了11Tb/s/W的能效和435Gb/s的二分带宽。通过簇共享NoC连接异构可重构加速器,在满足高灵活性的同时提升了性能和能效。
提出包控电路交换双层NoC架构,结合电路交换和包交换优势,实现高能效(11Tb/s/W)和高带宽(435Gb/s二分带宽)。
采用簇共享NoC连接的异构可重构架构,将通用处理器核与专用加速器集成,兼顾灵活性与计算效率。
ISSCC 2013Session 3Digital Processors32nm HKMG低功耗CMOS
Weiwu Hu1,2, Yifu Zhang1,2, Liang Yang2, Baoxia Fan2, Yunji Chen1,2,
该论文介绍了Godson-3B1500,一款基于32nm HKMG低功耗工艺的8核微处理器,工作频率1.35GHz,功耗40W,峰值性能172.8GFLOPS。通过设计优化,支持1.0V至1.3V的宽电压范围,实现了高性能与低功耗的平衡。
采用32nm HKMG工艺集成1.14亿晶体管和8个核心,在182.5mm²面积内实现高计算密度。
通过电压调节技术支持1.0V至1.3V宽电压范围,兼顾能效与性能。
ISSCC 2013Session 3Digital Processors28nm CMOS
Teja Singh, Joshua Bell, Shane Southard, also includes an adjustable write-chop circuit which allows for silicon write-m
本文介绍了AMD的Jaguar低功耗x86-64核心,是Bobcat的后续产品,采用28nm工艺,面积3.08mm²,支持从平板电脑到客户端产品的宽功耗范围。通过集成电源门控和可调写入斩波技术,优化了SoC功耗并提高了RAM设计的灵活性和工艺可移植性。
采用28nm工艺实现3.08mm²的低功耗x86-64核心,支持宽功耗范围(sub-5W到25W)。
集成电源门控技术,提供低功耗状态以优化SoC功耗。
ISSCC 2013Session 3Digital Processors
Jen-Wei Lee, Szu-Chi Chung, Hsie-Chia Chang, Chen-Yi Lee
该论文提出了一种支持双域(GF(p)和GF(2^m))的椭圆曲线密码(ECC)处理器,能够抵抗侧信道攻击。通过优化算法和架构,实现了在GF(p521)上3.40ms、在GF(2^521)上2.77ms的运算速度,解决了ECC处理器在安全性和性能之间的平衡问题。
提出了一种双域ECC处理器架构,同时支持素域和二元域上的椭圆曲线运算,提高了灵活性。
集成了侧信道攻击抵抗机制,在不显著降低性能的前提下增强了安全性。
ISSCC 2013Session 3Digital Processors28nm CMOS
Jason Hart, Steve Butler, Hoyeol Cho, Yuefei Ge, Gregory Gruber,
该论文介绍了Oracle SPARC T5处理器,采用28nm工艺,集成了16个核心,运行频率达3.6GHz。通过加倍核心管道数量并改进SoC架构,显著提升了性能、可扩展性和功耗效率。
将核心数量从T4的8个增加到16个,并通过加倍核心管道提升并行处理能力
改进了多插槽互连和I/O子系统,增强了系统可扩展性和数据吞吐量
ISSCC 2013Session 3Digital Processors32nm SOI CMOS
James Warnock1, Yuen H Chan2, Hubert Harrer3, David Rude2,
本文介绍了IBM System z微处理器及其多芯片模块(MCM)的设计与实现,旨在解决高性能计算中的功耗、散热和信号完整性等问题。通过创新的微架构和封装技术,实现了GHz级别的运行频率和高集成度。
采用先进的微架构设计,支持GHz级别的时钟频率,提升处理器性能。
利用多芯片模块(MCM)技术,将多个芯片紧密集成,减少互连延迟并提高带宽。
ISSCC 2012Session 3Digital Processors22nm high-k tri-gate LP CMOS
Y. William Li1, Carlos Ornelas2, Hyung Seok Kim1, Hasnain Lakdawala1,
该论文提出了一种可重构的分布式全数字时钟发生器核心,支持扩频时钟和偏斜校正,在22nm高k三栅极低功耗CMOS工艺中实现。它解决了多时钟域系统中时钟生成、偏斜最小化和快速唤醒等挑战。
提出分布式全数字时钟发生器架构,支持多时钟域独立生成和动态电压频率缩放。
集成扩频时钟和偏斜校正功能,减少电磁干扰和模块间时钟偏斜。
ISSCC 2012Session 3Digital Processors
Visvesh Sathe1, Srikanth Arekapudi2, Charles Ouyang2,
该论文介绍了AMD“Piledriver”x86-64微处理器中采用的谐振时钟设计技术,通过两种工作模式(直接驱动和共振)实现高达24%的时钟分布功耗降低,同时保持低时钟偏移,并满足商用处理器的宽频范围测试性和鲁棒性要求。
创新点1:提出一种谐振时钟分配方案,利用两层厚顶部金属、高工作频率和时钟负载密度等有利条件,显著降低时钟网络功耗。
创新点2:设计双模式时钟系统(直接驱动模式和共振模式),以支持从低频到高频的宽范围操作,同时保证测试性和鲁棒性。
ISSCC 2012Session 3Digital Processors32nm CMOS
Shailendra Jain1, Surhud Khare1, Satish Yada1, Ambili V1,
该论文介绍了一款在32nm CMOS工艺上实现的IA-32处理器,能够在280mV至1.2V的宽电压范围内工作,解决了近阈值计算中因电压缩放导致的频率下降问题,实现了显著的能效提升。
实现了从280mV到1.2V的宽工作电压范围,支持近阈值与超阈值操作模式的无缝切换。
通过优化的电路设计和架构调整,在低电压下维持了可接受的性能,克服了频率退化挑战。
ISSCC 2012Session 3Digital Processors
Zhiyi Yu, Kaidi You, Ruijin Xiao, Heng Quan, Peng Ou, Yan Ying,
提出一款16核处理器,采用混合通信机制同时支持消息传递和共享内存,以提升性能和能效。通过基于簇的分层架构和无缓存内存层次结构(扩展寄存器文件、小型私有存储和中等共享存储)实现高效核间通信。
提出簇式分层架构,同时支持共享内存和消息传递两种核间通信机制。
采用无缓存内存层次结构,利用扩展寄存器文件、小私有内存和中等共享内存避免缓存一致性开销。
ISSCC 2012Session 3Digital Processors32nm CMOS
Hasnain Lakdawala1, Mark Schaecher2, Chang-tsung Fu1,
该论文介绍了一款采用32nm工艺制造的SoC,集成了双核Atom处理器和RF WiFi收发器,实现了x86兼容的完整PC功能,旨在满足嵌入式PC应用对成本、性能和软件兼容性的需求。
在32nm工艺上首次集成双核Atom处理器与RF WiFi收发器,实现完整的PC-on-chip方案。
芯片支持x86操作系统兼容性,并针对嵌入式应用进行了快速集成和定制优化。
ISSCC 2012Session 3Digital Processors28nm CMOS
Jinuk Luke Shin, Heechoul Park, Hongping Li, Alan Smith,
本文介绍了Oracle T4 SoC处理器中的下一代64位SPARC核心,采用双发射乱序执行架构,实现了整数性能5倍、浮点性能7倍的提升。该处理器集成了8个核心、交叉开关和统一16路4MB L3缓存,并与前代T3平台兼容。
设计了新一代双发射乱序SPARC核心,大幅提升单线程性能。
在SoC中集成8个核心、交叉开关和统一大容量L3缓存,实现高吞吐量。
ISSCC 2012Session 3Digital Processors
Accelerators, Power Management and Testability, Features
本文介绍了一款第三代多核处理器,集成了32个RISC核心,并具备网络、加速器、电源管理和可测试性等特性。该设计通过增加核心数量提升了处理性能,解决了多核处理器集成度和能效问题。
集成了32个RISC核心,显著提升并行处理能力
融合了网络、加速器和电源管理功能,实现高集成度
ISSCC 2012Session 3Digital Processors22nm CMOS
Satish Damaraju1, Varghese George1, Sanjeev Jahagirdar1,
该论文介绍了代号为Ivy Bridge的22纳米多CPU与GPU系统级芯片,集成了最多四个高性能IA核心、一个优化的图形/媒体处理单元以及内存、PCIe和显示控制器。它解决了在单个芯片上实现高性能计算与图形处理集成、同时优化功耗和性能的问题。
在IA核心中增加了流水线除法器和下一页预取器,提升了计算性能。
采用22纳米工艺,实现了约1.4亿晶体管集成在约160平方毫米的芯片面积上。
ISSCC 2012Session 12Digital Processors
Dajiang Zhou1, Jinjia Zhou1, Jiayi Zhu2, Peilin Liu2, Satoshi Goto1
本文提出一款单芯片H.264/AVC HP/MVC视频解码器,支持8K×4K超高清视频和最多32路HD视点的实时解码(2Gpixel/s吞吐率)。针对视频编码算法中数据依赖性限制硬件并行度的关键挑战,设计了高效架构,实现了超高清和3DTV/FTV应用的实时解码。
提出一种支持超高清(8K×4K)和多视点(最多32路HD)实时解码的单芯片架构,突破数据依赖导致的并行度瓶颈。
通过优化的数据流控制和存储层次设计,在2Gpixel/s高吞吐率下实现H.264/AVC HP和MVC标准的完整支持。
ISSCC 2012Session 12Digital Processors
Yasuki Tanabe, Masato Sumiyoshi, Manabu Nishiyama, Itaru Yamazaki,
该论文提出了一款用于图像识别应用的异构多核SoC,实现了464GOPS的性能和620GOPS/W的能效,解决了实时多目标识别和高能效需求的矛盾。
采用异构多核架构,结合不同类型的处理器核以优化性能与功耗。
实现了464GOPS的高性能和620GOPS/W的高能效,远超同期同类设计。
ISSCC 2012Session 12Digital Processors
Jinwook Oh, Gyeonghoon Kim, Junyoung Park, Injoon Hong,
该论文设计了一款面向HD 720p视频流的实时运动目标识别处理器,功耗仅320mW,性能达342GOPS,解决了无人机和移动增强现实等应用中因低灵敏度CMOS传感器导致的运动/相机模糊噪声下的鲁棒识别问题。
提出高能效运动目标识别处理器架构,在320mW功耗下实现342GOPS运算性能,支持HD 720p实时处理。
针对运动/相机模糊噪声,可能集成专用硬件加速单元或鲁棒识别算法,提升低光照条件下的识别鲁棒性。