什么是存储层次结构?

存储层次结构是 SoC 中按速度、容量与成本组织的多级存储器体系,用于弥合处理器运算速度与存储器访问速度之间的差距。典型层次自上而下依次为寄存器、Cache(L1/L2/L3)、主存(DRAM)和辅存(Flash/SSD/HDD)。在 EDA 设计流程中,存储层次结构的架构探索与验证贯穿从虚拟原型到 FPGA 原型的全过程,是 SoC 性能优化的核心环节。

一、 技术原理

存储层次结构利用程序的时间局部性与空间局部性原理,将频繁访问的数据置于高速缓存中,减少处理器等待数据的时间。

寄存器位于处理器核内部,访问延迟 1 个时钟周期,容量几十至几百字节,由编译器或程序员显式管理。

Cache 分 L1/L2/L3 三级。L1 紧贴处理器核,延迟 3–5 个周期,容量几十 KB;L2 延迟 10–20 个周期,容量几百 KB 至数 MB;L3 为多核共享,延迟 30–50 个周期,容量可达数十 MB(以上为典型值,随微架构与主频差异较大)。Cache 采用直接映射、组相联或全相联映射,通过 LRU 等替换策略管理数据驻留。Cache 与处理器核之间是核内专用的 load/store 通路;核与核、核与末级 Cache/内存控制器之间则经硬件一致性互连(AMBA ACE/CHI,如 Arm CMN 系列)连接。AXI 属于非一致性接口,主要用于 DMA、外设与内存之间的数据搬运,其独立地址/数据通道与乱序传输特性利于提高并发带宽。

主存通常采用 DRAM(DDR4/DDR5/LPDDR5,以及经 2.5D 中介层与专用控制器接入的 HBM),延迟 100–300 个周期,容量 GB 级,由内存控制器管理,经一致性互连(ACE/CHI)或 AXI 与非一致性主设备相连;DDR 控制器的时序参数、刷新率以及 Cache 使能位等配置寄存器,通常也经 APB 总线访问。Cache 未命中时,处理器发起缓存行填充(cache line fill)请求,总线协议决定该过程的带宽和延迟。

辅存包括 NAND Flash、SSD 或 HDD,容量 TB 级,访问延迟远高于 DRAM——NAND 页读与 SSD 随机读在数十微秒量级(随 SLC/MLC/TLC 递增,块擦除才到毫秒量级),HDD 因机械寻道而在毫秒量级,用于持久化存储操作系统、应用程序和用户数据。它们并非直接挂在片上总线的数据通路上,而是经 SoC 内置的存储控制器接入——NVMe 走 PCIe 链路,另有 UFS/eMMC、SATA、SPI-NAND 等控制器;总线只承载这些控制器的配置寄存器访问(通常挂在 APB 上)。

存储层次结构的验证难点集中在四处:Cache 一致性协议的状态机组合爆炸、DDR 控制器时序与训练序列的纳秒/皮秒级精确模拟、多核并发访问的内存排序模型,以及总线层面的竞争与死锁。

二、 思尔芯产品支持

思尔芯数字前端 EDA 全流程方案支持存储层次结构的架构探索、功能验证与性能评估。

芯神匠 Genesis:可在 RTL 编码前搭建 SoC 虚拟原型,配置 Cache 大小、关联度、替换策略和预取算法,同时配置总线拓扑与协议参数,运行真实软件负载评估存储层次与总线协议对系统性能的综合影响,辅助架构决策。

芯神驰 PegaSim:软件仿真支持 Cache 一致性协议、DMA 传输、内存映射 I/O 等存储相关功能的验证,可覆盖多核缓存一致性、总线竞争、DDR 控制器初始化等场景。

芯神鼎 OD:硬件仿真以设计容量大、可扩展性好、全可视的特点,适合大型 SoC 中存储层次结构与总线互联的系统级深度验证,可捕获 Cache 一致性协议死锁、DDR 时序违规、总线超时等深层次问题。

芯神瞳 Prodigy: FPGA 原型验证运行速度快、性能高,支持真实 DDR 控制器和存储颗粒的接入,可在流片前运行完整的操作系统和存储压力测试,验证存储层次与总线协议在实际软硬件环境中的行为。

三、 行业地位

存储层次结构是现代 SoC 设计的核心架构要素,直接影响芯片的性能、功耗和面积。根据 Wilson Research Group / Siemens EDA 2024 功能验证研究,84% 的 IC/ASIC 项目集成嵌入式处理器,95% 的设计包含多个异步时钟域。对这类设计而言,处理器—Cache—内存控制器之间的时序关系与内存排序,正是存储层次验证的重点难点。Synopsys、Cadence、Siemens EDA 等主流 EDA 厂商均提供存储子系统与总线协议的联合验证方案;思尔芯的数字前端 EDA 方案覆盖从架构探索到原型验证的完整路径。

 

最后更新:2026-09-24

 

FAQ

Q:存储层次结构的验证难点在哪里?

A:难点集中在四处:Cache 一致性协议的状态空间随核数增长而急剧膨胀;DDR 控制器训练序列本身耗时在微秒至毫秒量级,但其时序精度要求达纳秒/皮秒级;多核并发访问的内存排序模型难以穷举;总线层面的竞争与死锁往往要跑长激励才暴露。这也决定了单一手段不够用——软件仿真负责定向覆盖,硬件仿真负责长激励与深度调试,FPGA 原型负责真实软硬件环境下的压力验证。


获取方案

您在设计什么类型的芯片?
设计中含的ASIC门容量为?
500万 - 2千万
2千万 - 5千万
5千万 - 1亿
1亿 - 10亿
大于10亿
您倾向于使用哪款FPGA?
赛灵思 VU440
赛灵思 KU115
赛灵思 VU19P
赛灵思 VU13P
赛灵思 VU9P
AMD VP1802
AMD VP1902
英特尔 S10-10M
英特尔 S10-2800
不太确定,需要专业建议
您需要什么样的FPGA配置?
单颗FPGA
双颗FPGA
四颗FPGA
八颗FPGA
不太确定,需要专业建议
您需要什么样的外设接口?
您需要多少数量的原型验证平台?
您是否需要以下原型验证配套工具? (可多选)
分割工具
多FPGA调试工具
协同建模工具(允许大量数据在 FPGA 与 PC 主机之间进行交互)
您什么时间内需要使用到我们产品?
0-6个月
6-12个月
大于12个月
不太确定
您是否需要其他工具资讯?(可多选)
架构设计
软件仿真
硬件仿真
数字调试
形式验证
想要更多了解,您是否需要产品选型指南?
是
否
其他
提交
输入您的电话,我们即刻给您回电
输入您的电话
验证码
您也可直接拨打电话:400 8888 427 或添加企业微信
电话咨询
微信咨询
Kathylianxiwomen_fuben.png
TOP
Kathylianxiwomen_fuben.png