你的浏览器版本过低,可能导致网站不能正常访问!
为了你能正常使用网站功能,请使用这些浏览器。

【经验分享】STM32H7的Cache与Buffer

[复制链接]
STMCU小助手 发布时间:2021-12-26 17:22
STM32H7的Cache与Buffer
1 e' i! Q( o; N2 \& dTCM和Cache的区别

) L! L  Y: |' }% D…使用lwip用到了mpu,对于内存管理产生了很多的疑问,需要统一解决一下,不然用起来总有些不安。$ S- A& v+ B8 j! ?2 C

5 @3 m5 ^4 @  p( N5 ?9 K% ASTM32H7使用的内存不是连续的,而是被划分为多段。
/ H0 @/ w# e+ ^3 ?: H) L4 ^/ w; M' S2 U' a
  1. MEMORY/ w2 @* L8 F# m0 D- }% |
  2. {5 j1 R6 b$ i- H. i: ~& t# r
  3.         DTCMRAM (xrw)     : ORIGIN = 0x20000000, LENGTH = 128K //高速段,cpu独享
    * o; K, R  I6 P% S
  4.         RAM_D1 (xrw)      : ORIGIN = 0x24000000, LENGTH = 512K
    0 x) S, s# K% u: t+ G
  5.         RAM_D2 (xrw)      : ORIGIN = 0x30000000, LENGTH = 288K
    5 M6 f  k9 N6 h* c( P
  6.         RAM_D3 (xrw)      : ORIGIN = 0x38000000, LENGTH = 64K
    , P# q6 \; X% I+ @( U" ~
  7.         ITCMRAM (xrw)     : ORIGIN = 0x00000000, LENGTH = 64K //高速段,cpu独享0 x9 S! Y4 \, T( E% K+ y
  8.         FLASH (rx)        : ORIGIN = 0x8000000, LENGTH = 128K
    9 u/ u9 ?$ U8 |* ^9 w' m6 T0 k
  9. }
复制代码

- s" U. S, v- T2 @6 q) zTCM内存段是和CPU同频率的,不需要也不能用Cache。用好TCM的优先级应该排在用好Cache的前面。
$ a7 D! \7 @3 C* B( G, c: p8 t" o. lCache处于核心里面,作为低速内存加速器使用,获得增益最大的是位于AXI总线上的比如内部Flash、内部SRAM、通过FMC或者QSPI控制器连接的外部sram。Cache使得低速Sram获取与高速TCM差不多的速度。使用Cache加速很有意义,不然400M的cpu变200M,相当于H7变F4,选择H7的cpu将变得没有意义。
+ d( y# g* [" v. i4 K6 G3 K4 B
% A* n- [' d. a9 {* \2 C
20201019190212727.png

& P! k7 F$ Q  b. ]$ M$ b& f( u7 y2 e* q$ ~
内存类型
' {& b. N' O5 v! H, {6 _- X内存类型分为Normal以及Device和Strongly-ordered,
' x- O. V3 v1 n" e! Q
I5LW_ZQ_SY3W%I@][7RY56T.png

0 W" v$ [) @9 v5 G7 s' t$ ?& M; b0 H9 O' q  i: l( Z' Y
20201019190230823.png
6 B, ]4 t/ n; c5 Q  l' j! y

" `8 K. ~# z  R
' I: H% y! [8 z5 dWrite-buffer是什么?, g" G) t& y: ?, Q% M: S1 ^
Device和Strongly-Ordered类型时候提到了write-buffer,它属于cpu核心,cache经常与write-buffer一起使用,使用writer-buffer的目的是将处理器和cache从较慢的对主存的写操作中脱离出来。( H+ h: O7 }- A! z0 M: n
Write buffer可以缓存8个word的数据和4个独立的地址,可以enable或者disable使用ARM核心控制寄存器 W的bit3。同时还要受到内存管理页表的一个bit控制,所以使用Write-Buffer,MMU必须已经使能(控制寄存器的bit0)。MMU-Memory Management Unit3 y# s1 j) J$ j1 ~' Z
通常情况下的配置都是主内存允许bufferable,但是I/O 空间 unbufferable
" K! `& P9 e) Z0 ^当CPU执行一个写操作时,根据配置情况执行写入操作。
( b: t5 ]: ^: V3 o; i' e. q9 m" {
! \2 c3 y8 `5 u8 |5 @/ ^

+ }0 Z6 \9 J' `% R( S
( H  w% E! d( k, ]% S
20201019190300772.png

9 {' a' J$ l" @  d, U  s2 }. @$ w7 v. E8 A) t7 M' V8 B: d
如果程序中使用DMB and DSB,处理器会等到write-buffer内指令完成,再进行后续指令操作,如果过程中发生中断,中断返回后继续write-buffer清空等待。- _! L5 c7 r& z$ t
8 Z; s9 o% F4 P( o1 B  w+ \8 g* T9 z
DMB或者DSB被称为 显式限制操作 explicit barrier。
1 J' V. z- U2 q; W( d9 u. d, K/ j+ q; q$ L4 q
20201019190244953.png

1 x; e: N7 b+ F- q, M4 I2 G2 D0 r9 e" ]; v7 t; `
Memory Attrabute
$ C( f; s# v$ J3 g; GNormal模式下可以设定的几种
0 \6 O/ t4 x, M, q, }% q
/ N1 D. R' y- [! o
UXF0GF8D%6@3RQT%LAI76.png
7 C, d& x2 g; ~

( E) @  G' ~& ^0 c. yShareable属性
# @' R9 D# c; d( t  k% f+ m共享属性设计的意义在于,多个bus master读写情况下需要cache保持同步,对于CortexM7,只有L1-Cache,如果设置了Shared相当于non-cacheable。# J1 \6 q# C7 N% z/ }, a
( A; \# K" N5 X2 O# q8 b" j8 F1 ^0 X
20201019190314464.png
5 N1 \, `, G, q& U; Z7 p

4 P1 M& q  l2 u5 y内核操作函数: _8 H: S, K; g" L+ n  B
内核操作函数包含以下几种,主要包含两种操作:clean和invalidate。
  |( M* E' C1 O. V4 I: pclean:将cache中的信息写到sram,相当于用cache信息覆盖sram;& L. v* b; d" l2 e( w% c' q
invalidate:使cache失效,相当于用sram信息覆盖cache;5 s  |0 q* L% t7 ^2 l" U
二者为相反的操作。
+ e) r& `" N# `% u( F
: j4 q$ a' Q) Z/ }8 J" z
2020101919032876.png
4 P  V; Z7 ?/ R& j6 e$ w; ?" Y

5 n# r: L; V2 \/ g0 I+ H8 L1 C
20201019190336970.png

" W/ [$ F4 T5 X+ z& T$ W+ p( ~6 z
5 H( L) ~  V; B! i8 ?/ p8 P$ x; m2 k: Z! U! i! ]5 n4 Z5 v/ ~& E# k: N, j
内存对齐问题' P0 b* n4 _; l! h7 b
使用cache时,dma的buffer必须32byte对齐,不然可能会出现问题。比如下面的情况:/ k; t, `' ?4 |; L; A
! {% C% |, Q6 K) o9 G
  1. typedef struct) Z/ S- \5 ^% F  |5 G" k% n
  2. {
    6 l, T- }0 R! y- y8 [2 R% I/ n
  3.     __attribute__ ((aligned (32))) uint8_t rx_buffer[BUFFER_SIZE];//用于buffer
    , g( `9 g1 D! `* Z& m! ?1 r, R- l
  4.     bool rx_xfer_done;                                     //用于记录dma已经被正确传输
    ( E, W: ]; L( C8 K! B5 j
  5. }st_dma_xfer
    & U1 G2 u' W$ q# p6 A0 F

  6. " I& J. O; g% _& l6 A% S& \
  7. void XDMAC_Handler(void)$ M: `* `. B) b7 H; Y, G- p
  8. {
    # G- r3 H$ P3 G8 b3 J( q
  9.     uint32_t dma_status;
    $ [0 O4 i' e; W! Q  }$ N
  10.     dma_status = xdmac_channel_get_interrupt_status(XDMAC, XDMA_CH_RX);$ Z- ?8 q/ E% K5 d
  11.     if (dma_status & XDMAC_CIS_BIS)* a* s( R# |; o$ w' d7 Y6 X) ^
  12.     {- [* C. t9 _% R: y+ x
  13.       g_st_dma_xfer.rx_xfer_done = true;! Q; B' H( T; V: y/ m% H
  14.       SCB_InvalidateDCache_by_Addr((uint32_t*)g_st_dma_xfer.rx_buffer, DMA_TRANSFER_SIZE);
    , U6 n, a9 P( E5 Q9 A) A9 \  O
  15.     }% L) M& l- M7 u+ d% d; M9 |
  16. }
复制代码
% u9 N: X9 M5 @* q8 |

4 n- K2 Y, k- s! m如果DMA的buffer只有16字节,DMA读取操作后,DMA控制器将接收到的数据写到了sram里面,然后进入DMA接收中断函数,cpu把成功读取的标识bool变量写为true,实际上写操作只是写在D-Cache里面,暂时没有写到sram。% ]" `3 U7 u2 W( ]8 H/ U

: ~9 Q1 a4 `0 S& }1 V
20201019190359602.png
  ]" r6 e: \0 y  z& W2 Y! q9 A
6 o! N: v. r- r( h/ o
如果此时cpu需要读取dma内容,需要对Dcache进行invalid操作,32个字节将一起更新,bool变量旧值0将覆盖新值1。cpu读不到中断函数写的bool变量信息。
4 D: z4 @5 b4 M9 n& R' C3 G. W2 G8 U1 P% b* _) k0 Z# K
20201019190409891.png

1 N5 _  f9 h/ u- J/ r1 k# q8 O/ ~* x6 p8 @) j
可见:
" y- e+ l2 c) G  ?, E. Q/ Kclean操作或者Invalidate操作都可能丢东西,使用上需要注意。经验是如果一段内存用来写dma外设,就不要读它,保证随时都可以clean;同样如果一段内存用来接收DMA外设传入信息,就不要用cpu写它,保证随时都可以invalidate。- g& S! e2 G4 u& Y: ]

  b2 k$ f. [9 `: A
2020101919042042.png

; n. `+ O$ g& r1 l. p. o; A% s8 m6 U/ x) `7 f
+ g2 W; T8 o) J8 S# c
收藏 评论0 发布时间:2021-12-26 17:22

举报

0个回答

所属标签

相似技术帖

官网相关资源

关于
我们是谁
投资者关系
意法半导体可持续发展举措
创新与技术
意法半导体官网
联系我们
联系ST分支机构
寻找销售人员和分销渠道
社区
媒体中心
活动与培训
隐私策略
隐私策略
Cookies管理
行使您的权利
官方最新发布
STM32N6 AI生态系统
STM32MCU,MPU高性能GUI
ST ACEPACK电源模块
意法半导体生物传感器
STM32Cube扩展软件包
关注我们
st-img 微信公众号
st-img 手机版