你的浏览器版本过低,可能导致网站不能正常访问!
为了你能正常使用网站功能,请使用这些浏览器。

【经验分享】STM32H7的Cache与Buffer

[复制链接]
STMCU小助手 发布时间:2021-12-26 17:22
STM32H7的Cache与Buffer* q5 C+ ~: q: U' m8 k9 z
TCM和Cache的区别

# u. F' }% i7 S" v' n) s5 z. H…使用lwip用到了mpu,对于内存管理产生了很多的疑问,需要统一解决一下,不然用起来总有些不安。
4 x3 r; U; R) q& |
/ W; w5 M6 J" YSTM32H7使用的内存不是连续的,而是被划分为多段。
' [. e& N+ L3 _) H  j3 Y8 R) k& F& l' v# i; C; P6 h
  1. MEMORY
    1 p2 o6 J2 Q' i& M
  2. {3 H1 _2 f; _: ], W; }" x& h. `  j  v
  3.         DTCMRAM (xrw)     : ORIGIN = 0x20000000, LENGTH = 128K //高速段,cpu独享
    * w5 ?9 S/ s4 Q
  4.         RAM_D1 (xrw)      : ORIGIN = 0x24000000, LENGTH = 512K
    $ j0 d+ n7 V: W; ?% e. ~' A
  5.         RAM_D2 (xrw)      : ORIGIN = 0x30000000, LENGTH = 288K% B; e; \- f8 s  s6 y! E
  6.         RAM_D3 (xrw)      : ORIGIN = 0x38000000, LENGTH = 64K
    ; j6 P" Z/ Q6 K. f/ p
  7.         ITCMRAM (xrw)     : ORIGIN = 0x00000000, LENGTH = 64K //高速段,cpu独享
    % t3 U2 [5 x' O
  8.         FLASH (rx)        : ORIGIN = 0x8000000, LENGTH = 128K
    0 y; v9 i7 l! {: B4 z' N
  9. }
复制代码

0 s2 Z* @+ i3 Q; M* xTCM内存段是和CPU同频率的,不需要也不能用Cache。用好TCM的优先级应该排在用好Cache的前面。4 ^8 f6 Z: C/ h. t
Cache处于核心里面,作为低速内存加速器使用,获得增益最大的是位于AXI总线上的比如内部Flash、内部SRAM、通过FMC或者QSPI控制器连接的外部sram。Cache使得低速Sram获取与高速TCM差不多的速度。使用Cache加速很有意义,不然400M的cpu变200M,相当于H7变F4,选择H7的cpu将变得没有意义。# S2 a( O! R7 A
, g5 l1 {- v! _/ ]
20201019190212727.png

% L  c8 _( O" {3 C+ b) M9 a& Z9 t2 K+ l3 a* T  o, }
内存类型
6 y. o& Z2 N4 ~7 q" M# i  w内存类型分为Normal以及Device和Strongly-ordered,9 e" g7 U; e# P7 X) w+ r. W
I5LW_ZQ_SY3W%I@][7RY56T.png
* p. Q2 S$ e: b/ N! s
% k7 s6 Z; M8 l* j% h7 T- H. w
20201019190230823.png
8 J. |: i2 P! ~' R

4 M3 C1 ?" ?6 W4 g5 d4 e/ ]' }8 V* ^! w+ e
Write-buffer是什么?% t. ^" F8 h2 N8 M: E
Device和Strongly-Ordered类型时候提到了write-buffer,它属于cpu核心,cache经常与write-buffer一起使用,使用writer-buffer的目的是将处理器和cache从较慢的对主存的写操作中脱离出来。
; Y" |2 d: g) d' S8 Y9 V( cWrite buffer可以缓存8个word的数据和4个独立的地址,可以enable或者disable使用ARM核心控制寄存器 W的bit3。同时还要受到内存管理页表的一个bit控制,所以使用Write-Buffer,MMU必须已经使能(控制寄存器的bit0)。MMU-Memory Management Unit! W' s5 D) n" {* C
通常情况下的配置都是主内存允许bufferable,但是I/O 空间 unbufferable
9 }, O8 S2 I9 Q! R6 Y; {8 t4 [# L当CPU执行一个写操作时,根据配置情况执行写入操作。0 F- c9 B% l* v' o; j7 m3 a  p

8 h" B- ]$ p7 j

  j0 k/ |: P4 w) e9 D8 i, M# m1 `8 Q) v) q# e& D3 ?# k
20201019190300772.png
% e! d( n8 b9 Y
3 O/ }! C; l% \; V' N
如果程序中使用DMB and DSB,处理器会等到write-buffer内指令完成,再进行后续指令操作,如果过程中发生中断,中断返回后继续write-buffer清空等待。+ T* X# i; k$ z& l7 W
* n# |4 ~; l6 h% P) d% B! e/ l" a
DMB或者DSB被称为 显式限制操作 explicit barrier。1 e8 q3 u: z; I8 K

$ ~: }. |8 L5 R/ _
20201019190244953.png

" m( _  _* [# q! M+ a
* @% f% W( `3 p; l$ r" K$ l" X% FMemory Attrabute
  G; g7 z- x' ?0 z3 m6 mNormal模式下可以设定的几种
- e0 W2 O6 @; C% ~8 g3 r3 B. `; @1 o3 e8 w
UXF0GF8D%6@3RQT%LAI76.png
7 M9 `8 m+ j, u7 z

7 N0 I  v7 C# M$ yShareable属性. X! u  k4 n. Y. k/ x+ k1 s. N
共享属性设计的意义在于,多个bus master读写情况下需要cache保持同步,对于CortexM7,只有L1-Cache,如果设置了Shared相当于non-cacheable。8 p* T" a! o' m
/ s' j( [5 o" J* k9 ^7 n8 u: M- F
20201019190314464.png

! g  d, S3 w. g: x: L/ w1 H, U! W
9 l& Q( W- @/ `( [: B  W内核操作函数
3 ]1 }3 j8 g, X; @内核操作函数包含以下几种,主要包含两种操作:clean和invalidate。( N4 O' ^' }: a6 i. r
clean:将cache中的信息写到sram,相当于用cache信息覆盖sram;; e& n9 Z# ]0 Y+ Z3 ]8 \: V
invalidate:使cache失效,相当于用sram信息覆盖cache;3 C/ u, r5 n8 T$ P1 q) f/ H( ]! ~
二者为相反的操作。
+ s$ }, U8 j1 C, Z
8 l" d1 Z4 R6 Y8 H1 P6 G
2020101919032876.png
3 {# Q+ u. J7 }; ]3 C

8 J( l+ y$ D3 \; {
20201019190336970.png

* c. \3 }& o+ C( l2 r, k! z: C# ?. b) H4 t' ~, F  G

- P* R( G0 Q1 ^% A内存对齐问题
  d8 V% @& B! y3 r  _' m使用cache时,dma的buffer必须32byte对齐,不然可能会出现问题。比如下面的情况:" u7 }& k9 _1 q6 y
5 K7 v: u' Q# e9 W0 a% M4 B
  1. typedef struct
    1 z- g" x/ K7 }3 J3 S& d9 N7 u7 `3 g
  2. {+ O, f* \6 {' n! x  w' f/ G
  3.     __attribute__ ((aligned (32))) uint8_t rx_buffer[BUFFER_SIZE];//用于buffer7 w3 Z, Y% q' t
  4.     bool rx_xfer_done;                                     //用于记录dma已经被正确传输
    8 D3 N% U3 |0 A6 Z9 K. K
  5. }st_dma_xfer
    : M- X, ?' `  c( J4 W( A

  6. ' Q0 y4 m" I  z
  7. void XDMAC_Handler(void)5 U. v+ r, [5 c- L$ D1 l& i0 S6 W8 H
  8. {
    6 r& E! x" I+ y- |3 N! N0 Y5 v8 f
  9.     uint32_t dma_status;
    , T1 [9 e8 ~2 a% |3 `$ T! f
  10.     dma_status = xdmac_channel_get_interrupt_status(XDMAC, XDMA_CH_RX);
    ! E; f7 _- H# j; c
  11.     if (dma_status & XDMAC_CIS_BIS)
    ( S# s& V$ a4 x! G7 Z7 B9 X
  12.     {
    9 U2 Q: o% v7 y
  13.       g_st_dma_xfer.rx_xfer_done = true;
    6 ?. Q. M# K+ L( T
  14.       SCB_InvalidateDCache_by_Addr((uint32_t*)g_st_dma_xfer.rx_buffer, DMA_TRANSFER_SIZE);
    0 J) ^6 m4 \; m4 H6 I) P7 U$ t3 `/ V7 f
  15.     }7 {% x8 }4 n8 q: R2 T
  16. }
复制代码
  ?$ {; c  X6 y$ ?8 w

' C& M" V: P) ]$ T如果DMA的buffer只有16字节,DMA读取操作后,DMA控制器将接收到的数据写到了sram里面,然后进入DMA接收中断函数,cpu把成功读取的标识bool变量写为true,实际上写操作只是写在D-Cache里面,暂时没有写到sram。/ j7 v# P7 V8 Y$ w$ O8 v1 K

( k5 P% Q1 f1 x6 b
20201019190359602.png
. b5 V& w$ |0 ^2 y0 ^3 A' s# ~# R. t
+ b/ [: i! K+ {6 m) \2 J, Y4 v
如果此时cpu需要读取dma内容,需要对Dcache进行invalid操作,32个字节将一起更新,bool变量旧值0将覆盖新值1。cpu读不到中断函数写的bool变量信息。
) g9 v( x2 L; y+ y$ k3 v1 I( f
. b( q) X9 @: d, k% A+ D
20201019190409891.png

( q% l: r$ y1 D( E. ]# J8 }0 l7 I4 A6 y$ N/ z( o4 i7 }7 ~
可见:# U5 I$ [8 f" q! E8 L, E7 ?1 {- Y1 N
clean操作或者Invalidate操作都可能丢东西,使用上需要注意。经验是如果一段内存用来写dma外设,就不要读它,保证随时都可以clean;同样如果一段内存用来接收DMA外设传入信息,就不要用cpu写它,保证随时都可以invalidate。6 W, y2 }2 F) Y  A) _

3 I( {2 K) J; [9 d
2020101919042042.png
. f$ ?. K' t4 v
8 d+ I4 L0 l- j* p; J/ J
9 X5 G+ o# B. I# s9 a6 a
收藏 评论0 发布时间:2021-12-26 17:22

举报

0个回答

所属标签

相似技术帖

官网相关资源

关于
我们是谁
投资者关系
意法半导体可持续发展举措
创新与技术
意法半导体官网
联系我们
联系ST分支机构
寻找销售人员和分销渠道
社区
媒体中心
活动与培训
隐私策略
隐私策略
Cookies管理
行使您的权利
官方最新发布
人形机器人运动控制、感知与智能配电
半导体创新技术与应用方向
EE架构与软件定义汽车
12V/48V 汽车智能配电(SPD)
区域控制单元(ZCU)与分区架构
关注我们
st-img 微信公众号
st-img 手机版