01、前言
6 J8 S( ~4 G" K8 O Y在之前的文章在《STM32延时函数的四种方法》使用定时器延时,在《如何测量代码运行时间》中提到使用定时器外设计算代码运行时间。文中提到这种方法的明显缺点就是需要占用一个定时器,一些MCU在特定应用场景下定时器外设资源是十分稀缺的。在留言区有位大佬提到可以使用DWT,我就研究了一番。
% g& ~& x' F1 h; l* k& \% T6 R$ A. F$ T" @
1 @3 K6 c/ B$ N$ Q/ Z+ e* I. m6 _8 d8 x& R" ^0 B
02、DWT
9 c0 V+ G5 w f2 a \' |在Cortex-M里面有一个外设叫DWT(DataWatchpoint andTrace),是用于系统调试及跟踪,DWT的中文名字应该是:数据观察点触发。在STM32用户手册的第32章节Debugsupport (DBG)有如下框图。, p. F2 m: Y5 |+ \. s
2 b l5 V& e2 y
$ t/ e4 {5 R( o$ v8 L! t \
, `2 ?" Z+ Q4 ?" T1 x2 ^/ @% A0 V
明显DWT属于DBG部分的功能,从上图的标题可以看出DWT属于CortexM3内核的,理论上M3内核的MCU都支持的,这个下文会说明。在这里我将其称之为“隐藏的定时器”,因为他可以代替定时器外设实现上文提到延时功能和测量代码运行时间的功能,DWT不能代替定时器的其他功能。" L& A+ [* e( C L: g9 `
7 _; q$ V1 }3 q- }% I4 m1 {5 e
之所以DWT可以实现延时功能,因为它有一个32的计数器CYCCNT,这是一个向上计数的计数器,当它溢出时会自动清零并重新开始向上计数,它的频率就是内核的主频。简单点说,就是内核时钟跳动一下,CYCCNT计数器就加1。
6 Y8 J, p t9 \8 {0 a
! E9 B, ^% U4 v0 [" h很明显DWT计数器的精度和系统主频有关,我们常用的STM32F103主频一般为72Mhz,STM32F207一般为120Mhz,STM32H7主频一般为400Mhz。以为主频最低为72Mhz的STM32F103为例,精度是1/72M= 14ns,这个精度足以满足大部分延时函数的需求,同样程序的运行时间都是微秒级别的,远远满足测量代码运行时间的要求。& [" k! n! C0 M5 o& i
5 d. Z. D! a1 J! y
03、DWT的配置- C7 q8 @) W# U4 M6 t7 K
首选使用DWT前必须使能DBG的系统跟踪,控制使能位在DEMCR寄存器的bit24。注意该寄存器详细说明在STM32的用户手册上查不到,需要在CortexM3内核手册查到,在《Cortex-M3权威指南》书中也可以查到。
3 z, l b- }, N2 A9 N- p) w
% E' I. N3 \1 {, V/ W: V1 b+ j
- x3 n5 j$ ]! ]' y! h+ y! w$ g' f5 E
在使能CYCCNT计数器前,必须先将其清零。下图是从ARM的官方手册《Cortex-M3Technical Reference Manual》中查到的。3 A2 r: F' C: I: L k, z
1 V0 d y" h0 e7 h! W
1 {8 c7 o5 v( T1 e) W6 Y) M
! x* f2 B+ D' i! {
使能CYCCNT计数器,其控制位是DWT控制寄存器的第一位,写1使能,则启用CYCCNT计数器,否则CYCCNT计数器将不会工作。
# s& w( A# f4 {; I
p4 ]! R* H4 {8 Z0 F2 T/ x
J' }* T5 ~, r" e
6 h1 m% |$ k5 b3 s4 v总结一下:
( D h, x3 r% X/ `0 K5 \
; \/ `+ C" l H1 q6 K, j ~a.先使能DWT外设,由内核调试寄存器DEM_CR的位24控制,写1使能。
( H3 A1 O) n: J& l5 Y
* m, c5 N* c. J, Y' E3 ^b.使能CYCCNT寄存器之前,先清0。1 p" z2 t+ o9 L6 B" n
& w+ l" D( I0 f1 I+ P- @) `c.使能CYCCNT寄存器,由DWT_CTRL的位0控制,写1使能。
5 P* M8 C/ ^# N" |
# n% s% \8 s& Z5 j. z4 `. q) F代码如下
" z# b0 O. ^2 S# E# `0 P6 U0 { t( p5 n$ x U
- //寄存器基地址
: {, `- P( B5 M: P+ l J - #define DWT_CR *(uint32_t*)0xE0001000$ \. W$ |: A H) a
- #define DWT_CYCCNT *(uint32_t*)0xE00010043 _( M6 V2 P4 l- P _) p+ Z
- #define DEM_CR *(uint32_t*)0xE000EDFC6 R7 t' J% S/ l2 q7 R, E! X
. {5 j' }8 m1 t( @- //定义需使能位. i0 C) C6 P* z' `
- #define DEM_CR_TRCENA (1<<24)7 D- o- y5 M+ V
- #define DWT_CR_CYCCNTENA (1<<0). c( C# p' I) g/ O' G
- - f% N# b1 x' @$ q5 ~: X' S
- //DWT init; g/ t& P0 z9 X; H. s+ q' c6 h
- void DWT_init(void)
: Q2 E! o6 n, b$ i - {% t' Q5 p6 T3 h7 l
- DEM_CR |= (uint32_t)DEM_CR_TRCENA;
) E6 C y) I: d; x v* ~8 E - DWT_CYCCNT = (uint32_t)0u;
6 x# E! }$ r* \ - DWT_CR |= (uint32_t)DWT_CR_CYCCNTENA;
+ w0 O0 f7 t8 B! `- m+ | - }
8 w& j* @7 [& v' b - //get DWT count: h+ I) t6 m: D2 C6 J7 G* r) ]/ e+ |
- uint32_t DWT_TS_GET(void)) l, b2 h1 e+ u
- {
6 B h* o6 Q G" s - return((uint32_t)DWT_CYCCNT);
1 ^; C6 [' t( a - }
0 e. f' J/ j* w# y5 Z; d0 l3 Y
复制代码 & I/ i3 Q& `% T/ @
04、代码; T) Z0 w" N3 L( K3 w" w, K0 y
从上文我们得知,我们已经获得了一个32位向上累加的计数器,溢出会自动清零并累加,频率是系统主频。那么我们简单封装下,就可以实现延时函数。以下代码在120Mhz的STM32F207测试。
0 m( A7 B5 m! ~# A2 k" R/ i* w( p9 e( }
; U: d. _* A. ]- k& E! a+ g+ f) G3 M* b& t$ @. r3 L
- //使用DWT延时time_ms毫秒
( ]3 b2 k7 Q* d% y% A6 ^ - void DWT_Delay_Ms(uint32_t time_ms)
; \) m/ _, e7 g- s! ~9 @, ` - {
6 S' V8 j7 \# g t# \ - uint32_t old_counter,current_counter;
$ u+ f6 h8 @2 h, D - uint32_t delay_ms;
& H3 [1 T5 C+ f* f) {1 _$ a - % K* D4 z: L9 Y6 G
- old_counter = DWT_TS_GET();
+ }3 t& N9 S- S1 v - current_counter = DWT_TS_GET();
: K+ F! t$ d* N. | - delay_ms = 0;+ z' T- W2 }: v% |$ {
- while(delay_ms<time_ms)
l6 @ I0 _3 [- O0 P0 N- J( o! i+ w - {
! f8 M( e4 ^$ @( E( L - current_counter = DWT_TS_GET();
# D6 c; E0 E: S- b" M2 z" h# z# } - if(current_counter > old_counter)
0 V. o8 a9 a) K$ O( d8 w, O4 d - delay_ms = (current_counter - old_counter)/(SystemCoreClock/1000);
3 f# g! ` @% f( ?% @ - else4 V: ]' a& R) r$ x! S
- delay_ms = (current_counter + 0XFFFFFFFF - old_counter)/(SystemCoreClock/1000);. J+ T' O) X$ O; v
- }
1 i2 z# _( c1 g' N6 m - }
复制代码 8 M3 c1 D3 P, S8 }' v
$ L/ W1 g( s: R7 M使用之前的文章《如何测量代码运行时间》测量延时函数是否准确。
8 _% n$ w: Q+ X; u' G3 w' C+ \& D+ R5 G9 K- A- O) Q
1 G, @4 i- V& X3 r$ }7 y; ^* W
复制代码 7 {$ \6 C: ~/ }0 K/ ]- N
如下图,延时函数精确延时,没有问题
8 |; C) p( X- _( G2 {6 u: i( ~5 |1 A+ x+ i) C$ j
' e' D/ c5 w o
+ ]% F8 S- X0 N' \, s2 s! i实现测量代码运行时长的函数接口& r. P5 Q* J$ s: b; ^) V: _9 C7 W
. a! x6 m; o$ H7 D
3 C6 ]- s4 Z( f; T2 }. @# J- //使用DWT测量函数运行时间
2 ]0 n: d* o8 f - float DTW_Time_Difference_ms(void)
7 n1 e8 V( Z3 q0 V1 l/ U - {
- o) O( a. F/ s) J* P$ o - static uint32_t old_counter;! T* g( I7 M- s0 y* F
- uint32_t counter,couter_current;) t0 ^/ i8 T' r5 O
- couter_current = DWT_TS_GET();
7 @4 _8 P4 q, _4 D, y - if(couter_current > old_counter). }. r- M( [7 R7 r2 ^# y# \
- counter = couter_current - old_counter; E8 a6 `4 o5 A' L# e
- else
# m' ]' X3 {) r - counter = couter_current + 0XFFFFFFFF - old_counter;: K/ Q! \: V+ ^) @
- old_counter = couter_current;
3 d7 S# o( v' B$ p - return (counter / (SystemCoreClock/1000));
; l: |" ?) P0 h0 Q' F* ? - }
复制代码
/ H3 q* b+ S0 o使用之前的文章《STM32延时函数的四种方法》精确延时,然后使用DWT测量延时时间。
8 j- \3 U C) F( m+ E, R
& s* L4 Q% a7 d- K* x, z# @9 N6 {- 8 R. q7 \' L9 {+ C" t! c
- delay_ms(300);//延时300ms7 \) R2 g( ~* S% L" w4 K& K
- time_ms=DTW_Time_Difference_ms();
复制代码
! L' p+ n' }% f7 l6 E/ B# H" [如下图,可以精确测量代码运行时间,没有问题。
+ ]% M0 f2 t! \ g9 G2 C7 f" K& P7 @# V
% h, }( @( S% Y; w0 [5 p( s [) U( N
05、后记
0 Y; a2 u7 A' s, b4 E* B. y本文使用DWT代替了定时器部分功能,它的优缺点如下:9 i: V- ^4 R& k7 a
4 }( m) S, u+ Y) b1、优点是:方便移植,经过测试在M3、M4、M7内核的MCU上都可以使用。
, b2 b8 K0 }: l9 S. Y) }6 |: \5 G z, q8 ~
2、缺点是:和定时器一样,都有一个延时的最大时间,测量代码运行时间的最大值。
% Y1 a4 d0 q+ ~ G$ e- [
4 |/ l, w; `- `如果项目使用MCU有空闲的定时器,且不考虑换MCU的话,我个人建议还是使用通用的定时器外设,不要使用DWT,虽然DWT方便移植,但通用定时器外设简单易懂,对于没有了解过这部分知识的小白,看到DWT的延时函数,还需要学**。
( C6 Z, _0 ~$ K' h5 w( b1 X% a g/ E8 |1 h0 K! w& g
) j( w* q0 o# @ |