This thread has been locked.

If you have a related question, please click the "Ask a related question" button in the top right corner. The newly created question will be automatically linked to this question.

[参考译文] TDA4VH-Q1:双精度数学运算的 R5F 与 C7100 与 C6678 与 A72 性能比较

Guru**** 2933120 points
请注意,本文内容源自机器翻译,可能存在语法或其它翻译错误,仅供参考。如需获取准确内容,请参阅链接中的英语原文或自行翻译。

https://e2e.ti.com/support/processors-group/processors/f/processors-forum/1646167/tda4vh-q1-r5f-vs-c7100-vs-c6678-vs-a72-performance-comparison-for-math-operations-in-double-precision

器件型号: TDA4VH-Q1

您好、

作为以下 TI E2E 主题中所讨论问题的后续行动:

TI E2E 论坛主题

您是否还能为 以下内核上的非矢量化标量双精度算术运算提供一些性能指标或相对性能期望?

  • C6678 (C66x DSP)
  • C7120/C71x DSP
  • Cortex-R5F
  • Cortex-A72

更具体地说、我指的是普通标量 FP64 运算、例如:

  • 加/减
  • 倍增
  • 除以
  • 依赖重运算链
  • 无法有效矢量化的小循环计算

在此类工作负载中、在 C6678 和 C7120/C71x 内核之间观察到类似性能是否正常?

由于 C71x 架构似乎通过 SIMD /矢量处理和高吞吐量并行性实现了主要性能增益、因此我希望更好地了解矢量化无效的标量双精度工作负载的预期行为。

此致

  • 请注意,本文内容源自机器翻译,可能存在语法或其它翻译错误,仅供参考。如需获取准确内容,请参阅链接中的英语原文或自行翻译。

    您好、

    在此类工作负载中、观察 C6678 和 C7120/C71x 内核之间的类似性能是否正常?

    是的、您可以观察到、对于不可矢量化的标量 FP64 代码、C7x/C71x 和 C66x 具有类似的标量问题宽度、因此相同 1GHz 下的周期数是相当的。 C7x 的标题 GFLOPS 优势来自其 512 位 SIMD 和 MMA、这两者都不在小型依赖型高链上有效、因此它们处于空闲状态。

    您还可以参考以下线程:TDA4VH-Q1:C7x DSPLIB SVD 性能比在 A72 上运行要差得多
     
    https://e2e.ti.com/support/processors-group/processors/f/processors-forum/1228994/tda4vh-q1-performance-gain-when-using-c7x-instead-of-c66x-dsp-for-non-ti-optimized-code?

    A72 是速度最快的、因为它以更高的时钟运行、无序执行指令、并且有两个完全流水线型 FP 单元。
    C71x 和 C66x 在此处的性能类似、因为 C71x 的主要优势在于其向量单元、当无法矢量化代码时、仅使用标量侧、这在两个 DSP 上都是相当的。R5F 是最慢的、因为其 FPU 以主要非流水线型多周期的方式处理双精度运算。
    我将分享时钟频率的详细信息:

    磁芯 十分之一
    A72 2.0GHz
    C7x (C71x) 1.0GHz
    C66x   1.0GHz 至 1.35GHz  
    R5F 1.0GHz


    此致、
    Shabary S Sundar