摘要:尽管CNN经剪枝及ReLU激活后具有显著稀疏性可提升推理效率,但稀疏分布不规则易导致负载不均衡。此外,卷积与池化串行执行造成的访存带宽浪费限制了性能。为解决以上问题,提出一种稀疏CNN加速算法和卷积池化融合方法,并在寒武纪MLU上进行了验证。首先,设计基于CSR格式的自适应SpMV算法AdaSpConv,通过动态任务分配有效解决核心间负载均衡问题;其次,提出CSR-CP存储格式实现卷积与池化的算子融合,减少数据搬运并显著降低访存延迟。实验结果表明,在MLU370-S4平台上,AdaSpConv峰值性能达0.828 GFLOP/s,有效访存带宽达3.39 GB/s,性能显著优于Scalar、Vector及Adaptive算法;基于CSR-CP存储格式,VGG-16和ResNet-50的卷积运算较传统方法分别加速2.87倍和1.99倍。
摘要:量子近似优化算法(QAOA)在物理部署前需经含噪预训练以获取抗噪初始参数,但传统含噪模拟的计算复杂度随电路规模呈指数膨胀,导致严峻的算力瓶颈。提出基于置信度自适应截断的QAOA含噪预训练算法。该算法构建量子电路演化的解析概率模型,将全局噪声空间重构为结构化加权树;进而设计以统计学置信度为边界约束的动态剪枝机制,安全截断长尾低概率错误路径。实验表明,在保障评估置信度的前提下,算法将单步模拟复杂度由指数级降至常量级,大幅压缩了不同量子比特规模下的算力开销。结合动态置信度调度策略,算法在计算成本与参数收敛质量之间实现平衡,为大规模变分量子算法的高效预训练提供了工程可行的加速框架。
摘要:长程静电相互作用的高效求解是分子动力学(Molecular Dynamics, MD)模拟中的关键问题,特别是在带电体系中对计算性能影响显著。Ewald算法适用于中小规模体系与高精度场景。基于ARM架构,对Ewald算法进行了系统优化,包括线性化重构关键数据结构、倒易空间计算的手动向量化、向量化版本的三角函数、优化线程并行策略等方案。实验结果显示,在单核条件下,实现约2.65倍加速,并在不同精度设置及跨平台测试中保持良好性能提升。在多核条件下,相较原生OpenMP实现,优化版本表现出更优的扩展效率与整体性能,在8线程时可以达到86.2%的效率和4.57倍的加速。研究验证了Ewald算法在新型向量化架构上的优化潜力,为相关算法在相关处理器上的高效实现提供了参考。