Design eines heterogenen FPGA-Hardwarebeschleunigers basierend auf CNN

JI Haolin ,  

XU Wei ,  

PIAO Yongjie ,  

WU Xiaobin ,  

GAO Tan ,  

摘要

Aufgrund der Beschränkungen der Rechenleistung und der Speicherressourcen der Hardwareplattform bleibt die Realisierung eines energieeffizienten und leistungsstarken Convolutional Neural Network (CNN) mittels eingebetteter Systeme eine der Haupt-Herausforderungen für Hardware-Designer. Basierend darauf schlägt dieser Artikel ein vollständiges Design eines heterogenen eingebetteten Systems vor, das auf einem feldprogrammierbaren System-on-Chip (SoC) basiert. Das Design verwendet eine kaskadierbare Eingangs-Multiplexstruktur und führt zwei unabhängige Multiply-Accumulate-Operationen in einem einzigen DSP aus, was den Zugriff auf den externen Speicher reduziert, die Systemeffizienz steigert und den Energieverbrauch senkt. Im Vergleich zu anderen Lösungen wird die Energieeffizienz um mehr als 38,7 % verbessert. Das Design (Framework) wurde erfolgreich in groß angelegten CNN-Netzwerken auf kostengünstigen Geräten eingesetzt und steigert die Energieeffizienz des Netzmodells erheblich. Die auf dem ZYNQ XC7Z045-Gerät erzielte Energieeffizienz beträgt sogar bis zu 102 Gops/W. Darüber hinaus erreicht die Bildrate bei der Inferenz der Convolutional Layer des VGG-16-Modells mit diesem Framework 10,9 fps, was deutlich zeigt, dass dieses Design die Inferenz von CNNs in energiebegrenzten Umgebungen effektiv beschleunigen kann.

关键词

Hardwarebeschleunigung; Convolutional Neural Network; FPGA; heterogenes SoC

阅读全文

以上内容由讯飞翻译自动生成,翻译内容仅供参考。对于因使用本网站翻译内容产生的相关后果,本网站不承担任何商业和法律责任。

The above content is generated by Large Model Translation. The translated content is for reference only. We do not assume any commercial or legal responsibilty for any consequences arising from the use of our website