Гибкая настройка производительности нейросетевого процессора путем параметризации архитектуры
https://doi.org/10.17586/0021-3454-2026-69-6-514-522
Аннотация
Рассматривается проблема проектирования аппаратных ускорителей для систем краевого искусственного интеллекта с учетом ограничений на используемые ресурсы. Разработана модульная параметризуемая архитектура нейросетевого процессора, которая позволяет гибко настраивать характеристики ускорителя, включая размеры вычислительных элементов и размер внутренней буферной памяти, под требования целевой системы. Эффективность полученных результатов подтверждена путем моделирования нейросетевого ускорителя на уровне регистровых передач с использованием параметров сверточного слоя нейронной сети YOLOv5s. Исследована зависимость площади кристалла от параметров архитектуры с использованием блока программируемой логики (ПЛИС) системы на кристалле ZYNQ-7000. Показано, что увеличение размеров систолического массива повышает производительность, но эффект прироста снижается при больших значениях. Масштабирование систолического массива также увеличивает количество логических элементов (LUT, Look-Up Table) и однобитных регистров (FF, Flip-Flop) ПЛИС. Увеличение объема внутренней памяти существенно влияет на потребление элементов блочной памяти (BRAM) ПЛИС, но не оказывает значительного воздействия на общую производительность. Результаты экспериментов подтвердили преимущество предложенного подхода в части адаптивности и гибкости настройки под различные сценарии применения. Перспективными областями применения являются системы, требующие высокой производительности при ограниченных ресурсах. Полученные результаты могут служить основой для разработки новых поколений нейросетевых процессоров с возможностью масштабирования производительности и учетом ограничений на ресурсы.
Об авторе
С. М. ТабунщикРоссия
Сергей Михайлович Табунщик — аспирант, факультет программной инженерии и компьютерной техники
Санкт-Петербург
Список литературы
1. Nakhle F. Shrinking the giants: Paving the way for TinyAI // Device. 2024. Vol. 2, N 8. Р. 100411. DOI:10.1016/j.device.2024.100411.
2. Gill S. S. et al. Edge AI: A taxonomy, systematic review and future directions // Cluster Computing. 2025. Vol. 28, N 1. Р. 1–53.
3. Chen Y. H. et al. Eyeriss: An energy-efficient reconfigurable accelerator for deep convolutional neural networks // IEEE Journal of Solid-State Circuits. 2016. Vol. 52, N 1. Р. 127–138.
4. Chen Y. H. et al. Eyeriss v2: A flexible accelerator for emerging deep neural networks on mobile devices // IEEE Journal on Emerging and Selected Topics in Circuits and Systems. 2019. Vol. 9, N 2. Р. 292–308.
5. Moons B. et al. 14.5 envision: A 0.26-to-10tops/w subword-parallel dynamic-voltage-accuracy-frequency-scalable convolutional neural network processor in 28nm fdsoi // 2017 IEEE Intern. Solid-State Circuits Conf. (ISSCC). IEEE, 2017. Р. 246–247.
6. Yin S. et al. A high energy efficient reconfigurable hybrid neural network processor for deep learning applications // IEEE Journal of Solid-State Circuits. 2017. Vol. 53, N 4. Р. 968–982.
7. Jouppi N. P. et al. In-datacenter performance analysis of a tensor processing unit // Proc. of the 44th Ann. Intern. Symp. on Computer Architecture. 2017. Р. 1–12.
8. Jouppi N. P. et al. A domain-specific supercomputer for training deep neural networks // Communications of the ACM. 2020. Vol. 63, N 7. Р. 67–78.
9. Jouppi N. et al. Tpu v4: An optically reconfigurable supercomputer for machine learning with hardware support for embeddings // Proc. of the 50th Ann. Intern. Symp. on Computer Architecture. 2023. Р. 1–14.
10. Chatha K. Qualcomm® cloud Al 100: 12TOPS/W scalable, high performance and low latency deep learning inference accelerator // 2021 IEEE Hot Chips 33 Symposium (HCS). IEEE, 2021. Р. 1–19.
11. Li Y. et al. Ascend: A scalable and energy-efficient deep neural network accelerator with photonic interconnects // IEEE Transactions on Circuits and Systems I: Regular Papers. 2022. Vol. 69, N 7. Р. 2730–2741.
12. Tabunshchik S., Bykovskii S., Kustarev P. Neural processor microarchitecture design for CNN processing acceleration // Optoelectronic Imaging and Multimedia Technology XI. SPIE, 2024. Vol. 13239. Р. 141–149.
13. Peddawad C. et al. Matrix-matrix multiplication using systolic array architecture in bluespec // CS6230: CAD for VLSI. 2015. Vol. 1, N 8.
14. Yu K. et al. MobileNet-YOLO v5s: An improved lightweight method for real-time detection of sugarcane stem nodes in complex natural environments // IEEE Access. 2023. Vol. 11. Р. 104070–104083.
15. Khan A. et al. A survey of the recent architectures of deep convolutional neural networks // Artificial Intelligence Review. 2020. Vol. 53, N 8. Р. 5455–5516.
Рецензия
Для цитирования:
Табунщик С.М. Гибкая настройка производительности нейросетевого процессора путем параметризации архитектуры. Известия высших учебных заведений. Приборостроение. 2026;69(6):514-522. https://doi.org/10.17586/0021-3454-2026-69-6-514-522
For citation:
Tabunshchik S.M. Flexible tuning of neural network processor performance by parametrizing the architecture. Journal of Instrument Engineering. 2026;69(6):514-522. (In Russ.) https://doi.org/10.17586/0021-3454-2026-69-6-514-522
JATS XML














