Preview

Известия высших учебных заведений. Приборостроение

Расширенный поиск
Доступ открыт Открытый доступ  Доступ закрыт Только для подписчиков

Гибкая настройка производительности нейросетевого процессора путем параметризации архитектуры

https://doi.org/10.17586/0021-3454-2026-69-6-514-522

Аннотация

Рассматривается проблема проектирования аппаратных ускорителей для систем краевого искусственного интеллекта с учетом ограничений на используемые ресурсы. Разработана модульная параметризуемая архитектура нейросетевого процессора, которая позволяет гибко настраивать характеристики ускорителя, включая размеры вычислительных элементов и размер внутренней буферной памяти, под требования целевой системы. Эффективность полученных результатов подтверждена путем моделирования нейросетевого ускорителя на уровне регистровых передач с использованием параметров сверточного слоя нейронной сети YOLOv5s. Исследована зависимость площади кристалла от параметров архитектуры с использованием блока программируемой логики (ПЛИС) системы на кристалле ZYNQ-7000. Показано, что увеличение размеров систолического массива повышает производительность, но эффект прироста снижается при больших значениях. Масштабирование систолического массива также увеличивает количество логических элементов (LUT, Look-Up Table) и однобитных регистров (FF, Flip-Flop) ПЛИС. Увеличение объема внутренней памяти существенно влияет на потребление элементов блочной памяти (BRAM) ПЛИС, но не оказывает значительного воздействия на общую производительность. Результаты экспериментов подтвердили преимущество предложенного подхода в части адаптивности и гибкости настройки под различные сценарии применения. Перспективными областями применения являются системы, требующие высокой производительности при ограниченных ресурсах. Полученные результаты могут служить основой для разработки новых поколений нейросетевых процессоров с возможностью масштабирования производительности и учетом ограничений на ресурсы.

Об авторе

С. М. Табунщик
Университет ИТМО
Россия

Сергей Михайлович Табунщик — аспирант, факультет программной инженерии и компьютерной техники

Санкт-Петербург



Список литературы

1. Nakhle F. Shrinking the giants: Paving the way for TinyAI // Device. 2024. Vol. 2, N 8. Р. 100411. DOI:10.1016/j.device.2024.100411.

2. Gill S. S. et al. Edge AI: A taxonomy, systematic review and future directions // Cluster Computing. 2025. Vol. 28, N 1. Р. 1–53.

3. Chen Y. H. et al. Eyeriss: An energy-efficient reconfigurable accelerator for deep convolutional neural networks // IEEE Journal of Solid-State Circuits. 2016. Vol. 52, N 1. Р. 127–138.

4. Chen Y. H. et al. Eyeriss v2: A flexible accelerator for emerging deep neural networks on mobile devices // IEEE Journal on Emerging and Selected Topics in Circuits and Systems. 2019. Vol. 9, N 2. Р. 292–308.

5. Moons B. et al. 14.5 envision: A 0.26-to-10tops/w subword-parallel dynamic-voltage-accuracy-frequency-scalable convolutional neural network processor in 28nm fdsoi // 2017 IEEE Intern. Solid-State Circuits Conf. (ISSCC). IEEE, 2017. Р. 246–247.

6. Yin S. et al. A high energy efficient reconfigurable hybrid neural network processor for deep learning applications // IEEE Journal of Solid-State Circuits. 2017. Vol. 53, N 4. Р. 968–982.

7. Jouppi N. P. et al. In-datacenter performance analysis of a tensor processing unit // Proc. of the 44th Ann. Intern. Symp. on Computer Architecture. 2017. Р. 1–12.

8. Jouppi N. P. et al. A domain-specific supercomputer for training deep neural networks // Communications of the ACM. 2020. Vol. 63, N 7. Р. 67–78.

9. Jouppi N. et al. Tpu v4: An optically reconfigurable supercomputer for machine learning with hardware support for embeddings // Proc. of the 50th Ann. Intern. Symp. on Computer Architecture. 2023. Р. 1–14.

10. Chatha K. Qualcomm® cloud Al 100: 12TOPS/W scalable, high performance and low latency deep learning inference accelerator // 2021 IEEE Hot Chips 33 Symposium (HCS). IEEE, 2021. Р. 1–19.

11. Li Y. et al. Ascend: A scalable and energy-efficient deep neural network accelerator with photonic interconnects // IEEE Transactions on Circuits and Systems I: Regular Papers. 2022. Vol. 69, N 7. Р. 2730–2741.

12. Tabunshchik S., Bykovskii S., Kustarev P. Neural processor microarchitecture design for CNN processing acceleration // Optoelectronic Imaging and Multimedia Technology XI. SPIE, 2024. Vol. 13239. Р. 141–149.

13. Peddawad C. et al. Matrix-matrix multiplication using systolic array architecture in bluespec // CS6230: CAD for VLSI. 2015. Vol. 1, N 8.

14. Yu K. et al. MobileNet-YOLO v5s: An improved lightweight method for real-time detection of sugarcane stem nodes in complex natural environments // IEEE Access. 2023. Vol. 11. Р. 104070–104083.

15. Khan A. et al. A survey of the recent architectures of deep convolutional neural networks // Artificial Intelligence Review. 2020. Vol. 53, N 8. Р. 5455–5516.


Рецензия

Для цитирования:


Табунщик С.М. Гибкая настройка производительности нейросетевого процессора путем параметризации архитектуры. Известия высших учебных заведений. Приборостроение. 2026;69(6):514-522. https://doi.org/10.17586/0021-3454-2026-69-6-514-522

For citation:


Tabunshchik S.M. Flexible tuning of neural network processor performance by parametrizing the architecture. Journal of Instrument Engineering. 2026;69(6):514-522. (In Russ.) https://doi.org/10.17586/0021-3454-2026-69-6-514-522

Просмотров: 146

JATS XML

ISSN 0021-3454 (Print)
ISSN 2500-0381 (Online)