EdigE
← ЛЕНТА
FPGA · 15.07.2026

VectorBlox 3.0: PolarFire FPGA научили пропускать нулевые операции в разреженных нейросетях

Нулевые веса в CNN могут перестать занимать такты матричного вычислителя и трафик внешней памяти: Microchip добавила такую обработку в VectorBlox 3.0 для PolarFire FPGA и PolarFire SoC. Ускоритель работает с разреженным представлением весов, где для неструктурированной разреженности сохраняются ненулевые коэффициенты и их индексы. Почтий выигрыш будет определяться плотностью сети и ценой декодирования этих индексов.

Microchip 14 июля 2026 года представила VectorBlox 3.0 SDK и CoreVectorBlox IP для развёртывания свёрточных сетей на PolarFire FPGA и PolarFire SoC. Главная техническая новинка релиза — обработка sparse neural networks с пропуском операций, связанных с нулевыми значениями. Компания связывает этот режим со снижением вычислительной нагрузки, обращений к памяти и энергопотребления при inference.

Разреженность полезна для FPGA-ускорителя только при наличии соответствующего формата данных и логики обхода. В неструктурированном варианте VectorBlox хранит ненулевые веса вместе с их индексами. Объём весового массива уменьшается, однако в поток данных добавляются координаты, а вычислитель должен восстанавливать позицию коэффициента в свёртке. Реальный эффект зависит от доли нулей, разрядности индексов, размера блоков и того, удаётся ли удержать последовательный доступ к DDR. При умеренной sparsity индексный поток способен съесть заметную часть выигрыша от сжатия.

SDK также поддерживает structured compression. Этот вариант удаляет веса группами — например, каналами либо регулярными блоками. Представление становится проще для аппаратного планировщика, адресация регулярнее, а загрузка массивов PE предсказуемее. Платой становится более жёсткое ограничение на pruning модели: структурированное прореживание может сильнее повлиять на точность при той же доле удалённых параметров.

CoreVectorBlox реализован как overlay для программируемой логики. В состав входят матричный и векторный процессоры, а также CNN-ускоритель; доступ к памяти организован через AXI4 master шириной от 64 до 256 бит, управление ведётся через AXI4-Lite. Такая схема отделяет развёртывание очередной сети от нового синтеза FPGA: доступно переключение сетей во время работы и time-slicing одного вычислительного ядра между задачами. Для камерных систем Microchip указывает опорные конфигурации с MIPI CSI-2, ISP и HDMI, а веса и исполняемые образы могут размещаться в SPI Flash и DDR. Рабочий поток использует INT8-квантизацию, поэтому ограничение точности задаётся ещё до оценки пользы от sparsity.

Microchip вынесла формулировку «до 2× быстрее» в название технического вебинара по VectorBlox 3.0. Открытая документация пока не содержит сопоставимой таблицы с моделью CNN, степенью разреженности, частотой FPGA, латентностью, мощностью и точностью до и после pruning. Поэтому двукратный результат следует трактовать как заявленный потолок для подходящих сетей, а не характеристику любой CNN на PolarFire.

Платформа уже имеет космический контекст. Planetek подтверждала использование PolarFire SoC и VectorBlox acceleration IP на ранних миссиях AI-eXpress в 2025 году и продолжающуюся характеризацию для бортовых вычислений с требованиями к радиационной стойкости. Для такого применения пропуск нулевых коэффициентов интересен прежде всего сокращением памяти и трафика: именно они часто задают энергобюджет обработки снимка на борту. SDK распространяется бесплатно, а CoreVectorBlox требует регистрации бесплатной лицензии в Libero SoC Design Suite.