EdigE
← ЛЕНТА

SAR-кадр очистили от спекла и сжали на FPGA в одном контуре

Спекл в SAR выглядит как зерно на фотографии, хотя рождается из вполне реальной интерференции отражений внутри одного радиолокационного пикселя. Его нельзя просто выбросить фильтром без риска стереть полезную структуру. Одновременно спутнику приходится решать другую задачу: передать на Землю гораздо меньше данных, сохранив картину сцены пригодной для анализа. В работе Cédric Léonard, Francescopaolo Sica и Martin Schulz эти две операции связали в один обученный конвейер и довели до исполнения на плате AMD/Xilinx ZCU102.

Сеть принимает патчи уже сфокусированного комплексного SAR-изображения SLC. Анализирующие и синтезирующие преобразования, а также гиперприор исполняются тремя ядрами DPUCZDX8G B4096 на 300 MHz. Арифметика DPU ограничена int8 и набором разрешённых операторов, поэтому перенос потребовал переделать саму сеть. GDN — привычную для learned compression нормализацию — заменили на ReLU. Transposed convolution перестроили с ядра 5×5 на 4×4 и изменили padding. Битовый энтропийный кодек вынесен на Cortex-A53: такой расклад превращает FPGA в вычислительный тракт признаков, а ARM — в последовательный участок упаковки потока.

Замена GDN дала результат, который трудно предсказать по обычным бенчмаркам нейросетевого сжатия. Для варианта ResSH при λ=1000 ReLU прибавила 1.67 ± 0.10 dB по метрике качества и увеличила скорость 0.26 ± 0.07 bpp. Авторы связывают это с природой SAR-данных и своей архитектурой; переносить вывод на любые изображения или кодеки оснований нет. Зато абляция хорошо показывает смысл hardware-aware проектирования: совместимость с железом иногда открывает более удачный режим самой модели.

Ещё нагляднее цена residual-блоков. Полный inference облегчённой SH-модели требует 15.70 GOP на патч 256×256, а ResSH — 156.68 GOP. При λ=1000 выигрыш ResSH над SH составил лишь 0.75 ± 0.31 dB. Для бортового тракта это конкретный аргумент против автоматического наращивания архитектуры: десятикратный рост работы DPU может купить доли децибела.

В сценарии только сжатия FPGA обработала патч SH за 29.1 ms, затратив 284.6 mJ; для ResSH получились 61.4 ms и 782.5 mJ. RTX A4000 в авторском сравнении завершала вычисление быстрее, ZCU102 расходовала меньше энергии на патч. Питание платы измеряли через 18 INA226 и три PMBus-линии, вычитая десятисекундный idle baseline. Это авторская методика, поэтому числа пока нельзя считать независимой репликацией или универсальным рейтингом GPU и FPGA.

До готовой спутниковой обработки здесь остаётся заметный участок пути. Входом служит focused SLC, значит сырые эхо-сигналы потребуют отдельного бортового фокусатора. Авторы также не измеряли непрерывный full-tile streaming: оценка для тайла TerraSAR-X построена по 11 000 перекрывающихся патчей и не включает планирование памяти между ними. Но опубликованный MIT-код уже содержит обучение, post-training quantization, компиляцию Vitis AI, C++-inference на плате и журнал измерений. Для инженера ценность работы именно в этой цепочке: SAR-сеть перестаёт быть картинкой из статьи и становится набором проверяемых решений от оператора свёртки до токового шунта на рельсе питания.

CedricLeon / SAR_DDC_FPGA contributors

### Источники

[arXiv:2608.11271 — Hardware-Aware Deployment of Joint SAR Compression and Despeckling on FPGA](arXiv:2608.11271)

[Репозиторий SAR_DDC_FPGA](https://github.com/CedricLeon/SAR_DDC_FPGA)

[Методика FPGA benchmark и измерений питания](https://github.com/CedricLeon/SAR_DDC_FPGA/blob/main/docs/FPGA_benchmark.md)