YOLO без внимания: attention-детекция на FPGA
Детекция объектов в реальном времени всё чаще уезжает с серверов на край сети: на камеры, дроны, промышленные контроллеры. Там нет ни бесконечной памяти, ни мощного GPU, ни щедрого бюджета по питанию. Есть FPGA и жёсткий компромисс между точностью, скоростью и ваттами. Именно в этот компромисс и бьёт работа исследователей Suraj Karki, Qazi Arbab Ahmed и Thorsten Jungeblut.
Свежие версии YOLO обзавелись механизмами внимания, и это отлично для точности, но плохо для железа. DPU от AMD просто не умеет исполнять часть операций из этих моделей: нестандартные активации, split-операции, пространственный attention. Обычно на этом всё и заканчивается: либо модель не запускается, либо её тащат на процессор и теряют весь смысл ускорителя.
Авторы пошли другим путём и переписали модель под ограничения DPU. Неподдерживаемые активации заменены совместимыми аналогами, split-операции переложены на свёртки 1×1, а пространственное внимание аппроксимировано так, чтобы целиком лечь на ускоритель. По сути attention никуда не делся как идея, но исчез как проблема для железа.
Проверяли всё на плате Xilinx ZCU104 и на двух современных attention-версиях детектора, YOLOv26 и YOLOv11, как на обычной детекции, так и на детекции с ориентированными рамками. Модели прогнали по шести датасетам: COCO, Pascal VOC, KITTI, DOTA, DIOR-R и собственному набору для детекции присутствия человека, а также через все восемь конфигураций DPU от B512 до B4096, замеряя mAP, FPS, задержку, потребление и расход ресурсов.
Цифры показательные. Варианты YOLOv26n и YOLOv26n-OBB выдали самую высокую сквозную пропускную способность: 34,05 FPS на обычной детекции и 29,55 FPS на детекции с ориентированными рамками. Квантизация съела в среднем около 5% точности, но взамен потребление упало примерно в три раза по сравнению с текущими лучшими решениями. Для edge-сценариев, где каждый ватт на счёту, такой размен выглядит честно.
Для инженеров, кто возится с развёртыванием моделей на FPGA, здесь есть готовый рецепт: не ждать, пока архитектуру официально поддержат, а аккуратно пересобрать несовместимые блоки под возможности ускорителя. Работа показывает, что даже модные attention-блоки можно притащить на край сети без катастрофической потери точности.
Подробности и полные замеры в оригинальной статье на arXiv: https://arxiv.org/abs/2607.13106
