地平线静态目标检测 MapTR 参考算法-V1.0

最新推荐文章于 2025-12-05 10:55:08 发布

原创

最新推荐文章于 2025-12-05 10:55:08 发布 · 1.6k 阅读

10 ·

CC 4.0 BY-SA版权

文章标签：

#目标检测 #算法 #人工智能 #自动驾驶

简介

高清地图是自动驾驶系统的重要组件，提供精确的驾驶环境信息和道路语义信息。传统离线地图构建方法成本高，维护复杂，使得依赖车载传感器的实时感知建图成为新趋势。早期实时建图方法存在局限性，如处理复杂地图元素的能力不足、缺乏实例级信息等，在实时性和后处理复杂度上存在挑战。

为了解决这些问题，基于 Transformer 的 MapTR 模型被提出，它采用端到端结构，仅使用图像数据就能实现高精度建图，同时保证实时性和鲁棒性。MapTRv2 在此基础上增加了新特性，进一步提升了建图精度和性能。

地平线面向智驾场景推出的征程6 系列（J6）芯片，在提供强大算力的同时带来了极致的性价比，征程6 芯片对于 Transformer 模型的高效支持助力了 MapTR 系列模型的端侧部署。本文将详细介绍地平线算法工具链在征程6 芯片部署 MapTR 系列模型所做的优化以及模型端侧的表现。

性能精度指标

模型配置：

模型数据集

性能精度表现：

预测的地图元素：“divider”，“ped_crossing”，“boundary”；

默认使用 Lidar 坐标系，和公版保持一致。同时适配 ego 坐标系；

量化配置 TopK：前 K 个量化敏感的算子。

公版模型介绍

MapTR

在这里插入图片描述

MapTR 模型的默认输入是车载摄像头采集到的 6 张相同分辨率的环视图像，使用 nuScenes 数据集，同时也支持拓展为多模态输入例如雷达点云。模型输出是矢量化的地图元素信息，其中地图元素为人行横道、车道分隔线和道路边界 3 种。模型主体采用 encoder-decoder 的端到端结构：

Map Encoder 通过 CNN Backbone+BEV Encoder 负责提取 2D 图像特征并转换到统一的 BEV 视角。MapTR-nano 默认使用 ResNet18 作为 Backbone，MapTR-tiny 默认使用 ResNet50。MapTR 兼容多种 BEV Encoder 实现方式例如 GKT、LSS 和 IPM 等并且表现稳定，鉴于 GKT 的部署高效性以及在消融实验中的精度表现更好，公版 MapTR 使用 GKT 作为默认 BEV Encoder 实现方式。
Map Decoder 采用 Hierarchical Query Embedding Scheme，即从 point-level（位置）和 instance-level（轮廓）显式地编码地图元素，point-level queries 被所有 instances 共享并融合进 instance-level queries 从而生成 hierarchical queries，hierarchical queries 经过级联的 decoder layers（默认是 6 层）不断更新。每个 decoder layer 首先使用多头自注意力（MHSA）做 inter-instance 和 intra-instance 的信息交互，接着会使用 Deformable Attention 来与 Map Encoder 输出的 BEV 特征做信息交互。point-level 的信息被所有 instance 共享，所以对于每个 instance 而言，映射到 BEV 空间的多个参考点 reference points 是灵活且动态分布的，这对于提取 long-range context information 预测随机形状的地图元素是有益的。
MapTR Head 由分类分支和回归分支构成。分类分支预测 instances 的类别，回归分支预测 points 集合的位置。Head 输出的预测值和真值 GT 之间采用 Hierarchical Bipartite Matching 实现监督学习，分为 Instance-level Matching 和 Point-level Matching，因此损失函数为三个部分的加权和：分类 Classification Loss、点对点位置 Point2point Loss 和连接边方向 Edge Direction Loss。

MapTRv2

在这里插入图片描述

MapTRv2 在 MapTR 的基础上增加了新的特性：

针对层次化 query，引入解耦自注意力，极大地减少了计算量和显存消耗；对于和输入特征交互的 cross-attention 部分，则引入了 BEV、PV 和 BEV+PV 三种变体；
引入辅助 one-to-many 集合预测分支，增加了正样本数，加速了训练收敛；
引入辅助 dense supervision，引入深度估计预测头、PV 和 BEV 视角下的分割头，进一步提升模