前言bev鸟瞰图模型 、 classification分类模型、 detection检测模型、disparity_pred深度估计模型、multitask多任务模型、online_map在线建图模型、opticalflow光流模型、segmentation分割模型、tracking追踪模型、traj_pred轨迹预测等BEV鸟瞰图模型1. 视图转换类CNN 基LSSLift-Splat-ShootBEV 感知开山之作。先从多视图图像预测深度分布将 2D 特征 “提升” 为 3D 体素再 “散开” 到 BEV 空间最后通过卷积 “射击” 生成 BEV 特征。✅ 优点原理清晰、稳定、工程友好❌ 缺点深度估计误差直接影响投影精度。BEVDet基于 LSS 的检测专用框架分 v1/v2/v3 系列适配不同算力。✅ 优点部署成熟、支持多任务头❌ 缺点时序融合弱于 Transformer 类。BEVDepth改进 LSS 深度估计显式建模深度不确定性提升远距小目标表现。✅ 优点纯视觉下精度提升明显❌ 缺点深度分支训练成本略高。2. Query 类Transformer 基BEVFormer标杆性 Query 模型。在 BEV 空间预设 Query通过变形注意力Deformable Attention从多视图图像中稀疏采样聚合特征天然支持时序融合。✅ 优点时序感知强、多任务统一、精度领先❌ 缺点算力高于 CNN 类部署需优化。BEVFormerV2升级版增强主干网络监督与数据增强提升收敛速度与精度。✅ 优点适配大规模数据支持多模态❌ 缺点训练资源需求更高。DETR3D将 3D 检测视为集合预测直接从 BEV Query 生成 3D 框端到端训练。✅ 优点无锚框设计适合复杂场景❌ 缺点收敛慢算力消耗大。3. 多传感器融合类BEVFusion统一 BEV 空间将相机与激光雷达特征对齐后融合。分特征级融合主流与点云 - 图像级融合支持动态权重分配。✅ 优点鲁棒性强雨天 / 遮挡表现好❌ 缺点激光雷达硬件成本高。Sparse4D稀疏张量 原始数据前融合端到端训练提升融合效率。✅ 优点计算量低、实时性强❌ 缺点工程实现复杂。BEV-SAN空间自适应注意力融合为 BEV 每个位置动态分配相机 / 激光权重。✅ 优点场景自适应强解决固定权重泛化差问题❌ 缺点推理略慢。4. 4D 占用 / 端到端类Occ-BEVBEV 占用预测输出 3D 体素占据网格支持语义与实例分割。✅ 优点支持异形物体、长尾场景❌ 缺点体素化计算量大。Tesla Occupancy Network特斯拉量产方案基于 BEVTransformer 预测体素占用替代传统 3D 检测。✅ 优点全链路高效、适配高阶智驾❌ 缺点依赖车载大算力平台。UniAD端到端模型将感知、预测、规划统一为单网络。✅ 优点减少模块延迟响应速度快❌ 缺点训练与调试复杂。选型建议按场景纯视觉量产优先LSS/BEVDet稳定易部署追求精度可选BEVDepth或BEVFormer轻量化版。城市复杂路况选BEVFormer/BEVFormerV2时序融合强或BEVFusion多模态鲁棒。高阶智驾激光雷达选BEVFusion特征级融合或Sparse4D稀疏高效。精细场景理解选Occ-BEV/Tesla Occupancy体素占用。成本敏感优先LSS/BEVDet纯视觉 CNN 类搭配轻量化骨干与量化。2025–2026 前沿方向稀疏与高效SparseBEV、Sparse4D全稀疏架构兼顾精度与实时性。Mamba 替代 TransformerMambaBEV用 SSM 替代注意力降低算力与内存。端到端一体化UniAD、XNet 2.0感知→预测→规划单网络。自监督 / 弱监督SelfBEV、WeakBEV降低标注成本实车数据闭环。Classification分类模型1、经典 CNN 分类模型LeNet最早的卷积分类网络手写数字识别。AlexNet开启深度学习热潮双 GPU、ReLU、Dropout。VGGNetVGG16 / VGG19结构简单、全 3×3 卷积非常稳定适合小数据集。GoogLeNet / Inceptionv1–v4多尺度卷积、1×1 降维计算效率高。ResNet18/34/50/101/152残差连接解决深层训练难最通用、最常用。ResNeXt分组卷积精度更高参量可控。DenseNet密集连接特征复用小模型效果好。MobileNetv1/v2/v3深度可分离卷积移动端 / 边缘端首选。ShuffleNet通道洗牌超轻量模型。EfficientNetB0–B7自动搜索最优宽度 / 深度 / 分辨率精度极高。ConvNeXt纯 CNN 对标 Transformer精度强、好训练。2、Transformer 分类模型ViTVision Transformer纯 Transformer 做分类里程碑。Swin Transformer分层窗口注意力通用强、下游任务无敌。DeiT蒸馏版 ViT训练更稳、更快。T2T-ViT渐进式 Token 化小数据也能用。PVT / PVTv2金字塔 ViT适合检测 / 分割。CrossViT多尺度分支交叉注意力。3、轻量高效适合部署 / 量化MobileOneMobileViTEfficientNet-LiteRepVGG重参数化训练多分支推理单路MobileDenseShuffleNetV24、2025–2026 最新主流Mamba / VMamba视觉状态空间模型速度快MetaFormerPoolFormer、ConvFormerEdgeNeXtMobileSAM 配套轻量分类头5、最简单直接的选型建议通用稳定ResNet50高精度EfficientNetB4 / Swin-T移动端 / 嵌入式MobileNetV3 / MobileViT科研 SOTAConvNeXt / Swin Transformer超快推理RepVGG / MobileOne检测模型1、两阶段检测精度高速度慢Faster R-CNN两阶段标杆RPN 检测头Mask R-CNN检测 分割一起做Cascade R-CNN级联检测框大幅提升 APLibra R-CNN平衡特征小目标更强2、单阶段检测速度快工程首选Anchor-basedSSD多尺度检测经典RetinaNet解决正负样本不平衡精度很高YOLOv3 / YOLOv4工业界曾经的王者Anchor-freeFCOS全卷积 anchor-free稳定好用CenterNet基于关键点简单干净3、YOLO 全家桶最主流、最实用YOLOv5工程部署最多YOLOv6美团速度精度均衡YOLOv7YOLOv8目前最通用、最易用YOLOv9YOLOv10极致速度YOLOv11最新 SOTAYOLO-World开放词汇检测4、Transformer 检测SOTA 精度DETR端到端检测去掉 NMSDeformable DETR可变形注意力速度快很多DINO目前 DETR 系列最强Swin Transformer 检测头通用强基线5、轻量化检测边缘 / 嵌入式 / 量化YOLOv8-n/s/mMobileNet-SSDMobileDetsPP-YOLOE百度飞桨轻量YOLO-Pose姿态 检测轻量6、3D / BEV 检测自动驾驶BEVDetBEVFormerDETR3DFCOS3DCenterPoint激光雷达7、最简单直接选型直接照抄通用项目、快速落地YOLOv8 / YOLOv11高精度、不计速度Cascade R-CNN / DINO边缘端、量化部署YOLOv8-n/s / MobileDets自动驾驶、BEVBEVFormer / BEVDet激光雷达 3D 检测CenterPoint分割模型按语义分割 / 实例分割 / 全景分割 / 轻量分割 / 3D/BEV 分割分。1、语义分割Semantic Segmentation给每个像素分类别道路、人、车、天空等FCN分割开山之作U-Net / U-Net医学影像、小数据必备DeepLabv3 / DeepLabv3空洞卷积 ASPP精度高、稳定PSPNet金字塔池化场景理解强SegFormerTransformer 轻量化又快又准SegNext精度超 SegFormer更好训HRNet高分辨率保持细节强2、实例分割Instance Segmentation把每个物体单独抠出来每个人、每辆车Mask R-CNN经典、通用、稳定SOLO / SOLOv2速度快anchor-freeCondInst动态卷积实例分割轻量化YOLACT / YOLACT实时实例分割3、全景分割Panoptic Segmentation语义 实例一起做东西 StuffPanoptic FPNMask2Former一个模型搞定分割全任务SOTAOneFormer通用大一统分割4、实时 / 轻量分割边缘、量化、移动端BiSeNet / BiSeNetV2超实时城市道路分割MobileSegMobileOne-SegPP-LiteSeg百度飞桨YOLOv8-seg工程最方便开箱即用5、自动驾驶 / BEV 分割BEVSegBEVFormer 分割头Occ-BEV占用网格SurroundOccSimpleOccupancy6、直接给你最强选型照抄就行医学影像U-Net通用语义分割SegFormer / SegNext工程快速落地YOLOv8-seg自动驾驶道路分割BiSeNetV2 / DeepLabv3全景 / 多任务一体Mask2Former边缘端 量化MobileSeg / BiSeNetV2BEV / 占用预测BEVFormer / Occ-BEVdisparity /depth 预测深度估计模型分双目视差disparity、单目深度depth、实时 / 轻量 / 可量化三类1、双目视差 Disparity 模型输出 disparity这类模型专门做双目匹配 → 视差图最适合disparity_pred。GC-Net早期经典 3D 卷积视差估计PSMNet金字塔 空间池化高精度标杆GA-Net引导聚合精度更高GwcNet分组相关卷积比 PSM 更快更准CFNet相关场滤波实时性好RAF-Stereo迭代 refine精度 SOTAStereoNet轻量双目适合边缘部署AnyNet任意分辨率 / 实时双目MobileStereoNet移动端轻量化视差模型2、单目深度估计模型输出 depth map不做 disparity直接输出深度值但很多结构可改输出视差。Monodepth / Monodepth2自监督单目深度最经典DPT (Depth Prediction Transformer)ViT 深度预测精度很高AdaBins分箱预测深度SOTADepthAnything超强通用单目深度工业实用Metric3D可输出米级绝对深度GLPN轻量 Transformer 深度模型3、实时 / 轻量 / 可量化模型适合 OpenExplorer 量化适合INT8 量化、BPU / 嵌入式部署StereoNetMobileStereoNetAnyNetCFNetLite-MonoMobileDepth4、最优路线高精度PSMNet / GwcNet / RAF-Stereo工程 / 量化友好StereoNet / MobileStereoNet最简单快速AnyNetmultitask多任务模型1、通用多任务架构Backbone 多任务头最常见一个主干多个检测 / 分割 / 深度 / 分类头。Multi-task CNNResNet 多分支HRNet Multi-head高分辨率适合分割 关键点ResNet / ResNeXt 多任务头Swin Transformer Multi-task Heads2、自动驾驶 / BEV 多任务最常用BEVFormer检测 分割 轨迹 占用 一网络搞定BEVDet3D 检测 语义分割BEVFusion多模态 多任务统一UniAD端到端感知→预测→规划Occ-BEV3D 检测 占用网格 语义PETR / PETRv2BEV 多任务、时序融合3、2D 视觉多任务检测 分割 深度 关键点Mask R-CNN检测 实例分割Panoptic FPN全景分割语义 实例YOLOv8/YOLOv11 multi-task检测 分割 姿态 分类OneFormer / Mask2Former大一统分割语义 / 实例 / 全景MTI-Net检测 深度 分割DPT-MultiTaskTransformer 多任务深度 分割4、轻量多任务适合量化、边缘、OpenExplorerBiSeNet 多任务头MobileNet Multi-taskMobileViT 多分支PP-YOLOE 多任务YOLO-Pose Seg检测 姿态 分割5、多任务训练范式决定你怎么训Hard Parameter Sharing主干共享分支独立最常用、最快Soft Parameter Sharing各任务有独立 backbone互相正则Attention-based FusionBEVFormer、Mask2Former 这种Multi-scale Feature FusionFPN、PAN 结构6、最强落地选型照抄自动驾驶 BEV 多任务BEVFormer / BEVFusion2D 检测 分割 姿态YOLOv8 / YOLOv11 multi-task高精度分割全家桶Mask2Former / OneFormer边缘 / 量化 / 低算力MobileNet 多任务头 / BiSeNet端到端智驾UniAD多个个任务一起做比如检测 分割检测 深度视差disparityBEV 3D 检测 语义分割opticalflow光流模型1、深度学习光流模型最常用1. 经典高精度FlowNet / FlowNet2光流深度学习开山精度一般速度慢。PWC-Net金字塔 代价体积轻量化、精度高、工业最常用。RAFT迭代优化目前精度天花板非常稳。GMA基于 RAFT 加注意力精度更高。GMFlow全局匹配 Transformer精度接近 RAFT速度更快。2. 实时 / 高速光流LiteFlowNet轻量 PWC-Net速度快。FastFlowNet实时高精度适合嵌入式。CSR-Flow上下文空间精炼速度快。ROF实时光流边缘部署友好。3. 2025–2026 最新 SOTAGMFlowMatchFlowUniMatchRAFT-Stereo也能做光流2、传统光流算法不用训练直接跑Lucas–KanadeLK 光流Horn–SchunckFarnebäckSIFT Flow工程上一般只用来做对比 / 初始化精度远不如深度学习。3、适合 OpenExplorer 量化、嵌入式部署最推荐 3 个PWC-Net结构干净、卷积为主、INT8 量化极其友好LiteFlowNet超轻量速度快FastFlowNet实时性强车规可用RAFT/GMA 因为有循环 / 迭代量化难度高不太适合 BPU。4、最简单直接选型要精度最高RAFT / GMFlow要工程落地 量化PWC-Net要实时嵌入式LiteFlowNet / FastFlowNet做自动驾驶 / BEV 时序PWC-Net 或 GMFlowTrack追踪模型分单目标 / 多目标 / 2D / 3D / BEV 跟踪直接给你能选的那种。1、单目标追踪 SOTSingle Object Tracking给初始框一直跟着它SiamFC孪生网络早期经典SiamRPN / SiamRPN精度高、速度快DaSiamRPN防遮挡更强Ocean / OceanTransTTransformer 跟踪StarkTransformer 高精度跟踪2、多目标追踪 MOTMulti-Object Tracking同时跟踪多人 / 多车最常用在自动驾驶、安防1. 传统关联检测 卡尔曼 匈牙利SORTDeepSORT最经典、工业最常用StrongSORT2. 基于外观特征FastReID行人 / 车辆重识别OSNet轻量 ReID3. 端到端 MOTJoint Detect TrackJDEFairMOT工业首选又快又稳CenterTrackTraDeSTransTrackByteTrack精度极高、现在最火BotSort比 ByteTrack 更强3、2D 检测 跟踪一体化工程落地最强YOLOv5 DeepSORTYOLOv8 ByteTrack / BotSort目前最通用YOLOv11 TrackYOLO-Track 系列4、3D 追踪 / 自动驾驶 TrackingAB3DPTTALTRSimpleTrack3D 快速跟踪CenterPoint Track激光雷达 3D 追踪5、BEV 跟踪时序多目标追踪BEV-TrackBEVFormerTrackPETR-TrackStreamPETRMOT-BEVMapTR Track在线建图 跟踪6、适合 OpenExplorer 量化、嵌入式部署这些结构干净、无复杂循环、好转 ONNX、好量化 INT8DeepSORTByteTrackFairMOTYOLOv8/v11 TrackFastReID、OSNet7、 最强选型照抄就行通用 2D 多目标ByteTrack / BotSort工程最快落地YOLOv8 ByteTrack嵌入式 / 量化DeepSORT YOLOv8-n/s自动驾驶 3D/BEVBEVFormerTrack / PETR-Track轻量 ReIDOSNet、FastReIDSLAM/VSLAM定位导航模型1、经典开源 SLAM最常用、资料最多1. 视觉 SLAMVSLAMORB-SLAM2 / ORB-SLAM3最经典、最稳、工程落地最多。支持单目、双目、RGB-DORB-SLAM3 支持视觉 IMU 紧耦合适合扫地机、AGV、无人机、嵌入式开发板SVO / SVO2半直接法速度极快弱纹理也能跑。适合高速无人机、嵌入式实时场景DSO / LDSO直接法精度高、对光照鲁棒。适合科研、高精度场景VINS-Mono / VINS-Fusion视觉 IMU 紧耦合非常稳。自动驾驶、机器人、无人机常用RTAB-Map闭环很强适合大场景、长时间建图。适合服务机器人、室内大场景建图2. 激光 SLAMLiDAR SLAMLOAM / LeGO-LOAM激光经典框架精度高、实时性强。A-LOAMLOAM 的优化开源版易编译、易跑通。LIO-SAM / LIO-SAM-LITE激光 IMU 紧耦合目前落地非常多。自动驾驶、机器人、室外导航首选之一FAST-LIO2超快、超稳、支持大场景。工业机器人、自动驾驶、无人机都爱用3. 多传感器融合 SLAM现在主流LVI-SAM激光 视觉 IMU 融合VINS-Fusion视觉 IMU GPS / 激光ORB-SLAM3 IMU LiDAR多模融合2、深度学习 / 神经网络 SLAMDeepVOVO TransformerNeRF-SLAM语义 重建SLAM这类精度高但算力要求大嵌入式一般不太跑。3、极简选型建议只有摄像头 →ORB-SLAM3 / VINS-Mono摄像头 IMU →ORB-SLAM3 / VINS-Fusion激光雷达 →A-LOAM / FAST-LIO2大场景、要稳、要闭环 →RTAB-Map自动驾驶 / 机器人融合 →LIO-SAM / LVI-SAM