新芽专题介绍(3):面向动态场景理解的视觉智能
选择此专题并在新芽系列课程中获得优秀的同学,可以免去前期筛选考核流程,直接进入南开大学媒体计算团队以及国家人工智能学院等合作院校团队推免生招收面试的最后一轮。
目标检测让机器回答“画面中有什么、在哪里”,目标跟踪让机器进一步回答“它是谁、从哪里来”,轨迹预测则尝试回答“它将去往哪里”。本专题沿着“检测跟踪一体化到轨迹预测”这一主线,引导新芽学子从单帧空间感知走向跨帧时序建模,再进一步理解多主体交互与不确定未来。
一、专题内容梳理
1.1 专题定位
真实世界不是一组彼此独立的静态图像,而是一个持续演化、相互作用的动态系统。自动驾驶汽车需要提前判断行人是否会横穿道路,无人机需要持续锁定快速运动的小目标,智能监控需要在遮挡后重新确认目标身份,机器人则需要根据周围运动主体的可能动作规划安全路径。这些应用都要求视觉系统不仅能够“看见现在”,还能够“理解过去、推测未来”。
本专题不把目标检测、目标跟踪和轨迹预测视为三个孤立任务,而是将它们组织为一条逐层递进的研究链路:
目标检测:建立瞬时空间认知。 从单帧图像中定位目标并判断类别,形成动态场景理解的基本观测。
目标跟踪:建立跨帧身份与历史。 将不同帧中的观测关联为连续轨迹,使系统获得目标身份、运动方向和速度等时序状态。
轨迹预测:建立面向未来的推理。 结合历史轨迹、场景约束和多主体交互,预测一个或多个合理未来,为预警、规划与决策提供提前量。
本专题的重点是检测跟踪一体化及其向轨迹预测的延伸:通过共享特征、联合学习或持续更新的目标查询,将目标定位与跨帧身份关联结合起来,形成连续、稳定的历史轨迹;再以历史轨迹为基础,研究场景约束、多主体交互和未来不确定性。
1.2 专题主线与技术脉络
动态场景理解并不是把检测、跟踪和预测三个任务简单拼接起来,而是让视觉系统对目标的认识随着时间不断深化。目标检测首先从图像中提取目标的类别、位置和置信度,形成对当前场景的瞬时观测;目标跟踪进一步将不同帧中的观测关联起来,为目标赋予稳定身份并积累运动历史;轨迹预测则在此基础上引入场景约束和多主体交互,推演目标未来可能出现的多种运动状态。
这一过程包含两条相互关联的演进主线。一条是研究对象的演进:从当前帧中相互独立的目标,扩展到具有跨帧身份和运动历史的动态目标,再扩展到受环境约束与多主体交互影响的未来状态分布。另一条是研究方法的演进:从检测与跟踪分别处理的模块化方法,发展到共享特征、联合学习以及基于目标查询的检测跟踪一体化方法;在此基础上,进一步学习如何利用历史轨迹进行未来运动建模。
图 1 总体技术脉络
▲ 本专题的核心脉络:研究对象从“当前帧中相互独立的目标”,扩展到“具有跨帧身份和运动历史的动态目标”,再扩展到“受场景约束与多主体交互影响的未来状态分布”;研究方法则从检测与跟踪的模块化处理走向检测跟踪一体化,再以历史轨迹为基础延伸到轨迹预测。
沿着上述主线,三个阶段具有不同的输入输出、核心问题和评价方式:
| 阶段 | 典型输入 | 核心输出 | 关键问题 | 常见评测 |
|---|---|---|---|---|
| 目标检测 | 单帧图像或短视频片段 | 类别、边界框或掩码、置信度 | 找得全、定位准、算得快 | AP、mAP、IoU;红外弱小目标检测还常用 Pd、Fa |
| 目标跟踪 | 视频与逐帧观测;SOT 通常还需初始目标标注 | 目标位置、身份编号、历史轨迹与状态估计 | 持续定位,在遮挡与交互中保持目标身份 | SOT:Success、Precision、AO;MOT:HOTA、MOTA、IDF1、ID Switch |
| 轨迹预测 | 历史轨迹,以及可用的地图、场景与交互信息 | 一条或多条未来轨迹及相应概率(视模型而定) | 预测合理,覆盖多种可能未来,并刻画不确定性 | ADE、FDE、minADE、minFDE、Miss Rate |
这些指标分别从不同侧面刻画系统能力:检测指标关注目标是否被准确发现,跟踪指标关注跨帧身份和轨迹是否保持一致,预测指标则关注未来运动是否合理、准确并具有足够覆盖性。三类指标之间存在明显联系,但不能相互替代。较高的检测 mAP 并不必然带来稳定的目标身份,较高的跟踪 HOTA 也不意味着模型能够可靠覆盖多种未来。
因此,本专题不仅关注各阶段的代表性方法,还强调理解信息如何在任务之间传递:漏检和定位抖动可能造成轨迹中断与速度估计偏差,身份切换会污染目标的历史状态,而历史轨迹中的误差又会在长时预测中进一步累积。其中,检测跟踪一体化利用时序信息帮助补偿短时漏检、维持身份一致性;轨迹预测则需要考虑上游轨迹的噪声与缺失。理解这些联系,有助于把握从稳定轨迹构建到未来运动推演的研究主线。
1.3 学习目标
本专题围绕“检测跟踪一体化到轨迹预测”的主线,将任务理解、文献阅读与实验分析结合起来。完成专题学习后,希望同学能够:
厘清任务关系与一体化机制。 能够说明检测、跟踪和轨迹预测的输入输出与评价方式,解释检测跟踪一体化如何结合目标定位与身份关联,以及历史轨迹如何支持后续预测。
比较代表方法与适用条件。 能够围绕特征共享、数据关联和时序状态更新,比较模块化跟踪与检测跟踪联合建模的差异;理解轨迹预测方法如何利用历史运动、场景约束与多主体交互表示可能的未来。
通过实验分析误差传播。 能够在跑通基线的基础上,设计轨迹观测缺失、位置扰动或身份切换等对照实验,在相同预测模型与评测条件下比较结果,结合指标与可视化分析漏检、身份切换和轨迹缺失对下游预测的影响。
形成有证据的研究表达。 能够从文献与失败案例中提出具体问题,用对比实验或消融分析检验想法,并在汇报中清楚说明方法效果、适用范围与尚未解决的局限。
二、阶段一:目标检测——从图像中发现目标
2.1 专题介绍
2.1.1 研究背景
目标检测是动态视觉系统的感知入口,其任务是在图像中识别感兴趣的目标并给出空间位置。深度学习目标检测经历了从候选区域驱动的两阶段方法,到密集预测的一阶段方法,再到基于集合预测的 Transformer 方法的演进。研究重点也从“能否检测”逐渐拓展到小目标、开放环境、跨模态、视频时序和边缘实时部署。
在本专题中,检测不仅是一个独立任务,还是后续跟踪和预测的观测来源。漏检会造成轨迹中断,框位置抖动会污染速度估计,误检会生成虚假轨迹,而置信度失准则可能让关联算法作出错误选择。因此,理解检测器的输出特性与失败模式,比单纯追求更高的 mAP 更重要。
2.1.2 研究意义
目标检测为智能交通、无人系统、遥感监测、工业质检和公共安全等应用提供基础空间信息。对新芽学子而言,它同时也是进入计算机视觉研究的理想起点:任务定义清晰、数据集和代码生态成熟,可以系统学习特征提取、多尺度表示、类别不平衡、匹配策略、损失函数和模型评测等基础知识。
本专题还特别关注红外弱小目标与序列检测。它们将通用检测中的尺度、信噪比和时序问题推向极端,也自然连接到后续的目标跟踪与运动预测。
2.1.3 当前主要挑战
尺度与分辨率矛盾。 小目标只有少量像素,连续下采样容易抹去其特征;高分辨率输入又会显著增加计算量。
复杂背景与低信噪比。 遮挡、运动模糊、光照变化、红外杂波和与目标相似的背景结构会同时增加漏检与误检。
长尾、域偏移与开放环境。 训练集中的类别和场景分布难以覆盖真实世界,模型在新天气、新传感器或新目标上可能快速失效。
精度与实时性的冲突。 检测器往往是整条系统中计算量最大的模块,延迟会继续传导到跟踪、预测和决策。
单帧决策不稳定。 逐帧独立检测忽略了视频中的运动连续性和跨帧互补信息,容易产生置信度跳变、框抖动和短时漏检。

图 2 目标检测效果示例
图片来源:YOLOX 官方项目,原始图片;对应工作《YOLOX: Exceeding YOLO Series in 2021》(2021)。项目采用 Apache License 2.0。
2.2 推荐阅读
本阶段的推荐阅读按照“通用基础—特殊场景—时序拓展”的关系组织。经典目标检测研究如何在单帧图像中准确定位和识别一般目标,形成了两阶段检测、一阶段检测、多尺度特征和集合预测等基础范式;红外弱小目标检测是在极小尺度、低信噪比和复杂背景条件下对这些基础思想的专门化发展,更强调细节保持、背景抑制、上下文建模以及适配弱小目标的损失与评价方式;视频与多帧序列检测则进一步引入时间维度,通过跨帧对齐、特征聚合和长时记忆弥补单帧信息不足。
三类方向并非彼此割裂。经典检测提供空间表征和模型设计基础,红外弱小目标检测将尺度与信噪比问题推向极端,而多帧检测利用运动连续性增强弱观测,既可以服务于通用视频目标检测,也可以服务于红外序列中的弱小目标发现。需要注意的是,序列检测虽然使用了跨帧信息,但其核心输出仍是各时刻的目标位置与置信度,通常不要求长期维持目标身份;当研究重点转向跨帧身份关联和完整轨迹构建时,任务便自然过渡到下一阶段的目标跟踪。
因此,阅读时可先通过经典目标检测建立基础,再学习红外弱小目标检测与视频及多帧序列检测两个方向。这里的分类并不表示先后递进:红外对应场景或成像条件,视频对应时间维度,两者可以交叉结合,形成红外序列目标检测的研究方向。
2.2.1 经典目标检测
阅读这一小节时,可以围绕“检测器如何生成并筛选目标”建立方法脉络:Faster R-CNN 代表两阶段检测,YOLO 代表单阶段密集预测,FPN 与 Focal Loss 分别处理多尺度表示和类别不平衡,DETR 则将检测改写为集合预测问题。进阶文献进一步展示 DETR 系列如何改善收敛速度、小目标性能与实时性,适合比较不同范式在精度、速度和训练成本上的取舍。
入门文献
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks(NeurIPS 2015)
You Only Look Once: Unified, Real-Time Object Detection(CVPR 2016)
Focal Loss for Dense Object Detection(ICCV 2017)
进阶文献
Deformable DETR: Deformable Transformers for End-to-End Object Detection(ICLR 2021)
DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection(ICLR 2023)
2.2.2 进阶方向——红外弱小目标检测
这一小节关注弱小目标如何在低信噪比和复杂背景中被保留下来。阅读时可比较上下文建模、多尺度特征融合、空间与通道注意力、噪声抑制及重建约束等思路,并特别留意不同工作采用的是点目标、掩码还是边界框标注,以及相应评价指标是否可以直接比较。
Asymmetric Contextual Modulation for Infrared Small Target Detection(WACV 2021)
Dense Nested Attention Network for Infrared Small Target Detection(IEEE TIP 2022)
UIU-Net: U-Net in U-Net for Infrared Small Object Detection(IEEE TIP 2023)
SCTransNet: Spatial-channel Cross Transformer Network for Infrared Small Target Detection(IEEE TGRS 2024)
Infrared Small Target Detection with Scale and Location Sensitivity(CVPR 2024)
Target-Aware Invertible Encoder with Reconstruction Guidance for Infrared Small Target Detection(CVPR 2026)
2.2.3 进阶方向——视频与多帧序列检测
这一小节沿着“跨帧对齐—特征聚合—长时记忆”的思路展开。阅读时应关注模型如何选择和利用邻近帧或历史帧、如何处理运动造成的空间错位,以及时序信息是在特征层还是结果层参与检测;同时注意这些方法仍以逐帧目标检测为核心输出,并不要求长期维持目标身份。
Flow-Guided Feature Aggregation for Video Object Detection(ICCV 2017)
Sequence Level Semantics Aggregation for Video Object Detection(ICCV 2019)
Memory Enhanced Global-Local Aggregation for Video Object Detection(CVPR 2020)
Infrared Small Target Detection in Satellite Videos: A New Dataset and a Novel Recurrent Feature Refinement Framework(IEEE TGRS 2025)
D2FANet: Enhancing Video Object Detection with Dual-Domain Feature Aggregation Network(CVPR 2026)
When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection(CVPR 2026)
三、阶段二:目标跟踪与检测跟踪一体化——构建连续目标轨迹
3.1 专题介绍
3.1.1 研究背景
目标跟踪旨在利用视频中的空间、外观与运动信息,持续估计目标状态并形成跨帧连续表征。按照任务初始化方式和目标数量,视觉跟踪通常包括单目标跟踪(Single-Object Tracking, SOT)与多目标跟踪(Multi-Object Tracking, MOT)等典型设定:SOT 通常在初始帧给定一个目标,重点解决后续帧中的持续定位;MOT 则需要同时处理多个目标的发现、关联和身份管理。
二者的任务边界不同,但共享目标表征、相似度度量、运动估计、遮挡处理、时序记忆和模型更新等基础问题。SOT 对目标匹配与精细定位的研究,为理解视觉跟踪的基本机制提供了清晰入口;MOT 则进一步引入开放目标集合、数据关联和轨迹管理,更直接地连接上游检测与下游多主体轨迹预测。因此,本专题以 MOT 及检测跟踪一体化为主要研究方向,将 SOT 作为理解目标表征与持续定位的基础和补充。
3.1.2 研究意义
目标跟踪把彼此独立的帧级观测转化为连续目标状态,是行为分析、异常检测、速度估计、意图识别和未来预测的基础。对于指定目标,稳定跟踪能够支持无人机伴随、视觉伺服、目标搜索和主动感知;对于复杂场景,多目标轨迹则为交通分析、人群理解和交互预测提供基本数据结构。
从本专题主线看,跟踪完成了一次关键的表征升级:系统不再只知道目标在当前帧的位置,而是开始维护其外观记忆、可见状态、运动趋势和历史轨迹。传统 Tracking-by-Detection 方法先逐帧检测,再独立完成数据关联,结构清晰,但检测误差容易传递到身份关联和轨迹管理。检测跟踪一体化则尝试在特征、训练目标或跨帧状态表示上加强两个任务的联系,使目标定位与身份保持能够相互利用信息。
这里的“一体化”包含不同程度的结合,并不只对应一种模型结构:
| 建模层次 | 主要特点 |
|---|---|
| 模块化跟踪 | 检测器先输出逐帧目标框,跟踪器再利用运动或外观信息完成关联 |
| 共享表征 | 检测与身份表征共用骨干网络或部分特征,减少重复计算并加强信息共享 |
| 联合学习 | 在同一模型中联合优化检测、身份表征、关联或运动估计等目标 |
| 持续目标表示 | 使用目标查询或轨迹查询跨帧维护状态,同时处理已有目标更新与新目标发现 |
理解这些层次,有助于比较不同方法的结合方式、端到端程度和适用条件,也能避免把简单的模块串联等同于检测跟踪一体化。
3.1.3 当前主要挑战
外观变化与相似干扰。 尺度变化、姿态形变、光照改变和低分辨率会削弱目标表征,而相似目标或背景干扰又容易造成错误匹配。
遮挡、出视野与重新出现。 跟踪器需要判断目标是短时不可见、已经离开,还是在其他位置重新出现,并避免错误更新目标模板或身份。
定位、检测与关联相互依赖。 SOT 中的定位漂移会逐帧累积;MOT 中的漏检会造成轨迹断裂,误检会产生虚假轨迹,关联错误则可能引发身份切换。
复杂运动与相机运动。 急转、加减速和镜头运动会破坏简单运动假设,需要结合视觉线索、状态估计与更长时间上下文。
长期记忆与在线效率的平衡。 更长历史有利于目标恢复和身份保持,却会增加存储、计算以及错误记忆持续传播的风险。
任务设定与评价指标差异。 SOT 更关注定位成功率与精度,MOT 还需综合评估检测、身份和关联质量,阅读论文时不能直接比较不同设定下的分数。
![]() | ![]() |
| 图 3-a SOT效果示例 | 图 3-b MOT效果示例 |
SOT Demo 来源: DaSiamRPN 官方项目主页及官方代码仓库,对应论文《Distractor-aware Siamese Networks for Visual Object Tracking》(ECCV 2018)。项目代码采用 MIT License。
MOT Demo 来源: OC-SORT 官方项目,对应论文《Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking》(CVPR 2023);查看原始 Demo。演示数据来自 DanceTrack,项目代码采用 MIT License。
3.2 推荐阅读
本阶段的推荐阅读以“模块化多目标跟踪—检测跟踪联合学习—基于 Transformer 的联合建模”为主线。SOT 文献用于补充目标表征、匹配、定位和模型更新等基础知识;MOT 文献则围绕多个目标的发现、关联、身份管理与轨迹构建逐步展开。
阅读时可以先从 SOT 中选取代表工作,理解目标表征与持续定位;随后通过 Tracking-by-Detection 方法掌握检测、运动估计、外观匹配和数据关联之间的关系;再重点阅读共享表征、联合优化和持续目标查询等检测跟踪一体化方法。通用目标跟踪作为前沿拓展,用于了解模型如何统一不同跟踪设定、支持多类型提示并走向开放世界中的任意目标。
3.2.1 基础与补充——单目标跟踪(SOT):目标表征与持续定位
这一小节展示 SOT 从模板匹配到动态目标建模的演进。SiamFC 与 SiamRPN 适合理解离线学习的孪生匹配,ATOM 与 DiMP 分别强化目标状态估计和在线判别,TransT 与 OSTrack 展示注意力融合及单流建模,DTPTrack 则进一步讨论如何利用历史信息而不让错误预测持续引发漂移。
入门文献
Fully-Convolutional Siamese Networks for Object Tracking(ECCV Workshops 2016)
High Performance Visual Tracking with Siamese Region Proposal Network(CVPR 2018)
Learning Discriminative Model Prediction for Tracking(ICCV 2019)
进阶文献
Transformer Tracking(CVPR 2021)
Joint Feature Learning and Relation Modeling for Tracking: A One-Stream Framework(ECCV 2022)
Drift-Resilient Temporal Priors for Visual Tracking(CVPR 2026)
3.2.2 模块化多目标跟踪:Tracking-by-Detection与数据关联
这一小节用于建立多目标跟踪的基本流程与评价观念。SORT 和 DeepSORT 分别展示运动关联以及外观信息的引入,ByteTrack、OC-SORT 和 ProgTrack 从检测置信度、观测更新与渐进匹配等角度改进关联过程;HOTA 则用于理解为什么跟踪评测需要同时考察检测、关联和定位。阅读时应重点分析不同错误如何转化为轨迹中断、虚假轨迹和身份切换。
入门文献
Simple Online and Realtime Tracking(ICIP 2016)
Simple Online and Realtime Tracking with a Deep Association Metric(ICIP 2017)
HOTA: A Higher Order Metric for Evaluating Multi-Object Tracking(IJCV 2021)
ByteTrack: Multi-Object Tracking by Associating Every Detection Box(ECCV 2022)
进阶文献
Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking(CVPR 2023)
ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategy(CVPR 2026)
3.2.3 核心方向——检测与跟踪联合学习
这一小节聚焦检测与关联如何在同一模型中交换信息。JDE 与 FairMOT 将检测和 ReID 表征放入共享网络,CenterTrack 同时预测当前目标及其跨帧位移,QDTrack 通过准稠密采样学习实例相似度,FDTA 则针对端到端跟踪中实例表征区分度不足的问题强化空间、时间与身份信息。阅读时应关注各方法联合了哪些环节,以及检测精度、关联能力和效率之间如何权衡。
Towards Real-Time Multi-Object Tracking(ECCV 2020)
Tracking Objects as Points(ECCV 2020)
FairMOT: On the Fairness of Detection and Re-Identification in Multiple Object Tracking(IJCV 2021)
Quasi-Dense Similarity Learning for Multiple Object Tracking(CVPR 2021)
From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking(CVPR 2026)
3.2.4 核心方向——基于Transformer的检测跟踪联合建模
这一小节包含两种相关但不同的思路:TransTrack、TrackFormer、MOTR 与 MOTRv2 主要通过目标查询或轨迹查询逐帧更新已有目标并发现新目标,GTR 则在短视频片段内利用轨迹查询对多帧目标进行全局分组。阅读时应比较查询如何初始化、传播和终止,以及方法是否依赖预训练检测器、显式匹配或额外轨迹管理,不能仅凭使用 Transformer 就将其视为同一种端到端方案。
TransTrack: Multiple Object Tracking with Transformer(CVPR 2021)
TrackFormer: Multi-Object Tracking with Transformers(CVPR 2022)
Global Tracking Transformers(CVPR 2022)
MOTR: End-to-End Multiple-Object Tracking with Transformer(ECCV 2022)
MOTRv2: Bootstrapping End-to-End Multi-Object Tracking by Pretrained Object Detectors(CVPR 2023)
3.2.5 前沿拓展——通用目标跟踪:从任务统一到开放世界
这一小节沿着“统一跟踪任务—统一实例感知—开放世界关联”的脉络展开。UTT 尝试在同一框架中处理 SOT 与 MOT,Unicorn 进一步统一 SOT、MOT、VOS 和 MOTS,UNINEXT 将多类图像与视频实例感知任务改写为目标发现与检索,MASA 则学习可迁移到不同检测或分割模型的通用关联能力。阅读时可比较这些方法统一的是任务定义、模型结构、训练数据还是目标表征,并关注它们如何从固定任务走向对任意实例的持续关联。
Towards Grand Unification of Object Tracking(ECCV 2022)
Universal Instance Perception as Object Discovery and Retrieval(CVPR 2023)
Matching Anything by Segmenting Anything(CVPR 2024)
四、阶段三:轨迹预测——从历史观测推演可能未来
本阶段以目标的历史位置序列为主要输入。与前面的视觉跟踪衔接时,需要按目标身份与时间戳组织观测,并根据任务约定,从边界框中选取中心点或底边中点等位置表示。图像坐标与地面或世界坐标应明确区分;若预测任务使用后者,则需具备相应的相机标定、几何映射或三维定位信息。输入序列还应与预测模型要求的采样间隔、历史时长及坐标定义保持一致,并明确缺失观测采用掩码、插值还是轨迹片段筛选等处理方式。
学习时可先使用标注历史轨迹理解预测任务,再在相同的坐标表示与评测条件下引入实际跟踪结果,分析位置误差、身份切换和轨迹缺失对预测的影响。实验中应明确区分“基于标注轨迹的预测”与“基于跟踪结果的预测”,以说明误差来源。
4.1 专题介绍
4.1.1 研究背景
轨迹预测根据目标的历史位置、速度、朝向以及场景环境,推断其未来一段时间的运动状态。早期方法主要依赖线性运动模型或循环神经网络;随后,社会交互、地图约束、目标意图和多模态生成成为研究重点;近年来,Transformer、扩散模型和轨迹 token 化进一步提升了多主体联合建模能力。
与检测和跟踪不同,预测不存在唯一确定答案。同一辆车到达路口后可能直行、转弯或停车,同一名行人也可能横穿或等待。因此,预测模型的目标不是武断地给出“一条最像的线”,而是对多个合理未来及其不确定性进行建模。
4.1.2 研究意义
预测为决策系统提供时间提前量,是从“被动感知”迈向“主动智能”的关键一步。在自动驾驶、机器人避障、空海交通管控、人群疏导和体育分析中,系统只有预判其他运动主体的行为,才能规划安全、有效的自身动作。
轨迹预测还会反向检验感知质量:位置噪声、ID 切换和轨迹缺口都可能显著放大未来误差。因此,本阶段不仅研究预测模型本身,也研究带噪轨迹、缺失观测和感知不确定性如何进入预测过程。
4.1.3 当前主要挑战
未来具有多模态。 多个未来可能同时合理,模型既要保持多样性,也要避免生成违反场景约束的轨迹。
多主体相互作用。 礼让、跟随、竞争和博弈会改变个体行为,独立预测每个目标容易产生相互碰撞的未来。
环境和地图约束。 道路拓扑、障碍物和可行驶区域提供强先验,但过度依赖高清地图也会降低跨城市、跨场景泛化能力。
误差随预测时域累积。 越远期的未来越不确定,长时预测还会面临稀有行为和分布外事件。
概率校准与安全评测。 “命中一条真实轨迹”并不足以证明模型可靠,还需评估模式概率、场景一致性、碰撞风险和置信度校准。
![]() | ![]() |
| 图 4-a 真实未来轨迹 | 图 4-b 预测未来轨迹 |
圆点表示历史轨迹,星号表示预测或真实的未来轨迹,不同颜色代表不同行人。
Demo 来源: PECNet 项目,对应论文《It Is Not the Journey but the Destination: Endpoint Conditioned Trajectory Prediction》(ECCV 2020)。预测结果 GIF;真实轨迹 GIF。
4.2 推荐阅读
本专题以“模型如何逐步表示未来”为主线:先从历史运动和社会交互出发,引入随机变量表示多种可能;再利用终点、道路和场景语义约束预测;随后通过 Transformer 统一建模多主体的时空关系;最后发展为扩散模型和轨迹序列生成。
4.2.1 综述与任务全景
建议先用前两篇综述建立轨迹预测的任务定义、输入输出、数据集和评测框架,并重点理解鲁棒性研究如何处理观测噪声、分布变化与安全可靠性;大模型相关综述可作为前沿拓展,用于了解语言知识和视觉语言模型可能在哪些环节参与轨迹表示、交互推理与生成。
入门文献
Trajectory Prediction for Autonomous Driving: Progress, Limitations, and Future Directions(Information Fusion 2025)
A Survey on Robustness in Trajectory Prediction for Autonomous Vehicles(arXiv 2024)
前沿拓展:大模型与轨迹生成
4.2.2 时序建模、社会交互与随机未来
这一阶段奠定了现代轨迹预测的基本问题设定:未来不仅由单个目标的运动惯性决定,还受到周围目标影响,并且通常存在多个合理结果。阅读时可以沿 Social LSTM 的社会池化、DESIRE 的候选生成与排序、Social GAN 的对抗式多样性以及 Trajectron++ 的异构交互与动力学约束,比较不同方法如何表示交互和不确定未来。
入门文献
Social LSTM: Human Trajectory Prediction in Crowded Spaces(CVPR 2016)
DESIRE: Distant Future Prediction in Dynamic Scenes with Interacting Agents(CVPR 2017)
Social GAN: Socially Acceptable Trajectories with Generative Adversarial Networks(CVPR 2018)
Trajectron++: Dynamically-Feasible Trajectory Forecasting With Heterogeneous Data(ECCV 2020)
4.2.3 目标条件与场景约束
研究重点由“根据历史坐标外推”转向“预测目标可能去往何处,并确保轨迹符合场景结构”。VectorNet 适合理解矢量化地图和主体间关系表示,PECNet 展示如何先建模终点再生成完整轨迹,Y-Net 则把目标、路径点和路径组织为分层预测过程。阅读时可比较地图、终点和中间路径点分别提供了什么约束。
入门文献
VectorNet: Encoding HD Maps and Agent Dynamics from Vectorized Representation(CVPR 2020)
It Is Not the Journey but the Destination: Endpoint Conditioned Trajectory Prediction(ECCV 2020)
进阶文献
4.2.4 进阶方向——Transformer 与多主体联合预测
Transformer 使模型能够在更长时间范围和更多目标之间建立关系,并以候选意图或查询为中心生成、筛选和细化多种可能轨迹。AgentFormer 适合理解主体维度与时间维度如何共同进入注意力建模,MTR 则展示如何围绕运动意图查询生成并细化候选轨迹。阅读时应关注交互建模的范围以及多种未来模式的产生方式。
AgentFormer: Agent-Aware Transformers for Socio-Temporal Multi-Agent Forecasting(ICCV 2021)
Motion Transformer with Global Intention Localization and Local Movement Refinement(NeurIPS 2022)
4.2.5 进阶方向——扩散模型与多未来轨迹生成
这一小节聚焦扩散模型如何通过逐步去噪生成多种可能未来。MID 主要展示运动不确定性如何进入随机轨迹生成,MotionDiffuser 进一步引入可微代价函数,对多主体联合轨迹施加可控约束。阅读时可比较扩散过程带来的多样性、采样成本,以及生成轨迹是否满足场景和交互约束。
Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion(CVPR 2022)
MotionDiffuser: Controllable Multi-Agent Motion Prediction Using Diffusion(CVPR 2023)
五、结语与期望
从检测跟踪一体化到轨迹预测,是计算机视觉从“看见”走向“理解”,再走向“预见”的过程。检测与跟踪的联合建模关注如何发现目标、维持身份并构建稳定轨迹,轨迹预测则进一步研究如何依据历史运动、场景约束和多主体交互推演可能的未来。
希望通过本专题,新芽学子不只是掌握三个任务的代表模型,更能建立一种面向动态世界的系统观:当前观测从何而来,历史状态如何形成,未来为何具有不确定性,不同模块如何彼此影响,以及一个更高的局部指标是否真的让整个系统变得更可靠。
期待大家从一条轨迹出发,看到其背后完整的视觉智能链路,并在复现、比较和质疑中提出自己的研究问题。
附:基础学习资料
《Deep Learning》(Ian Goodfellow 等)——深度学习入门经典教材
PyTorch 官方教程,也可以使用 PyTorch 中文文档
《Pattern Recognition and Machine Learning》(Christopher M. Bishop)——机器学习原理入门(难度不小)
此外,你也可以使用一些入门工具:
Google Colab:免费云平台,不用安装软件,就能运行 PyTorch 代码。
Kaggle 平台:免费数据集和竞赛平台。
💡Tips:不必等到“所有基础都学完”再开始复现。更有效的方式是先跑通最小基线,在读代码、研究失败原因和解释指标的过程中回溯所需知识。



