新芽专题介绍(4):主动视觉感知智能体
选择此专题并在新芽系列课程中获得优秀的同学,可以免去前期筛选考核流程,直接进入南开大学媒体计算团队以及国家人工智能学院等合作院校团队推免生招收面试的最后一轮。
一、专题介绍
1.1 研究背景
过去十余年,YOLO、DETR、DINO 等目标检测模型不断提升精度与速度;Grounding DINO、YOLO-World 等开放词汇检测器则进一步把固定类别检测扩展到由自然语言描述目标。但现实感知系统面对的并不是一张已经完美拍摄和处理好的标准图片。无人机、机器人、自动驾驶车辆和边缘摄像头常常工作在低光、过曝、失焦、运动模糊、远距离弱小目标、遮挡、复杂背景及算力受限等条件下。
此时,检测失败未必意味着检测器不够强:目标信息可能在采集阶段已因曝光不当而丢失;小目标在高分辨率全图缩放后可能完全不可辨;当前图像存在雾、噪声或模糊,却仍在沿用固定处理流程;当检测置信度很低时,系统也往往不会继续寻找新的视觉证据。
本专题关注一个更上层的问题:
当目前观测不足时,视觉系统能否主动决定下一步应该如何看、看哪里,以及获取什么新的视觉证据?
专题围绕主动视觉感知智能体展开,重点关注两类实现路径:
- 主动成像与可控感知(Active Imaging / Task-Aware Camera):研究下一张图应如何拍摄、RAW/ISP 应如何处理,以及如何控制曝光、增益、焦点、变焦、云台方向或视角,使观测更适合机器任务。
- 检测侧的主动决策(Detection Agent / Agentic Detection):研究当前图像应如何继续看。智能体在检测器之上组织检测流程,决定是否裁剪、放大、恢复图像、调用何种检测器或专家模型、是否复核,以及何时停止。
1.2 研究内容与总体引导
从最广义上说,主动视觉感知智能体研究的是“面向任务的信息获取”:系统不再把输入图像当作固定不变的前提,而是根据当前任务、已有观测和资源限制,主动选择下一步的观察方式,并利用新证据修正判断。这里的“主动”既可以发生在真实世界中,也可以发生在图像和计算工具内部。
本专题的核心研究问题
正式定义: 在当前观测不完整、任务目标明确且时间、算力或能量有限的条件下,如何让视觉系统根据当前状态选择下一步的成像、相机控制、图像处理或检测工具动作,获得新的视觉证据,并通过反馈持续更新决策,从而以尽可能低的代价完成可靠的感知任务?
用更通俗的话说,本专题不只是问“这张图里有什么”,也不只是问“哪个检测器精度最高”,而是问:当第一次看到的东西不够清楚、检测结果不够可信时,机器下一步应该做什么?应该重新拍一张、调整曝光或焦点、换一种 ISP 处理、裁剪放大某个区域、调用另一个检测器,还是已经有足够证据可以停止?
这个问题可以形式化为一个带成本约束的序列决策问题。时刻 $t$ 的状态 $s_t$ 包含当前图像、任务目标、历史观测和剩余预算;系统选择动作 $a_t$,动作可以作用于相机、ISP 或视觉工具;环境随后返回新观测 $o_{t+1}$ 和反馈 $r_t$。系统希望学习一个策略 $\pi$,在满足预算约束的同时最大化最终任务效果:
$$ π^{*} = arg max_{π} E[TaskScore − λ ∑_{t=1}^{T} Cost(a_t)]
$$
因此,研究重点不是让系统无休止地执行更多动作,而是学习何时采取动作、采取什么动作、动作是否带来有效信息,以及何时停止。
可以将本专题的研究内容理解为三个相互衔接的层次:
- 主动视觉感知(Active Visual Perception):决定“从哪里看、何时看、看几次”,涉及相机位姿、视角、焦点、变焦、曝光等会改变后续观测的动作。
- 主动成像与任务驱动 ISP(Active Imaging / Task-Aware ISP):决定“如何把传感器信号变成适合当前任务的图像”,包括 RAW 处理、增强、降噪、色调映射、模块顺序和参数配置。
- 检测智能体(Detection Agent):作为主动视觉感知在检测任务中的具体实现,决定“拿到当前图像后还要做什么”,包括裁剪、放大、重建、切换检测器、调用外部工具、复核候选结果,以及判断何时停止。
三者可以用同一条闭环主线串起来:状态(当前观测与任务)→ 动作(拍摄、处理或调用工具)→ 新观测 → 反馈(精度、置信度与成本)→ 下一步动作或停止。因此,本方向并不等同于单纯的图像增强、目标检测或大模型工具调用;只有当动作是为了获得更有价值的任务信息,并且结果会反过来影响后续决策时,才构成完整的主动视觉感知智能体问题。
学习时可以沿着“先理解观测,再学习动作,最后建立闭环”的顺序推进:先掌握检测器、相机和 ISP 的基本输入输出;再阅读曝光、焦点、管线配置和视觉搜索等动作决策方法;最后关注强化学习、规划、多模态模型和成本约束下的停止策略。这样能够把看似分散的论文统一到“如何用有限代价获取足够证据”这一核心问题上。
1.3 研究意义
主动视觉感知智能体的意义,不只是把更多模型串联起来,而是改变视觉系统处理问题的基本方式。
- 观测本身可以优化:曝光、增益、焦距、视角与 RAW-to-RGB 过程都会改变机器最终获得的信息;“怎样拍”与“怎样识别”并非彼此独立。
- 机器所需图像不一定等于人眼喜欢的图像:传统 ISP 主要追求自然、舒适的照片,而检测器更关心边缘、纹理、目标结构与有效动态范围。
- 复杂场景需要动态流程:正常场景可能直接检测即可;低光场景可能先增强;超大图像可能先局部搜索;开放世界场景可能先推断应检测的类别。
- 动作会产生新观察:局部裁剪、数字放大、重新曝光、调整焦点、光学变焦和改变视角都会带来新的视觉证据,并据此改变下一步决策。
- 每一次“看”都有成本:高分辨率推理、多模型调用、机械转动、曝光等待和无人机移动都会消耗时间、算力与能量。系统的目标不是做更多动作,而是只做当前最有价值的动作。
因此,本方向处于计算机视觉、计算成像、强化学习、多模态大模型和具身智能的交叉位置,适合作为本科生进入前沿视觉研究的切入点。
1.4 当前主要挑战
当前输入往往只是部分观察
- 低光、过曝、模糊和遮挡会使第一次观察不足以支持可靠判断。
- 高分辨率全图缩放后,小目标信息可能完全消失。
动作空间复杂且异构
- Exposure、Gain、Focus 等通常是连续动作。
- Crop、Detector Selection、Tool Calling 等通常是离散动作。
- Camera、ISP 与计算工具的动作还可能相互耦合。
反馈不总是可靠
- Detector confidence 并不必然等于真实正确率。
- 多模态大模型可能产生错误的场景判断。
- 系统需要具备复核、纠错与重新搜索能力。
需要决定何时停止
- 不断放大、换模型或继续搜索可能带来更多证据,也会不断增加成本。
- 系统必须在 Accuracy、Latency、Energy 与 Action Cost 之间权衡。
从离线数据走向真实闭环并不容易
- 在固定数据集上学习图像处理相对容易。
- 控制真实曝光、焦点、镜头和机器人视角时,动作会改变后续数据分布,训练与评测难度显著提高。
二、学习资料与参考文献
建议按照以下路径逐步学习:先理解目标检测的输入、输出与评测;再认识 RAW、ISP 与相机参数;随后学习任务驱动成像与视觉搜索;最后进入状态、动作、反馈构成的主动视觉感知闭环。
2.1 基础教材与学习材料
在开始阅读论文前,建议掌握必要基础,但不要陷入“所有基础都学完才开始科研”的误区。更推荐带着论文中的具体问题补知识。
- 李沐《动手学深度学习》——适合快速补齐深度学习、CNN、Transformer 等基础。
- PyTorch 官方教程——用于模型复现与实验。
- MMDetection——理解现代检测框架的训练、配置与评测方式。
- Spinning Up in Deep RL——建立 State、Action、Reward、Policy、MDP 等强化学习基本概念。
- Sutton & Barto, Reinforcement Learning: An Introduction——可重点阅读 MDP、Value、Policy Gradient 与 Actor-Critic。
- Camera / RAW / ISP 基础——建议了解 Sensor 与 RAW、Bayer CFA、Demosaicing、Exposure Time、Gain/ISO、White Balance、Color Correction、Tone Mapping、Gamma 与 Denoising;重点是理解它们改变了何种传感器信息,以及哪些改变在拍摄后不可逆。
Tips:不必等到所有基础都完备再开始实践。先选一篇论文或一个可验证的小任务,在复现和阅读中回溯补齐知识,往往更有效。
2.2 入门文献(主动视觉感知与检测基础)
入门部分只保留能够回答“相机如何影响检测”和“智能体如何通过动作获得新证据”的代表性工作;动态结构搜索、强化学习调参和复杂场景适配放到 2.3 进阶部分。
(一)任务驱动 ISP 与相机管线基础
- Reconfiguring the Imaging Pipeline for Computer Vision(ICCV 2017)【链接】 【代码】 —— 论文提出面向机器视觉的可配置成像管线,说明相机不必完全按照人眼摄影需求处理图像。
- Hardware-in-the-Loop End-to-End Optimization of Camera Image Processing Pipelines(CVPR 2020)【链接】 —— 论文直接在硬件 ISP 上针对检测、分割等下游任务优化参数,建立“成像—任务指标”之间的端到端联系。
- End-to-End High Dynamic Range Camera Pipeline Optimization(CVPR 2021)【链接】 —— 论文联合优化传感器、HDR ISP 和检测器,展示如何用最终视觉任务反向指导成像参数。
(二)主动相机控制基础
- Neural Auto-Exposure for High-Dynamic Range Object Detection(CVPR 2021)【链接】 —— 论文联合学习曝光选择、ISP 和目标检测,使相机能够为检测任务主动选择更合适的曝光。
(三)检测智能体基础(主动视觉感知的检测分支)
- Active Object Localization With Deep Reinforcement Learning(ICCV 2015)【链接】 —— 论文把目标定位建模为智能体连续调整候选框的动作过程,是理解“观察—动作—奖励—停止”检测闭环的经典起点。
- Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection(ECCV 2024)【链接】 【代码】 —— 论文将自然语言短语与图像区域对齐,提供后续视觉搜索、候选框生成和 Agent 工具调用所需的开放词汇检测器。
- YOLO-World: Real-Time Open-Vocabulary Object Detection(CVPR 2024)【链接】 【代码】 —— 论文把开放词汇检测做成实时检测工具,使 Agent 能够根据动态生成的文本类别快速定位目标。
- V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs(CVPR 2024)【链接】 【代码】 —— 论文让多模态大模型先定位高价值区域,再通过裁剪和放大获取细节,建立“搜索—新观察—再推理”的数字视觉闭环。
- DetToolChain: A New Prompting Paradigm to Unleash Detection Ability of MLLM(ECCV 2024)【链接】 【代码】 —— 论文为 MLLM 配置放大、测量和区域提示等工具,使检测从一次性猜框变成诊断、取证和修正的迭代流程。
2.3 进阶文献
进阶部分从“理解任务驱动成像”进入“学习如何动态配置成像与决策”:重点关注 ISP 结构搜索、顺序调参、场景自适应,以及曝光和焦点等物理动作控制。
(一)ISP 结构与任务适配进阶
- ReconfigISP: Reconfigurable Camera Image Processing Pipeline(ICCV 2021)【链接】 【代码】 —— 论文利用可微代理和神经架构搜索自动重连 ISP 模块,使处理管线能够适应不同任务、场景和效率约束。
- Learning To Exploit the Sequence-Specific Prior Knowledge for Image Processing Pipelines Optimization(CVPR 2023)【链接】 —— 论文利用 ISP 模块顺序和参数之间的结构先验,改进高维 ISP 超参数的自动优化。
- RL-SeqISP: Reinforcement Learning-Based Sequential Optimization for Image Signal Processing(AAAI 2024)【链接】 —— 论文以强化学习模拟专家逐步调参过程,联合优化 ISP 参数,并在目标检测、实例分割和图像质量任务上验证序贯策略。
- AdaptiveISP: Learning an Adaptive Image Signal Processor for Object Detection(NeurIPS 2024)【链接】 【代码】 —— 论文用强化学习为不同输入动态选择 ISP 模块和参数,并在检测精度与计算成本之间进行权衡。
- Multimodal Large Language Model-Guided ISP Hyperparameter Optimization with Dynamic Preference Learning(ICCV 2025)【链接】 —— 论文将 MLLM 提供的语义信息和图像质量描述引入 ISP 超参数优化,并用动态偏好学习减少人工标注需求。
- Dark-ISP: Enhancing RAW Image Processing for Low-Light Object Detection(ICCV 2025)【链接】 —— 论文直接处理 Bayer RAW,在低光场景中用轻量、自适应的任务驱动 ISP 提升目标检测性能。
- Task-Aware Image Signal Processor for Advanced Visual Perception(CVPR 2026)【链接】 【代码】 —— 论文用 Global、Regional 和 Pixel 三个尺度的轻量调制算子构建面向检测与分割的可控 ISP。
(二)主动相机控制进阶
- Learning to Control Camera Exposure via Reinforcement Learning(CVPR 2024)【链接】 —— 论文把曝光时间和增益控制建模为序列决策,使相机能够根据光照反馈快速获得更适合视觉任务的下一帧。
- TaCOS: Task-Specific Camera Optimization with Simulation(WACV 2025)【链接】 【代码】 —— 论文在仿真环境中联合优化相机硬件参数与视觉任务,以较低成本搜索适合检测和机器人感知的相机设计。
- Stabilizing and Accelerating Autofocus with Expert Trajectory Regularized Deep Reinforcement Learning(CVPR 2025)【链接】 —— 论文利用专家轨迹正则化强化学习控制镜头焦点,降低多步对焦中的来回搜索和等待成本。
- JOCA: Task-Driven Joint Optimisation of Camera Hardware and Adaptive Camera Control Algorithms(WACV 2026)【链接】 【代码】 —— 论文联合优化固定相机硬件、运行时自适应控制算法和下游视觉任务,进一步把相机设计与主动控制统一起来。
(三)Detection Agent / Agentic Detection
- LLM-Guided Agentic Object Detection for Open-World Understanding(arXiv 2025)【链接】 【代码】 —— 论文让 LLM 根据场景自动生成待检测的物体名称,再交给开放词汇检测器完成定位。
- Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning(arXiv 2026)【链接】 —— 论文用 MLLM 动态组合图像恢复与领域专家检测器,并利用历史决策经验改进后续流程。
- OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection(CVPR 2026)【链接】 —— 论文把开放词汇检测中的提示、区域和视觉推理组织为带探索、记忆与奖励的主动决策过程。
- AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/Few-Shot Object Detection(CVPR 2026)【链接】 —— 论文将检测拆成 Scout、Pinner、Curator 和 Judge 等协作角色,通过共享黑板与知识库完成零样本和少样本检测。
2.4 拓展文献
(一)RAW/ISP 与任务感知成像拓展
- Toward RAW Object Detection: A New Benchmark and a New Model(CVPR 2023)【链接】 【代码】 —— 论文建立真实 RAW 目标检测基准,并说明原始传感器信息需要任务导向的动态范围调整才能被检测器有效利用。
- RAW-Adapter: Adapting Pretrained Visual Model to Camera RAW Images(ECCV 2024)【链接】 【代码】 —— 论文在输入和特征层增加 RAW 适配模块,把 sRGB 预训练视觉模型迁移到传感器 RAW 图像。
- Towards RAW Object Detection in Diverse Conditions(CVPR 2025)【链接】 【代码】 —— 论文构建覆盖多种光照和天气的 RAW 检测数据,并通过 RAW 域预训练提升恶劣条件下的检测泛化。
- Beyond RGB: Adaptive Parallel Processing for RAW Object Detection(ICCV 2025)【链接】 【代码】 —— 论文让多种 ISP 操作并行处理 RAW,再按检测任务融合互补表示,避免过早固定为单一 RGB 结果。
- SimROD: A Simple Baseline for Raw Object Detection with Global and Local Enhancements(AAAI 2026)【链接】 【代码】 —— 论文用可学习全局 Gamma 和绿色通道引导的局部增强构建轻量 RAW 检测基线。
- SemiISP/SemiIE: Semi-Supervised Image Signal Processor and Image Enhancement Leveraging One-to-Many Mapping sRGB-to-RAW(arXiv 2025)【链接】 —— 论文利用 sRGB 到 RAW 的一对多映射生成伪数据,缓解 ISP 训练中真实 RAW—RGB 配对数据不足的问题。
(二)视觉搜索、Grounding 与可靠检测拓展
- Unsupervised Active Visual Search With Monte Carlo Planning Under Uncertain Detections(TPAMI 2024)【链接】 【代码】 —— 论文把检测器漏检的不确定性纳入概率地图和 Monte Carlo 运动规划,指导机器人选择下一处搜索位置。
- ROD-MLLM: Towards More Reliable Object Detection in Multimodal Large Language Models(CVPR 2025)【链接】 —— 论文通过目标级视觉—文本对齐和零目标训练样本,提升 MLLM 对不存在目标的拒识与检测可靠性。
- VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding(CoRL 2025)【链接】 【代码】 —— 论文通过动态拼接多帧图像、反馈式 grounding 和多视角投影完成零样本三维目标定位。
- AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models(arXiv 2026)【链接】 【代码】 —— 论文让在线视觉语言智能体按需检索点云候选并调用渲染工具获取额外视角证据,实现零样本三维目标定位。
- Re-Aligning Language to Visual Objects with an Agentic Workflow(ICLR 2025)【链接】 【代码】 —— 论文用 planning、tool use 和 reflection 循环修正 VLM 生成的语言描述与视觉目标之间的错配。
- GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents(arXiv 2026)【链接】 —— 论文用强化学习训练智能体决定何时以及如何调用裁剪、缩放等视觉工具,形成主动视觉 grounding 闭环。
- Active Perception Meets Rule-Guided RL: A Two-Phase Approach for Precise Object Navigation in Complex Environments(ICCV 2025)【链接】 【代码】 —— 论文先用规则引导强化学习探索环境,再依据目标检测反馈完成最后一公里的主动定位和停止。
- Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning(AAAI 2026)【链接】 【代码】 —— 论文迭代调用开放词汇检测器、MLLM 和 LLM,通过语义与空间推理逐步筛选最符合查询的候选区域。
三、结语与期望
“新芽计划”的目的并不是让学生在短时间内记住尽可能多的模型名称,而是希望大家从一个现象出发,逐步找到背后的科学问题,并判断现有工作究竟解决了哪一层。
在本专题中,RAW Detection、Task-Aware ISP、Camera Control 与 Detection Agent 并不是彼此孤立的小方向。它们共同指向一个更大的问题:
在不完整观测和有限预算下,下一步获取什么视觉证据最有价值?
方向一回答“下一张图应该怎么拍”,方向二回答“当前图像应该怎么继续看”。当 Exposure、Focus、Zoom、Viewpoint、ISP、Visual Search、Open-Vocabulary Detection 与 Tool Use 都能成为智能体的 Action 时,视觉系统便从被动感知走向主动、具身的感知。
希望通过本专题,新芽学子不仅能够复现一篇论文,更能开始思考:一个真正智能的视觉系统,究竟应该如何主动地“看”?