AnchorReasoning:面向自动驾驶长尾场景的视觉定位与因果推理数据集
AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios
一个自动驾驶推理数据集,41 万多帧标注把视觉证据和驾驶决策串成思维链,多个骨干模型实测轨迹误差明显下降,做自动驾驶 VLM 的可以看看。
新数据集 AnchorReasoning 基于 WOD-E2E 构建,包含 416,119 帧标注和 395,379 个决策关键元素,覆盖 4 大类、19 种细粒度类型。每帧组织为视觉定位思维链(VG-CoT),串联元素识别定位、属性推断、驾驶行为理由和轨迹规划四个层级。配套课程式监督微调策略和对象尺寸感知的定位评测指标。在八种通用、具身智能和自动驾驶骨干模型上,5 秒 ADE 和 FDE 分别下降 7.84 和 11.86,同时推理 token 减少 18.5 个,每帧延迟降低 0.32 秒。
AnchorReasoning: A Visual Grounding and Causal Reasoning Dataset in Long-Tail Autonomous Driving Scenarios
Vision-language models (VLMs) offer a promising approach to long-tail autonomous driving, but existing driving datasets provide limited supervision for connecting decision-critical visual evidence with reasoning and planning. We introduce AnchorReasoning, a visually grounded reasoning dataset built on WOD-E2E, containing 416,119 annotated frames and 395,379 decision-critical elements across four major categories and 19 fine-grained types. Each frame is organized as a visually grounded chain-of-thought (VG-CoT) that links decision-critical element identification and localization, element attributes and implications, driving-action rationale, and action and trajectory planning. We further develop a curriculum supervised fine-tuning strategy that progressively learns these hierarchical capabilities, together with an object-size-aware grounding metric for evaluating localization quality. Experiments across eight general-purpose, embodied-AI, and AV-specific backbones show that VG-CoT supervision improves grounded reasoning and trajectory prediction. Across models, 5-s ADE and FDE decrease by 7.84 and 11.86, while RFS Frame and Cluster improve by 1.66 and 1.70. These gains are achieved with 18.5 fewer reasoning tokens and 0.32 s/frame lower inference latency on average, demonstrating the value of visually grounded, decision-focused supervision for VLM reasoning and planning in long-tail autonomous driving.