算法论文8
FSDrive:推动自动驾驶迈向视觉推理
机器之心
AI 摘要
FSDrive提出“时空视觉CoT”,让模型直接“以图思考”,联合未来场景与感知结果推理。该方法不改动原MLLM架构,实验显示其以低数据/算力成本获强竞争力,推动自动驾驶迈向视觉推理。
阅读原文 · 机器之心
NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理
面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
算法论文8
复旦&引望WAM-Diff2让自动驾驶解码提速15.1倍
视觉-语言-动作(VLA)模型是端到端自动驾驶主流技术,但自回归解码架构有瓶颈。复旦大学与引望智能联合提出WAM-Diff2,实现自回归VLA向离散扩散模型迁移,解码加速15.1倍,多任务性能不降。
机器之心
算法论文8
RefCaptioner 让视频与参考图精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
机器之心
算法论文7
大模型看图能力差,与人类有近 9 倍鸿沟
本文介绍了专门测量「主动观察」能力的视觉推理基准 ActiveVision,评测显示无外部工具时,大模型与人类准确率有近 9 倍差距,用工具后虽提升但仍远不如人类,还说明了其出题与避免取巧的方式。
机器之心
推荐文章8
吴甘沙:用兵法做物理AI,机场份额超91%
吴甘沙在演讲中分享驭势科技创业十年心得,用《孙子兵法》《隆中对》构建竞争策略,指出自动驾驶达99分易,最后1%难,是创业公司护城河。还介绍了市场选择、技术路线、商业模式等内容。
AI科技大本营