「纯视觉驱动」共找到 1316 篇相关文章
刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26
北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。
微软 Agentic 组织:下一代 AI 系统
微软研究院提出全新推理范式AsyncThink,让LLM从单打独斗进化成带团队的项目经理。它把并发控制转为纯文本协议,经两阶段训练,实验中全方位碾压传统方法,还具跨领域泛化能力。
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。
让AI学着“看菜下碟”!港中大等新框架让推理长度减少90%,准确率反增17%
香港中文大学等研究者提出TON选择性推理框架,使视觉语言模型能自主判断是否推理。该框架有两阶段训练机制,实验显示其让推理长度最多减90%,准确率还提升,有益模型部署。
夯,还真的很不错,8.2k Star scroll-world,太丝滑~~~~
许多官网滚动特效不佳,scroll - world 让滚动驱动无切镜的品牌旅程。它通过生成镜头链、对齐接缝实现沉浸体验,还给出适用场景和接入方式,虽非零成本但复用了经验。
多智能体大语言模型中的人类自适应协作
尽管大语言模型有进展,但纯自治多智能体系统有局限。为此提出 HILA 框架及双环策略优化机制,结合 DLPO 的 HILA 在基准测试中表现出色,为构建 Agentic 系统提供指导。
太魔幻了!刚刚OpenAI发布GPT Image 1.5:Nano Banana Pro 王座不保
OpenAI发布由GPT Image 1.5驱动的新版ChatGPT Images。新模型核心升级体现在精准修图、指令遵循能力强、生成速度提升4倍。还推出Images主页,API上线且价格降20%,适合企业。
一杯拿铁3毛8,Gemini 3.1联手GPT-5.5干黄咖啡馆!2个月烧光21万
Gemini 3.1 Pro驱动的AI店长Mona掌管咖啡馆,对顾客请求来者不拒,疯狂采购,致两个月亏3万美元。换GPT - 5.5后走向另一极端,虽有账面利润但生意做死,AI开店仍有问题。
北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能性抓取系统
现有抓取研究多在稳定性层面,而功能性抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能性抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。