「VLM多模态理解能力」共找到 1578 篇相关文章
CVPR2026 | 鬼手想点谁就点谁?LaSM让GUI智能体把注意力「收回来」
文章聚焦弹窗式环境注入攻击,指出多模态智能体易受环境干扰致目标漂移。提出 LaSM 方法,通过放缩关键层权重让智能体注意力回到任务,实验显示其提升防御效果,且对正常任务影响小。
OpenClaw不会蛋炒饭!Ropedia放出人类经验,机器人「教科书」来了
当LeCun和李飞飞各自拿下10亿美元押注世界模型时,一个更底层的问题浮出水面:谁来为Physical AI提供真正能用的数据?Ropedia给出的答案,不是更多视频,而是一部结构化的、来自真实世界的「经验百科全书」。
引爆千亿市场!杭州AI再出王炸:刷新自研天花板,“三甲专家大脑”装进14亿人口袋
在2026智诊科技AI发布会上,智诊科技完成蜕变。其发布的Wise MemOS 2.0打破传统局限,WiseDiag V2有深度多模态联合分析能力,WiseResearch让AI告别幻觉,“好伴AI”下放技术,服务大众。
模型声称会“脑补”,结果被论文打脸了?潜在空间想象竟是“摆设”!
多模态大模型中“潜在视觉推理”概念很火,研究者让模型在潜在空间“想象”。但清华和北交学者论文指出,潜在 Token 不关心输入、不影响输出、没信息量。作者提出 CapImagine 方案,效果远超潜在空间方法。
对话MossCode:估值1亿美金的AI运动手表,想给用户构建一套「个人运动能力Context」
AI智能运动穿戴赛道正火,MossCode获数千万元天使轮融资,估值达一亿美元。其创始团队背景强大,想打破运动行业「苦难叙事」,用AI理解个体差异,为用户打造更贴合需求的运动手表。
关于中美 AI 竞争的差距,我可能真的说错了
作者因读者反馈,意识到自己对中美AI竞争差距理解不全面。基模能力中国整体落后美国,但部分领域领先。模型能力提升难被多数用户感知,且中美在商业模式、模型开源等方面差异大。
自动化评测的九九归一——评测agent
本文提出统一评测Agent架构,实现评测全链路自动化。它能学习标注标准,完成自动标注等工作。还介绍架构、解耦方法、模型优化及训练方案,解决多模态幻觉等问题,提升机审率,节省标注成本。
蚂蚁开源世界模型LingBot-World:具有分钟级记忆的实时世界模拟器
蚂蚁集团旗下灵波科技开源具身智能模型及世界模型LingBot-World,它将视频生成模型进化成可交互世界模拟器,采用多阶段进化策略,有涌现记忆等能力,虽有不足,但为开源社区构建世界模型迈出坚实一步。
录屏扒代码、截图改网页!Kimi K2.5把「视觉x代码」玩明白了
Moonshot AI推出最强Agentic模型Kimi K2.5,发布后热度起飞。它实现多功能一体化整合,具备设计审美,支持可视化编辑,推出编程工具Kimi Code。在多项测试中表现优异,还能在办公领域发挥作用,其智能体集群提升了效率。
5年博士1年读完,20分钟干完48小时教授工作!这个工具在硅谷火了
新智元报道,Claude Code正重新定义编程。顶级开发者用它写代码,零基础小白10分钟做出App,教授20分钟完成48小时工作量。它理解项目上下文,自动设计、生成、测试代码,普通人用自然语言提需求即可。