「纯视觉路线」共找到 1059 篇相关文章
小鹏加速冲向L4终局:对VLA架构「动刀」成关键一环
在辅助驾驶领域,端到端的VLA方法虽有效果,但面临中间层语言难以准确表达物理世界细节的问题。小鹏汽车去掉“语言转译”环节,推出第二代VLA,有跨代级驾驶体验,背后是底层技术架构重构。
45亿红包打响AI入口大战,百度给出另一种回应
春节期间,国内外AI圈有两件大事,国外OpenClaw在GitHub爆火,国内大厂掀起AI春节营销大战。百度率先接入OpenClaw,并推出5亿红包活动。其采用搜索+AI策略,有全栈布局优势,想走长远发展之路。
DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案
DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。
Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆
由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。
轻量高效,即插即用:Video-RAG为长视频理解带来新范式
现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。
刚刚,Figure 03惊天登场!四年狂造10万台,人类保姆集体失业
通用机器人曙光来临,Figure 03正式亮相,专为Helix「大脑」打造,手掌心有摄像头,指尖能感知3克力。其进化亮点多,未来四年将量产十万台,适用于家庭和商用场景。
LLM开源2.0大洗牌:60个出局,39个上桌,AI Coding疯魔,TensorFlow已死
9月13日蚂蚁集团开源团队发布LLM开源2.0全景图,收录114个项目,39个新晋、60个出局。生态洗牌,Agent层活跃,分类架构细化。AI Coding等领域发展显著,TensorFlow不敌PyTorch,还梳理厂商大模型发布情况。
InfiniteTalk:音频驱动的从口型到全身动作同步方法
近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。
「只参与,不参赛」奖牌数却仅次于宇树,这个幕后玩家如何做到的?
2025年世界人形机器人运动会,宇树科技获奖最多,没参赛的加速进化T1获奖牌数排第三。这家新公司选不同发展路径,重产品与生态,技术应用于多场景,有望成行业‘苹果’。
厉害了,智谱造了全球首个手机通用Agent!人人免费,APP甚至直接操控云电脑
智谱发布全球首个手机通用Agent AutoGLM,免费且人人可用。它可在云端执行任务,不占本地资源,还能操控云电脑。能集成到多种载体,上线移动端API申请通道及开发者生态共建计划。