多模态任务」共找到 2681 篇相关文章

算法论文8

VLA别再「走神」:即插即用提升视觉泛化,相对Pi0.5提升18%

至简动力、北大、港中文团队发现VLA模型深层动作预测对关键视觉区域依赖下降,提出DeepVision - VLA框架,在仿真和真实任务中效果显著,能有效提升视觉泛化能力。

量子位
开源动态7

DeepSeek之后:中国开源人工智能生态的架构选择

自2025年1月“DeepSeek时刻”,中国开源社区有历史性进展,讨论焦点从模型转向架构与硬件选择。技术架构多元,多模态能力扩展,开源许可宽松,小模型走红,本土硬件采用加快。

Hugging Face
新闻资讯7

“Claude Skills很棒,可能比 MCP 更重要”

10月17日,Anthropic发布Claude Skills,是助其模型获新功能的模式。Claude用Skills可改进执行特定任务方式,且只在相关时调用。它易共享,可能比MCP更重要,实现依赖编码环境。

InfoQ
算法论文8

1/15成本,实现AI水印新SOTA | 南洋理工大学&A*STAR

给AI生成作品打水印成行业共识,但传统方法有短板。南洋理工大学等机构研究人员提出局部鲁棒图像水印方法MaskMark,成本仅为Meta模型WAM的1/15,在多任务中表现优异。

量子位
算法论文8

在「想象」中练就真机能力:RISE,让VLA强化学习告别真机试错

香港大学李弘扬老师团队提出 RISE 框架,通过组合式世界模型让机器人在虚拟空间强化学习,解决传统 VLA 模型落地难题,在长程任务中性能提升显著,重新定义智能体理解世界的方式。

机器之心
新闻资讯8

李飞飞最新长文火爆硅谷

AI教母李飞飞发表长文,首次系统性解释空间智能,提出真正具有空间智能的世界模型须具备生成、多模态、交互三个核心能力,还分享World Labs进展及世界模型在多领域的潜力。

量子位
开源动态7

登顶AndroidWorld开源榜首!可以操作手机的移动端AI Agent。

Minitap开源的手机Agent登顶AndroidWorld开源榜首,亮点是能操控安卓与iOS模拟器。用户用自然语言就能完成复杂任务,还具备跨平台控制、全场景交互等特点,项目可快速部署。

开源AI项目落地
开源动态8

告别Transformer,重塑机器学习范式:上海交大首个「类人脑」大模型诞生

上海交通大学团队发布首个「类人脑」大模型 BriLLM,脱离传统 Transformer 架构限制。它基于 SiFu 学习机制,有可解释性、能无限处理上下文等优势,还支持多模态融合,已获交大重点项目资助。

机器之心
新闻资讯8

Andrej Karpathy 分享ChatGPT模型选择指南

前OpenAI创始成员Andrej Karpathy发文分享ChatGPT模型使用指南,点出关键事实,如o3适合重要任务。社区热烈讨论,专业用户分享策略,还对o4 - mini等模型表现给出反馈。

AGI Hunt
新闻资讯7

李飞飞刚发Atlas,中国开源“同款”已抢跑半年?

9月2日,李飞飞团队发布多模态世界模型Atlas,引发好评。而国内影溯3月就开源InSpatio - World模型,有类似能力。影溯登顶权威榜单,还联合启动大规模空间智能3D数据开放计划。

量子位