具身视觉」共找到 1599 篇相关文章

算法论文8

去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理

上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。

AIGC开放社区
开源动态8

告别昂贵人工标注,英伟达全自动视频理解助力小模型逆袭顶级大模型

麻省理工、英伟达等推出FoundationMotion,它是全自动数据生成流水线,能解决运动数据稀缺难题。通过自动标注生成问答数据,让小模型经微调后在运动理解上超越顶尖闭源模型,还介绍了其数据生成、问答设计等环节。

AIGC开放社区
7

谷歌杀入诺奖神殿,两年三冠五得主!世界TOP3重现贝尔实验室神话

2025年谷歌关联科学家再获诺贝尔物理学奖,使其两年内收获三项诺奖、五位得主。此前2024年已有三位相关科学家获奖。谷歌成继贝尔实验室与IBM后,最「诺奖基因」的科技企业。

新智元
算法论文7

SceneWeaver:面向通用三维环境生成的反思型智能体框架

室内场景合成在智能兴起下愈发重要,现有方法存在局限。BIGAI提出SceneWeaver框架,通过基于工的迭代优化统一多样场景合成范式,有高保真模拟、强健物理交互等优势。

带你学AI
新闻资讯8

新天终启,万象智生!从AlphaGo到GPT-5,新智元十年见证ASI创世纪

2025年AI飞速发展,大模型发布密集,如OpenAI、谷歌等有诸多成果,中国造大模型也表现出色。新智元9月7日将举办十周年峰会,邀多位嘉宾探讨前沿突破,还将发布报告,人类将达ASI临界点。

新智元
算法论文8

Sora没做到的,LongVie框架给解决了,超长视频生成SOTA

视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。

机器之心
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen
新闻资讯7

对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
开源动态8

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen社区发布业界最早工程化落地的多模态Skill范式Skill-Omni,让Agent经验从‘读得懂’升级为‘看得见’。它能将网页和视频视觉知识沉淀为多模态Skill,还介绍了生成及读取方式和适用任务。

量子位
开源动态8

19K star 霸榜,下一代的浏览器自动化神器!

做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。

开源先锋