空间超感知」共找到 2770 篇相关文章

开源动态7

爆火开源AI画布,真正可落地的手写AI黑板

文章推荐开源AI画布PenEcho,它是个智能黑板,适合学习场景,让手写与AI共生。能理解内容及空间关系,把回答放回画布,支持多模型,还具备多种功能。

开源AI项目落地
算法论文8

苹果新作:内化视觉思考,推理提速 5 倍

Apple研究团队提出Internalized Visual Thinking(IVT),一种将预测性世界建模能力内化到模型表征中的后训练框架。它在训练时预测未来,推理时直接回答,相比Visual CoT推理提速5倍。

机器之心
产品应用8

谷歌首个原生多模态向量模型发布:Agent 可以用文字搜图片、用图片搜视频了...

谷歌推出首个原生多模态嵌入模型Gemini Embedding 2,通过Gemini API和Vertex AI公开预览。它将文本、图像等映射到统一向量空间,支持多模态交错输入,性能越现有领先模型,开发者可快速接入。

AI寒武纪
算法论文8

AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性

中国科学技术大学等多机构研究者发表综述,梳理500篇论文,揭示扩散模型视觉内容合成“一致性危机”,介绍三类一致性关系、加强位置、评估问题,指出未来模型需具备冲突感知等能力。

新智元
算法论文8

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。

量子位
算法论文8

谢赛宁团队用RAE实现从8%到84%的飞跃,宣告VAE时代结束

谢赛宁团队用RAE新架构将ImageNet图像生成FID刷到1.13,宣告VAE组件过时。RAE结合先进表征学习成果与强大生成模型框架,解决诸多问题,还为其高维潜空间定制DiTDH架构,性能优异。

AIGC开放社区
开源动态8

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

阿里达摩院推出 RynnBrain 模型,从底层出发将时空记忆和物理空间推理训进模型,在 16 项具身 Benchmark 上达 SOTA。还开源 7 个模型,解决通用大模型在物理世界的局限,在多项任务表现出色。

机器之心
算法论文8

ICLR 2026 Oral | 让大模型学会“像法医般思考”,实现可解释、可泛化的深度伪造检测

生成式AI发展使深度伪造技术安全隐患受关注,现有检测器表现不佳。中科院自动化所联合蚂蚁集团提出Veritas框架,构建HydraFake数据集,赋予大模型“模式感知推理”能力,实验效果现有检测器,还给出未来研究方向。

深度学习自然语言处理
产品应用8

字节发布通用游戏智能体!5000亿token训练,用鼠标键盘吊打GPT-5!

字节seed团队打造通用游戏智能体Game-TARS,基于键盘—鼠标动作空间训练,用5000亿标注量级数据,结合新技术提升扩展性和泛化性,在多类游戏任务中表现越GPT - 5等模型。

量子位
新闻资讯8

Google封神,计算机视觉的GPT3时刻来了!

Google Deepmind称在CV领域做出类似GPT-3的成果,Veo 3经大规模训练涌现通用视觉理解和推理能力,能以图片+提示词完成复杂视觉任务,还具备感知、建模等四大能力。

探索AGI