多场景支持」共找到 5919 篇相关文章

算法论文8

李飞飞又被超越了?百万「普通视频」打造通用4D世界模型!

全行业为昂贵视角数据发愁时,中科院和CreateAI推出NeoVerse,用百万单目视频打开4D世界模型大门。它抛弃视角数据和离线预处理,解决扩展性瓶颈,在重建速度、生成质量等方面表现出色,有丰富下游应用。

新智元
产品应用8

打开高德的理由又一条!全球首个「需求链智能调度」AI地图上线

8月,全球首个AI原生地图应用——高德地图2025上线。它有「需求链智能调度」系统,能处理任务出行。其ST - MAC技术可解构复杂请求、构建群体智能服务生态,还有时空感知、AI探索等功能。

新智元
开源动态8

社区供稿丨Jina-VLM:可在笔记本上跑的语言视觉小模型

Jina AI发布2.4B参数量的视觉语言模型Jina - VLM,在语言视觉问答任务达SOTA。它引入注意力池化,连接视觉与语言基座,处理问答等任务,对硬件要求低,项测试表现优,还介绍架构、训练策略和上手方式。

Hugging Face
算法论文8

数百个虚拟人在线逃生!天大等发布:首个实时在线智能体模拟方法

天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。

新智元
开源动态8

谷歌太壕了!编程Agent大招至简:开源且免费,百万上下文、模态、MCP全支持

谷歌开源免费的编程Agent Gemini CLI,提供业界最高免费限额,能在终端访问Gemini。其能力样,涵盖代码理解等,支持百万上下文、模态和MCP,开源协议为Apache 2.0,还给出安装和使用指引。

量子位
新闻资讯7

浙大系具身智能再闯港交所:主打工业场景,每天进账1000000元

仙工智能再次冲刺港交所,此前5月首次递表未实质进展。过去三年营收走高,2024年达3.39亿,但连续三年亏损累计1.22亿。其聚焦工业场景,提供机器人控制系统等一站式方案,产品涵盖控制器、软件等。

量子位
算法论文8

一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26

VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。

量子位
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向智能体系统的失败归因

随着大语言模型发展,智能体系统潜力大但失败率高。新加坡国立大学等机构研究者提出AgenTracer框架,构建标注管线、设计轻量级追踪器,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

深度学习自然语言处理
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向智能体系统的失败归因

随着大语言模型发展,智能体系统潜力大但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

PaperAgent
开源动态8

轻量级语音模型Vui开源,支持本地部署,笑声停顿全拟真,4万小时练出人类对话感!

近日,Fluxions - AI团队在GitHub开源轻量级语音模型Vui,可设备端运行。它能精准模拟语气词、笑声等,有三款模型,适用于语音助手、播客生成等场景,解决了传统模型的痛点。

开源星探