实时交互」共找到 864 篇相关文章

算法论文8

通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果

阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。

深度学习自然语言处理
开源动态8

手机操控革命!开源手机AI Agent,自然语言操控Android/iOS!

传统移动设备自动化工具难实现自然语言控制和跨应用交互,开源项目Mobile - Use提供解决方案。它由Minitap AI开发,能通过自然语言指令实现设备UI感知自动化,功能丰富,应用场景广。

开源星探
算法论文8

长视频生成可以回头看了!牛津提出「记忆增稳」,速度提升12倍

牛津大学团队提出VMem,把「看过什么」写进几何小片,用基于3D几何的记忆索引替代短窗上下文,实现「一致性更强、资源更省、速度更快」,实测速度比常规管线快约12倍。

新智元
新闻资讯7

Skywork技术论坛一手分享:Agent与多模态的落地真相|甲子光年

8月19日,昆仑万维发起第一期Skywork全球技术论坛讨论会,众多高校和企业嘉宾围绕Agent与多模态展开交流。探讨了Agent商业化、多模态应用等核心问题,提出诸多判断,指出行业热度高但落地是关键。

甲子光年
新闻资讯7

谷歌实验室推出了 Opal,一个用于创建 AI 迷你应用程序的可视化平台

谷歌实验室推出实验性无代码工具 Opal,可让用户通过自然语言和可视化编辑器创建 AI 小应用。它支持两种交互模式,开发完成后能分享链接。开发者关注其与微软产品竞争前景。

InfoQ
产品应用8

斑马智行,开启汽车主动智能时代|甲子光年

2025年WAIC上,斑马智行联合通义及高通,首发行业首个基于高通8397平台的端侧多模态大模型解决方案。该方案让智能座舱从“被动响应”到“主动感知”,还打通产业链,实现多方面适配。

甲子光年
新闻资讯8

Gemini负责人爆料!多模态统一token表示,视觉至关重要

Gemini模型行为产品负责人Ani Baddepudi与谷歌AI Studio产品负责人探讨Gemini多模态技术,涉及设计理念、应用及发展方向。指出多模态对构建AGI重要,还介绍Gemini 2.5视频理解亮点与‘万物皆视觉’理念。

量子位
开源动态7

开源端到端语音大模型:直接从原始音频输入,生成语音输出

目前大模型大多只能输出文本,人机音频交互不顺畅。Step - Audio团队开源端到端语音大模型Step - Audio - AQAA,能直接听懂音频问题并合成语音回答,介绍了其架构和各核心模块。

AIGC开放社区
算法论文8

首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会

香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。

机器之心
推荐文章8

巨头博弈下,Agent 的机会和价值究竟在哪里?

极客公园创始人与拾象相关人员对话,探讨 Agent 热点话题。指出其真正门槛或在基础设施,还谈及产品路径、技术挑战等,如通用 Agent 是大模型公司主战场,Coding 是衡量 AGI 关键指标等。

海外独角兽