语音交互」共找到 807 篇相关文章

产品应用7

南京艺术学院人工智能与计算机视觉算法创新设计成果展示

南京艺术学院‘人工智能与计算机视觉算法创新设计工作坊’汇集师生与专家成果,涵盖多种艺术形式。学生学习多技术完成跨媒体作品,如以《大闹天宫》为蓝本的交互装置,还有探索情绪、文化等主题的作品。

MANA新媒体艺术站
产品应用8

实测对比!扣子空间播客功能完爆 NotebookLM,覆盖场景更大

多模态是大模型热门应用概念,文本生成语音赛道受资本青睐。作者实测对比扣子空间和NotebookLM,发现扣子空间播客功能更优,能精准拿捏尺度,覆盖场景大,还能做旅行攻略、生成网站等。

InfoQ
开源动态7

315 行代码构建编程助手,Go大佬揭开智能体的「神秘面纱」

知名Go大佬Thorsten Ball用315行代码构建编程智能体,虽无法与Claude、Gemini等编码功能媲美,但为初学者提供学习范例。文章分享构建步骤,包括准备工作、添加工具等,展示如何让智能体与Claude对话及使用工具。

机器之心
开源动态8

终于用上啦,3.9 万 Star archify,程序员福音!!!!

架构图常与代码脱节,约3.9万Star的archify让Agent先把代码库或系统描述写成带类型的JSON,经布局、检查后交付可交互系统地图,它先结构化、验证再交付,适用于特定场景。

小华同学ai
产品应用7

Cursor、OpenClaw 同时出手,“口袋编程”时代来了:程序员只用“动嘴”!

Cursor 推出 iOS 移动应用 Cursor Mobile,与桌面版打通,可远程管理编程智能体,还支持语音输入。OpenClaw 也官宣有原生移动应用,登陆 iOS 和安卓平台。这标志开发模式向移动化转变,但也有成本等问题。

InfoQ
算法论文8

ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑

北京通用人工智能研究院语言交互实验室提出原生并行推理器NPR,它有「自蒸馏 + 并行强化学习」三阶段训练范式,配套并行推理引擎,让并行推理成模型原生认知能力,还介绍了其具体实现、实验结论等。

机器之心
算法论文8

ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!

现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。

机器之心
开源动态8

清华开源|做一门课要3天?用 OpenMAIC,30分钟生成完整互动课堂|GitHub 15.6k

OpenMAIC 是清华开源的 AI 互动课堂平台,能将主题或学习材料快速转化为完整互动学习体验。它把课堂拆成多种交互组件,架构设计出色,支持多 LLM 服务商,还能在聊天应用生成课堂。

小华同学ai
产品应用8

OpenAI Codex桌面版深夜突袭!一人指挥Agent军团,程序员彻底告别996

OpenAI推出编码杀器Codex桌面App,可指挥多Agent并行协作。它能多任务并行切换,创建调用Skills,设置自动化流程,从写代码进化到解决问题,还具备双人格模式,默认安全,有望重塑开发者与代码交互逻辑。

新智元
产品应用8

AI开始“动手”了,全世界第一个带头的是阿里千问

阿里千问App上线400多项新功能,依托Qwen模型和阿里生态,在全新Agent架构下提升AI能力。它能在购物、旅游、办公等场景帮用户办事,使AI具备现实世界落地能力,推动人机交互跃迁。

量子位