语音工具」共找到 2098 篇相关文章

产品应用8

美团提出首个语音交互GUI智能体,端到端语音训练能力优于传统文本训练

美团和浙大联合推出GUIRoboTron - Speech,这是首个能利用语音指令和屏幕截图端到端决策的自主GUI智能体。它解决了文本依赖问题,团队经多步骤研发,其性能评估表现佳,还给出招聘信息。

量子位
产品应用8

首发!成都华微亿门级逻辑综合加固EDA工具来了

6月26日,成都华微电子科技股份有限公司济南研发中心主任王宁发布亿门级FPGA逻辑综合与安全加固综合EDA工具。该工具前端性能比肩国外,还补上市场空白,集成加固功能,有本地化服务优势。

芯师爷
开源动态8

最低 306KB,这款低延迟语音检测神器太绝了!

语音交互中,VAD至关重要。新开源的TEN VAD能精准识别语音起止,是替代WebRTC VAD和Silero VAD的优选。它低延迟、高准确率、极致轻量,已被Kaldi集成,还能跨平台部署,使用方便。

开源先锋
算法论文7

支持5000+ Server,ScaleMCP为大模型Agents动态同步MCP工具

现有工具选择框架未整合MCP服务器,存在重复、不一致和低效问题。普华永道提出ScaleMCP,配备MCP工具检索器,还提出TDWA嵌入策略,通过实验证明其提升了LLM代理性能。

PaperAgent
产品应用7

本地可运行的高质量的文本转语音模型

介绍Kyutai的Pocket TTS,一款轻量级文本转语音应用,可在CPU高效运行,模型小且低延迟,支持Python API和CLI,能语音克隆,还可在浏览器试用,目前仅支持英语,也有社区浏览器端实现。

GitHubStore
算法论文8

半量工具,双倍效能:ARPO革新大模型强化学习

大语言模型在多轮工具调用场景有挑战,传统强化学习算法有探索效率低和资源消耗大问题。本文提出ARPO,通过量化token熵分布变化设计自适应探索机制,降低工具调用成本且提升多轮推理性能。

深度学习自然语言处理
开源动态8

一句话生图要过时了?开源图像生成Agent进化出「工具编排」

来自多机构的研究团队提出GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现出色,已开源模型、代码等。

机器之心
开源动态7

mcpx?要来拯救mcp!让工具调用不再吃掉你的上下文

MCP传统集成方式需在对话前加载所有工具定义,易使上下文溢出。开发者cs50victor基于mcp - cli构建mcpx,按需发现工具,大幅节省token,提升准确率,适合本地部署,虽有额外推理调用,但利大于弊。

AI工程化
开源动态8

冲159K星 OpenClaw工具链,正在悄悄改变Agent玩法

Clawdbot更名openclaw后在github星冲到159K。它能让AI深入工作流且保数据隐私,有集成渠道多、工具齐全、有状态会话与持久记忆、路由策略适配不同模型等核心能力,并在多方面优于常见AI工具

CourseAI
新闻资讯8

工作场景AI化,一个月花100美元订阅AI工具值吗?

InfoQ《极客有约》X AICon 直播栏目邀请来也科技胡一川等探讨 AI 时代「10x 个体」与「10x 组织」。指出「10x 个体」核心是主动思考、善用工具,组织应从「固态」向「液态」转型,还分享了 AI 工具使用与落地经验。

InfoQ