「语音编程」共找到 1315 篇相关文章
“边说边思考”,Mini-Omni-Reasoner 开创实时语音推理新范式
Mini - Omni - Reasoner将推理能力引入大型语音模型,开创“边说边思考”范式,实现实时语音推理与交互。推出Spoken - Math - Problems - 3M数据集,经四阶段生成流程构建。训练采用分阶段策略,性能超基础模型。
谷歌推出 Jules:一款基于 Gemini 2.5 的异步编程智能体
谷歌将异步智能编程助手 Jules 正式发布,它基于 Gemini 2.5 Pro 模型,可执行多种编程活动。采用异步模式,直接接入代码库。测试阶段开发者反馈多,正式版有三种访问层级,但部分用户对其界面和输出质量不满。
连续自回归的dots.tts:小红书开源语音合成模型「基座」
语音合成赛道发展如早期大语言模型,路线未收敛。小红书与上海交通大学合作开源的 dots.tts,是 20 亿参数、全连续、端到端自回归 TTS 基础模型,有准确度高、可扩展等特点,还开源了代码。
SpaceX一分现金没花收购Cursor,马斯克吞下AI编程工具第一名
SpaceX在IPO第四天,以600亿美元全股票方式收购AI编程工具Cursor母公司Anysphere。Cursor商业增长快,但市场份额下降且算力不足。收购是马斯克算力布局收尾,还将发布联合模型及编程代理工具。
日本AI王者,CTO是Transformer之父,刚拿下世界编程竞赛冠军
在ICFP 2025编程大赛中,日本Sakana AI的「Team Unagi」以人机共创模式夺冠。其AI系统「ShinkaEvolve」优化代码,性能提升近十倍,还启发人类思维。Sakana AI以自然进化为理念,探索AI新范式。
重磅发布!国家队出手解决企业跨省通信「老大难」,语音识别错误率暴降20%
企业全国语音通信业务曾面临交付周期长、AI应用门槛高的问题。联通云犀平台以「全云化架构+语音AI基座」破局,实现架构重构与AI进化,降低方言识别错误率,在多行业落地降本增效。
少 61% Token、多10倍成功率,这个终端 AI 编程代理火了!
现在多数AI编程工具问题多,而在Github上火爆的`oh-my-pi`是运行在终端的AI编程代理,有哈希锚定编辑等实用功能,支持多模型,经基准测试效果好,还能解决实际开发痛点。
击败GPT、Gemini,复旦×创智孵化创业团队「模思智能」,语音模型上新了
近日,由复旦邱锡鹏担任首席科学家的模思智能发布多说话人自动语音识别模型 MOSS - Transcribe - Diarize,性能超 GPT - 4o、Gemini 等。它解决语音领域落地痛点,跑分亮眼,还解决 SATS 方案不足,开放 API 限时免费。
DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危
据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。
把 AI Coding Agent 搬进终端:Crush 让你的命令行变成“编程搭子”
Crush是Charmbracelet出品的终端AI编程代理,可将工具、代码和工作流接到所选LLM,在终端协同工作。它有多模型、会话制等特点,适合终端重度用户等,还介绍了安装、使用及进阶玩法。