语音基准」共找到 1125 篇相关文章

开源动态8

“AI大神”李沐终于开源新模型,爆肝6个月,上线迅速斩获3.6k stars!

7月23日,“AI大神”李沐开源音频基础模型Higgs Audio v2,构建于Llama - 3.2 - 3B之上,预训练数据丰富。该模型在多个测评中成绩领先,有多种能力,李沐介绍其技术及训练方法。

AI前线
开源动态8

2G 内存跑 Gemma 3n 完整版!全球首个 10B 内模型杀疯 LMArena:1300 分碾压记录

当地时间6月26日,谷歌正式发布Gemma 3n完整版,可在本地硬件运行。它是开源大模型,具多模态能力,最低2GB内存设备就能跑,E4B模型LMArena测评表现佳,还有MatFormer架构等多项创新。

AI前线
算法论文8

音频大模型安全可信度的全面“体检”!6大维度,清华南洋理工联手打造

南洋理工和清华团队提出新框架AudioTrust,将ALLMs评估扩至六个核心维度,探究音频模态特有问题。目前基准及平台已开发,揭示了开源与闭源ALLMs在多维度的潜在风险。

量子位
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
新闻资讯8

重磅!OpenAI深夜发布GPT-6 Astra,总裁Brockman:这就是AGI

OpenAI发布GPT-6 Astra,总裁称实现了AGI。它在多基准测试成绩优异,能独立完成复杂工作,网络安全能力强。但推理难监控,其即日起向特定机构开放,有使用价格标准。

AI寒武纪
算法论文7

机器人从炫技 Demo 走向上岗,两篇 ICML 顶会论文拆解背后的智能底座

在WRC世界机器人大会上,云蝶科技发布RoboForge系统级具身大脑和WING任务型本体。其科研团队两项成果POLIA与Strat-Reasoner发表于ICML 2026,从视觉证据和他者意图两方面,为理解具身大脑技术提供切口。

AI科技评论
产品应用7

The Batch: 969 | 谷歌的机器人模型有了腿

谷歌发布 Gemini Robotics 2(GR2),能将相机图像和文字指令转为机器人关节控制命令,可同时控制人形机器人腿、躯干、手臂和手部,简化模型训练和设计,不过谷歌未公布其基础模型等信息。

DeeplearningAI
新闻资讯7

上下文窗口限制被打破:Subquadratic推出了一个1200万Token的窗口

2026 年前沿模型宣传至少 100 万 Token 上下文窗口,但利用不佳。Subquadratic 推出能处理 1200 万 Token 窗口的模型,称可绕过问题,还将推 5000 万窗口模型,其 SSA 架构有优势,基准测试成绩佳。

InfoQ
算法论文8

ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑

北京通用人工智能研究院语言交互实验室提出原生并行推理器NPR,它有「自蒸馏 + 并行强化学习」三阶段训练范式,配套并行推理引擎,让并行推理成模型原生认知能力,还介绍了其具体实现、实验结论等。

机器之心
新闻资讯8

4.3亿听障人士的福音,哥大团队研发脑控助听器,最高增益12分贝

哥伦比亚大学等机构团队研发实时闭环脑控听力系统,发表于Nature Neuroscience。该系统解码大脑注意力信号,放大目标人声、压制杂音,打破传统助听器瓶颈。经多项测试,效果显著,临床应用潜力大。

DeepTech深科技