「语音基准」共找到 1125 篇相关文章
o4-mini暴击六大数学天团,攻破陶哲轩难题!4.5h激战人类阵地失守
Epoch AI团队举办竞赛,约40位数学精英分成8组与o4 - mini - medium在FrontierMath基准上对决。o4 - mini击败6组团队,虽未完全超越人类,但Epoch AI预测到2025年底AI可能超30% - 50%人类基准。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
深入感知级别图像理解:UniPercept 统一图像美学、质量与结构纹理感知
多模态大语言模型在语义级任务表现卓越,但在感知级图像理解有短板。上海人工智能实验室等机构联合发布 UniPercept,构建感知属性定义系统与基准测试集,训练强基准模型,在多方面表现超现有顶尖模型,应用潜力大。
理想首款AI眼镜,只卖1699元
理想推出首款AI眼镜Livis,售价1699元起,整备重仅36g,续航18小时。它能控车、有头枕音响,还可拍照录像。采用流式智能语音框架,核心亮点是理想同学语音助手,意在构建以车为核心的AI生态。
AI 播客原理解析
作者分享用豆包AI播客将英文长文转成高质量播客的体验,解析AI把文章变真人对话式语音播客的原理,涉及提示词工程和文字转语音技术,还介绍提示词写作与优化过程及长文处理方法。
普林斯顿团队领衔发布最强开源数学定理证明模型:32B性能大幅超越前代SOTA DeepSeek 671B
近日,普林斯顿大学牵头多机构推出开源数学定理证明模型 Goedel-Prover-V2。其 32B 旗舰模型在多基准测试超 DeepSeek-Prover-V2-671B,8B 小模型特定基准性能与之持平。该模型有三项关键创新,团队已公开模型及数据集。
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
VoxCPM2:无tokenizer语音合成,高保真声音克隆
VoxCPM2突破传统TTS系统局限,直接操作连续声学特征,保留音色纹理更完整。基于扩散自回归架构,有硬核技术指标,提供三种克隆模式,性能佳,生态完善,微调便捷,但也存在安全风险。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
Show me《指环王》!卡帕西强推大模型评测新基准
大神卡帕西宣称Anthropic用《指环王》给大模型评测上强度,这一‘指环王基准’正接替‘鹈鹕骑自行车’SVG测试。虽Opus 5生成的画面粗糙,但网友测试展现出丰富创意,不过新测试也引发争议。