语音基准」共找到 1125 篇相关文章

新闻资讯8

奥数金牌只是序章!OpenAI谷歌彻底打脸预言家,AI巨浪势不可挡

2022年专家预言AI到2025年赢得IMO金牌概率低,结果OpenAI和谷歌DeepMind的LLM提前摘金。此前多项AI基准测试预测也失准,AI发展远超预期。GPT - 5降低使用门槛,群体智能时代到来,各机构需重新思考生存之道。

新智元
新闻资讯7

OpenAI最强对手出现!马斯克发布Grok-4,性能碾压Claude 4两倍!

半小时前马斯克发布Grok - 4,虽Grok3.5跳票、直播迟到被吐槽,但它训练量和算力投入大。在多项基准测试中碾压Claude Opus 4,还具备原生工具调用等能力,xAI目标是让其更快更智能。

探索AGI
开源动态8

对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA

浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。

新智元
开源动态8

500万视频数据集+全新评测框架!北大开源主体一致性视频生成领域新基建OpenS2V-Nexus,生成视频 「像」 又 「自然」

北大团队推出开源套件OpenS2V - Nexus,含全球首个S2V细粒度评测基准OpenS2V - Eval和500万条高质量人物文本视频三元组数据集OpenS2V - 5M,还评测18个S2V模型,揭示主流模型能力差距。

机器之心
新闻资讯7

AI屠刀下一站“Vibe设计”!谷歌一个产品把合作伙伴Figma干崩了

3月18日谷歌宣布旗下AI设计工具Stitch支持Vibe Design,用户可用语音设计UI和前端界面。消息一出,Figma股价暴跌,Adobe股价也下跌。Stitch有五大能力升级,与Figma功能重叠,谷歌靠免费、分发、捆绑或吃掉市场份额。

量子位
开源动态8

社区供稿 | Jina Embeddings V4: 为搜索而生,多模态多语言向量模型

Jina AI发布多模态向量模型jina-embeddings-v4,参数38亿,能同步处理文本与图像。内置LoRA适配器强化检索等任务表现,在多基准测试中展现顶尖性能,支持单/多向量表示。介绍了架构、上手指南等。

Hugging Face
算法论文8

MSRA首测AI从零建仓库:能写、能跑,但不一定对丨ACL'26

微软亚洲研究院工作RepoGenesis被ACL 2026高分录用,它是面向多语言、仓库级、端到端Web微服务生成的基准。输入贴近实际,用多维度评测开源Agent和商业IDE,还拓展模型微调。但也有边界,未模拟真实复杂需求。

量子位
开源动态8

美团开源全模态,比肩顶级闭源模型,开源新SOTA

美团LongCat团队发布5600亿参数开源全模态模型LongCat - Flash - Omni,它有端到端全模态架构,能实现毫秒级实时音频 - 视觉交互。该模型训练采用渐进式策略,工程上有高效技术支撑,在多基准测试表现出色。

AIGC开放社区
新闻资讯7

谷歌约战,DeepSeek、Kimi都要上,首届大模型对抗赛明天开战

太平洋时间8月5 - 7日,8款前沿AI模型将在Kaggle Game Arena展开为期3天的国际象棋比赛,参赛方都是AI界顶流。谷歌称现有基准测试难跟上模型发展,这场比赛是探索新评估方法。赛制为单败淘汰制。

机器之心
产品应用8

太逼真!豆包·播客模型来了:一句话生成「苏超联赛」播客,很懂13太保的梗

火山引擎发布豆包·播客模型,生成的AI对话语气、停顿等像真人。操作简单,生成快且有字幕。能处理多种类型内容,如热搜话题、苏超联赛、超长文本等。其基于端到端实时语音模型,有技术突破。

量子位