评测标准」共找到 946 篇相关文章

开源动态8

Soul App 又放大招!把 42000 小时数据喂出的“歌神” SoulX-Singer 开源了!

语音合成近年爆发式增长,开源领域也有强大音乐模型。Soul APP联合多机构开源的SoulX - Singer,喂了42000小时数据,主打零样本歌声合成,支持双控制方式,多语言与跨语言能力强,架构先进,评测表现优。

开源星探
推荐文章8

Scaling 时代落幕:Ilya 眼中下一代 AI 的关键,不在模型,在人类

深度学习亲历者 Ilya Sutskever 认为单靠扩大模型规模推进 AI 的时代已结束,未来关键在于解决 AI 泛化难题。他指出当前模型评测与现实能力脱节,人类泛化能力强或源于进化,还探讨了价值函数等内容。

InfoQ
算法论文7

OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??

OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。

量子位
产品应用7

时隔一年,再次使用7个国产AI大模型写高考作文,国产模型的进步也太大了!有彩蛋。

去年评测国产模型写高考作文能力时,各模型问题不少,如用词重复、字数不足。今年再次测试7个国产模型,能力有指数级提升,文采惊人,扣题方面通义千问和文心一言表现出色。文末还有海外模型“翻车”彩蛋。

开源AI项目落地
产品应用8

3B激活参数!商汤绝影Sage登顶PinchBench,端侧第一

商汤绝影Sage端侧大模型在PinchBench评测中,以94%任务完成率超越Claude、GPT - 5.4等主流大模型。它激活参数仅3B,算力需求低,还具备多项实用场景能力,靠SCOUT和ERL两项自研技术提升性能。

新智元
开源动态8

1万亿参数Ling-1T开源,国产LLM牛了~

Ling-1T是Ling 2.0系列首款旗舰“非思维”模型,总参数量达1万亿。预训练数据超20万亿token,支持128K上下文长度。在多项任务中表现出色,是目前已知最大的FP8训练基座模型,已完成全面评测

PaperAgent
产品应用8

字节最强多模态模型登陆火山引擎!Seed1.5-VL靠20B激活参数狂揽38项SOTA

5月13日,火山引擎在上海发布5款模型和产品,其中豆包1.5・视觉深度思考模型(Seed1.5-VL)最吸睛。它激活参数20B,性能与Gemini2.5 Pro相当,38个评测基准达SOTA,推理成本低,已开放API。

机器之心
推荐文章8

腾讯老兵+大厂00后新锐,码上飞想做的不只是AI Coding

HDC 2026上华为展示鸿蒙新能力,背后技术服务由创业公司码上飞提供。码上飞核心团队多元,有大厂老兵与02后新锐。其技术积累丰富,开源项目多,还参与标准制定和前沿产研。

量子位
开源动态8

开源“裸考”真实世界,国产具身智能基座模型拿下全球第二!

国产具身智能基座模型WALL - OSS在RoboChallenge真机评测榜单获全球第二,多个单任务排第一。它是开源模型,开源程度彻底。还介绍其技术突破及团队情况,强调开源对具身智能发展意义重大。

量子位
产品应用7

千问AI Arena上线:给Agent一个真实的战场

8月12日,阿里千问AI平台上线‘千问AI Arena’,这是面向AI Agent的挑战与评测平台。它从真实业务产生任务,征集解决实际问题的Agent方案。首个任务聚焦跨境电商,有丰富奖励和评审机制。

阿里云开发者