大模型裁判」共找到 9156 篇相关文章

算法论文8

NeurIPS 2025|CAKE:模型驱动的贝叶斯优化新配方,让黑箱优化更智能、更高效

香港中文学(深圳)等高校研究人员提出 CAKE 方法,被 NeurIPS 2025 接收。它利用语言模型动态设计高斯过程核函数,构建自适应贝叶斯优化框架,在多领域实验中效果优,还具备可解释性。

机器之心
产品应用8

破解300年数学难题,智能体突破!谷歌发布超强AI Agent

今天凌晨谷歌Deepmind发布编程AI Agent——AlphaEvolve,它与Gemini深度集成,能评估算法。它解决了300多年的数学难题,还提出新算法,提升模型计算效率,可优化GPU指令,架构含多模块。

AIGC开放社区
算法论文7

中移动九天团队MultiPL-MoE:全新Hybrid-MoE架构用于增强通用模型低资源代码能力

语言模型在有限计算资源下提升多语言代码能力面临挑战。中国移动九天团队提出 Hybrid MoE 架构 MultiPL - MoE,耦合两层专家选择机制优化,实验证明其在增强低资源代码能力、缓解高资源语言遗忘上有效。

机器之心
新闻资讯7

Meta亿元天团首个模型交卷!余家辉宋飏Jason Wei耗时九个月,一雪Llama前耻

Meta超级智能实验室耗时9个月推出原生多模态模型Muse Spark,发布后股价拉升。它让Meta在第三方测评中赶上第一梯队,虽在编程和长时间自主运行有差距,但在多模态理解等方面表现突出,不过也有编程翻车情况。

量子位
新闻资讯8

国产AI高考708分,这款模型靠什么成为「屏蔽生」?

高考放榜,媒体对国内外模型进行测试。综合成绩上,讯飞星火X2物理、历史类表现优异;单科专项中,它在数学、作文等测试也领先。其优势源于数据积累、理解评判标准,还采取软硬件一体化落地路径。

机器之心
开源动态8

腾讯开源三具身基座模型,首席科学家张正友详解“三层脑”如何破解机器人反应慢

WAIC 2026 期间,腾讯开源三款具身基座模型。首席科学家张正友称此前用 OpenClaW 调度机器人效果差,后设计 TairosAgent 框架。腾讯将具身智能拆成三层,配合具身智能体和框架构成完整矩阵,还解决语言信息不足等问题,并在工业和养老场景测试。

InfoQ
新闻资讯7

人民想念DeepSeek

文章探讨AI时代Token相关问题。指出其消耗、价格贵,存储价格上涨使Token降价缺杠杆,虽模型能力提升、MFU优化可降本,但传导到C端取决于商业考量。还回顾模型价格战,介绍本地部署及芯片创新方案。

芯师爷
产品应用7

10万智能体同场模拟,YuLan-OneSim带来真正的社会实验

YuLan-OneSim是语言模型驱动的社会模拟器,能模拟人类社会行为。它可零代码构建场景,有50个默认场景,具分布式架构,支持10万智能体同场模拟,还推出AI社会研究员,自动完成社会科学研究流程。

带你学AI
开源动态8

迈向AI4S 2.0,上海AI实验室开源书生万亿科学模型Intern-S1-Pro

2月4日上海人工智能实验室开源万亿参数科学多模态模型Intern - S1 - Pro,为AI4S迈向2.0提供开源基座。其核心科学能力跃升,底层架构创新,科学与通用能力协同发展,还构建了‘算力 - 算法’一体化基座,推动科研范式革命。

OpenMMLab
算法论文8

没想到,又一个Code Agents瓶颈,被美团&上交彻底撕开了~

AI写代码能力提升,但打分方法僵化且成本高。上交与美团论文提出新基准PRDBench,让AI出题人审核,还训练裁判PRDJudge,提升打分准确率与稳定性,促使AI学会‘看懂需求’。

PaperAgent