免真值评估」共找到 811 篇相关文章

算法论文8

RL救不了泛化性!揭示LLM数学Reasoning的深层瓶颈

大型语言模型在数学竞赛级任务依赖机械化推理,现有评测集有缺陷。UC Berkeley团队提出OMEGA基准量化其数学泛化能力,实验揭示复杂度引发性能崩塌等问题,指出LLM创新组合难,给出改进方向。

深度学习自然语言处理
推荐文章8

直播预约 | Evaluation论文分享@ICML&ACL2025

2025年6月11日20:00将直播分享Evaluation论文。多位嘉宾参与,涉及SyncPL奖励建模、文本事实一致性验证、大模型评测方法等多领域论文,涵盖模型优化、基准测试等内容。

深度学习自然语言处理
新闻资讯8

AI时代UI已死?Karpathy称产品要给AI开后门,还分享了自己的AI编程心法

Andrej Karpathy指出,只有复杂UI、无脚本支持、基于不透明二进制格式的软件产品,在AI时代会被淘汰。他给出风险评估清单,还分享AI编程心法,探讨编程中‘验证鸿沟’问题。

AGI Hunt
开源动态7

卷疯了!2.2k Star通用型、开源Agent平替Manus、GenSpark AI

2025 年是 Agent 之年,文中介绍了 Manus、GenSpark AI 两款闭源代理,还重点阐述开源的 II - Agent,它功能丰富,架构设计合理,在 GAIA 基准测试评估,性能可平替前两者。

CourseAI
算法论文8

建模世界偏好:偏好建模中的Scaling Laws

研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。

通义千问Qwen
新闻资讯7

让GPT-4.1「头皮发麻的考试」!OpenAI给大模型上强度,AI能赢吗?

OpenAI 公布 MRCR 评测标准数据集,其针对 AI 模型上下文能力进行「奥运会」级别测评。MRCR 提升了测试难度,能揭示 AI 能力边界,推动模型发展,帮助更合理应用技术。GPT4.1 在一些测试中表现出色,未来 AI 能力上限充满可能。

新智元
新闻资讯8

25位IT大佬亲述:AI「吃掉」程序员!码农黄金时代终结

AI Impact Lab创始人探讨AI对技术岗位影响,提到AI公司熟悉技术岗、指标清晰等原因或致其先受冲击,调研显示AI未改变多数岗位但影响初级岗位招聘、模糊岗位边界,还对未来技术就业市场做了预测。

新智元
算法论文8

让代码接管世界演化,西湖大学发布Code视频世界模型

西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。

机器之心
新闻资讯7

OpenAI解散「灾难风险应急」团队!GPU大神Scott Gray也跑路了

OpenAI解散「Preparedness」团队,该团队负责评估自家AI灾难级社会风险。官方称安全工作已融入开发流程。此前多个安全团队也已解散,多名安全高管离职,引发员工不安。

量子位
推荐文章8

翁荔新博客提出「自进化先从Harness开始」,DeepSeek崔添翼转发附议

前OpenAI安全副总裁翁荔新博客探讨AI自进化,提出从Harness开始的现实路径。DeepSeek崔添翼转发附议,认为Harness方向自进化很可能出成果。翁荔梳理研究,展示优化递进趋势,也指出实现递归自我改进存在的瓶颈。

量子位