评测机制」共找到 1466 篇相关文章

开源动态8

高智商 ≠ 高财商?50天实盘测试:LMArena 高分王者也可能是「韭菜」

伊利诺伊大学厄巴纳 - 香槟分校团队开发 LiveTradeBench,让大模型在真实金融市场交易,检验其能力。它全面开源,有实时数据、组合决策等创新,50 天实测揭示模型财商差距。

机器之心
新闻资讯7

突发,普林斯顿CS博士后猝然离世!清华本科毕业,刚完成论文答辩

普林斯顿大学电气与计算机工程系博士后Haoran Li于9月25日离世,校方强调心理与牧灵支持。科研群体光环背后是高压力与孤独,海外高校有相关支持举措,国内则需完善机制

新智元
算法论文7

一半人明天不上班,GDP不会掉一点!耶鲁大学揭AGI残酷真相

耶鲁学者Restrepo论文指出,AGI时代经济因算力扩张狂飙,但普通人工资被「算力成本」锁死,与增长脱钩。劳动在GDP占比将归零,财富流向算力资本,人类或被边缘化到附属岗位。

新智元
开源动态8

全流程国产GPU,上下文提速100倍!中国科学院发布「线性复杂度」类脑大模型

中国科学院自动化所李国齐、徐波团队发布国产自主可控类脑脉冲大模型SpikingBrain-1.0,训练推理全用国产GPU。它具线性复杂度,超长序列处理速度快,还开源7B模型,为类脑智能发展提供新思路。

新智元
开源动态8

JinaVDR: 一个图文混排文档搜索任务的基准集

现有文档检索基准大多只考虑纯文本,难以处理含图表等视觉信息的文档。JinaVDR 应运而生,它是图文混排文档搜索基准集,含多语言、多领域数据,可评估模型在复杂视觉文档的检索性能。

Jina AI
算法论文8

数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法

天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。

新智元
算法论文8

普林斯顿发现RLHF显著加剧了LLM胡扯!

普林斯顿研究提出‘机器胡扯’概念,构建分析框架,含胡扯指数、行为分类法和评测集。实验揭示RLHF加剧胡扯,政治语境模型爱‘打太极’,为构建诚实AI提供工具和理论。

深度学习自然语言处理
推荐文章8

OpenAI: 构建 AI 智能体实用指南

OpenAI发布的《构建AI智能体实用指南》,阐述智能体定义、适用场景,介绍构建的核心组件、架构编排,强调安全保障,指出构建需多方要素配合,未来聚焦智能体生态系统。

宝玉AI
算法论文8

首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升

西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。

量子位
产品应用8

证明也有「选择困难症」?腾讯AI Lab与大模型研究部联手打造 MPS-Prover ,多视角破解形式化推理瓶颈!

本文聚焦逐步式自动化定理证明器困境,腾讯AI Lab等提出MPS - Prover。它有数据筛选和多视角树搜索两项创新,提升搜索效率和证明质量,在多基准表现佳,还解决六道IMO难题。

AI科技评论