独立测评」共找到 344 篇相关文章

算法论文8

4B模型幻觉抑制能力超越GPT-5,CMU等提出行为校准强化学习新方法

大语言模型幻觉问题是部署难题,CMU等研究人员提出行为校准强化学习新方法,重新设计奖励函数。经训练,40亿参数模型幻觉抑制力超GPT - 5,实验证明该方法效果显著,还带来理论洞察。

机器之心
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论
推荐文章7

SubAgent 与 Skills:AI Agent 的两种扩展方式

文章介绍了 AI Agent 的两种扩展方式:Skills 是“操作手册”,让 Agent 按需获取知识;SubAgent 是独立“专家助手”,有自己的上下文窗口。还通过给文章配图案例对比两者差异,并给出使用建议。

宝玉AI
算法论文8

腾讯混元数字人团队发布Moral RolePlay基准,揭秘大模型的「道德困境」

腾讯混元数字人团队和中山大学推出「Moral RolePlay」测评基准,评估大模型扮演多元道德角色能力,揭示顶尖AI模型演不好反派,暴露模型理解社会心理复杂性的局限,还给出未来对齐技术方向。

机器之心
新闻资讯7

OpenAI 将推出群聊功能,终于要对 Slack 下手了

据爆料,ChatGPT 网页版将推出群聊功能预览版。群聊可通过链接分享,新成员能看历史记录,自定义指令独立,还有表情反应等交互功能。OpenAI 或借此获取对话数据,有取代 Slack 之意。

AGI Hunt
算法论文7

视频模型假装在推理?MME-CoF新基准评估12个推理维度

视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。

新智元
算法论文8

230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷

ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。

量子位
产品应用7

炸裂黑科技,脑波沟通来了!AlterEgo让你在大脑中发声

AlterEgo是一种非侵入式、可穿戴的外围神经接口,能让人用自然语言与机器等交流,无需发声。它始于2018年MIT媒体实验室,2025年初独立运营,可用于帮助语言障碍者,还能融入日常生活。

带你学AI
新闻资讯8

00后以1.1亿美金「掀桌」,硅谷AI将书写影视新传奇 终结制片旧时代

00后Cecilia Shen创立的Cybever转型为AI原生影视工作室Utopai Studios,首年获1.1亿美元收入。其技术经四个阶段进步,能生成高质量3D虚拟环境,还带来两部大剧,有望改变影视行业格局。

机器之心
产品应用7

竞购 Chrome,正面竞争 OpenAI,Perplexity 为什么要做 AI 浏览器?

今年 Perplexity 推出 AI 原生浏览器 Comet,OpenAI 也计划发布浏览器,Perplexity 还出价 345 亿美元收购 Chrome。文章梳理了 Perplexity CEO 观点及 a16z 测评,介绍 Comet 特点、目标、优势,还对比了 Comet 与 Dia。

海外独角兽