大模型评测」共找到 9229 篇相关文章

算法论文8

从「记忆解题」到「深度推理」:港科推出首个本科数学动态评测基准 UGMathBench

港科团队发表在 ICLR 2025 的研究 UGMathBench,是首个本科数学动态评测体系。它涵盖 16 个学科领域,通过变量扰动创建多版本试题,引入创新指标评估模型推理能力,测试结果揭示了当前模型短板。

AI科技大本营
推荐文章7

为什么堆算力救不了模型

文章指出模型和人类脑归纳规律路径不同,AI追求精确但脆弱的拟合,人追求粗糙但不变的压缩。模型在可收敛系统表现惊艳,不可收敛系统则崩盘,未来AI产品核心是打造可收敛封闭环境。

AI科技评论
产品应用8

融合风控知识的模型体系建设与应用实践

腾讯算法专家欧阳天雄在AICon会分享《模型驱动下的智能风控落地实践》,介绍腾讯天御融合海量风控知识构建金融风控模型,解决传统风控模型难题,还展示构建技术、工程实践及落地案例,为金融风控提供新思路。

InfoQ
算法论文8

腾讯与中科院联合提出R-4B,一个能自动决定是否思考的多模态模型

多模态语言模型“始终思考”模式有缺陷,腾讯混元团队与中科院自动化所联合提出R - 4B,通过双模式退火训练和双模式策略优化实现自动思考,在多评测中达SoTA,省资源且效果好。

深度学习自然语言处理
产品应用8

文心新出的推理模型,给了我们信心

在 WAVE SUMMIT 2025 会上,百度发布文心模型 X1.1,是 X1 升级版,发布即上线可免费体验。它在事实性、指令遵循、智能体等能力显著提升,全方位测评表现出色,还开源新模型,展现百度全栈 AI 实力。

机器之心
算法论文8

DMLR 2026 | RPI Shaowu Pan(潘韶武)团队 Nithin Somasekharan等:CFDLLMBench——首个面向计算流体力学的语言模型综合基准评测

文章介绍针对CFD领域的综合LLM评测基准CFDLLMBench,构建三层递进挑战体系。实验揭示主流LLM在‘知道’与‘做到’间有差距,多智能体框架可提升成功率,代码与数据集已开源。

力学与人工智能
算法论文8

LeCun有了新证据!模型思考与人类思考存在本质差别

Yann LeCun参与的研究用信息论揭示语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流模型,发现AI与人类在‘理解’上有三核心差异,对当前AI发展趋势提出挑战。

AI工程化
新闻资讯8

火山引擎发布豆包模型1.6,加速Agent规模应用

6月11日,火山引擎举办Force原动力会,发布豆包模型1.6、视频生成模型Seedance 1.0 pro等,升级Agent开发平台。豆包1.6表现优异,应用广泛;Seedance 1.0 pro评测领先。还通过创新定价等推动Agent规模化应用。

AIGC开放社区
算法论文8

伯克利联手“拷问”模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估模型在动态交互中可靠性的问题。测试显示,顶尖模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
算法论文8

ACL 2025 | 指令遵循不能仅靠常识?GuideBench 揭示模型如何“踩雷”领域指南规则

这篇ACL 2025主会论文聚焦提升智能体指南规则遵循能力。提出评估基准GuideBench,涵盖7类1272个任务。实验显示多数主流模型指令遵循能力不佳,尤其数学推理挑战,为模型迭代提供评估基准。

深度学习自然语言处理