评测维度」共找到 797 篇相关文章

开源动态8

大模型结构化推理优势难复制到垂直领域!最新法律AI评估标准来了,抱抱脸评测集趋势第一

多个机构研究人员联合发布全新多语言法律推理基准数据集LEXam,它含4886道题,每道长篇题有答案和推理路径。研究显示现有大模型应对法律推理难,LEXam引入评估新模式,还对不同模型做了测试。

量子位
新闻资讯7

今年最火的AI产品,不止龙虾|榜单申报中

量子位开展2026年度值得关注的AIGC企业和产品评选,参选有对应条件和评选维度。报名4月27日截止,结果5月中国AIGC产业峰会公布。峰会将聚焦‘如何用好AI’。

量子位
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业与产品,结合调研和专家意见,结果5月峰会公布。参选有条件和评选维度,报名4月27日截止。

量子位
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品,结合调研与专家意见,结果5月峰会公布。参选有条件和维度,报名4月27日截止。

量子位
新闻资讯7

一年一度最值得关注的AI榜单来啦!申报即日启动

时值第四届中国AIGC产业峰会,量子位将评选2026年度值得关注的AIGC企业和产品,结合调研与专家意见,结果5月峰会公布。介绍了参选条件、评选维度,报名4月27日截止。

量子位
新闻资讯7

Anthropic 发文称自家 Claude 已经开智,网友:为了上市,不择手段?

Anthropic发布Claude内部机制新研究,介绍J-space和J-lens,称可读取模型未输出的内部概念。此研究在训练、评测和部署有潜在价值,但叙事引发争议,网友质疑是否过度包装。

AI科技评论
算法论文8

ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」

现有第一人称视频助手难以自主判断何时介入服务用户。大连理工大学等团队提出Vinci2,含评测基准EgoServe和智能体EgoMemo。它已被ECCV 2026接收,代码和标注均开源。

机器之心
产品应用8

刚刚,Thinking Machines出手!首款交互模型来了,翁荔出镜实测

Thinking Machines Lab推出首个大模型TML - Interaction - Small,打破传统人机交互模式,实现全自然交互。它训练范式独特,采用双模型架构等设计,评测表现超GPT - Realtime 2.0等模型,后续还会推出更大尺寸模型。

机器之心
产品应用8

π0引用的中国团队,又出手了:世界仿真器新作发布

Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。

量子位
新闻资讯7

刚刚,Anthropic 又出新货:Claude Opus 4.1 发布,代码、推理能力再升级

Anthropic发布Claude Opus 4.1,是对Opus 4的小升级,提升智能体任务、代码处理和推理能力。付费Claude用户等已可用,价格不变。在编程评测表现佳,获多方好评,官方建议升级。

AI进修生