自主智能测试」共找到 5084 篇相关文章

推荐文章7

烧了1万块横测,你用的模型可能掉队了

作者花大成本从后端、人味、前端、推理等维度,对glm 5.2、kimi k3等国产模型进行测试,展示各模型在不同测试中的结果,指出国模2T俱乐部的kimi和qwen下限高,且刻板印象需改变。

探索AGI
产品应用7

DeepSeek识图模式全量上线,却认不出自家老板梁文锋

端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。

机器之心
算法论文8

2026,一篇不错的高效Agents技术全面综述

上海AI Lab等9所高校联合发表《迈向高效智能体(Agents):记忆、工具学习与规划综述》。文章介绍了高效智能体概念,分析其效率危机,阐述提升效率的三大战略方向,涵盖多种记忆、工具学习和规划方法。

PaperAgent
推荐文章8

Computer Use:莫拉维克悖论

2025年AI在数学证明等“高阶智能”任务表现佳,在“像人类一样使用电脑”任务却受挫,再现莫拉维克悖论。文章分析计算机使用智能体是实现AGI机会与挑战,指出发展难题、探讨RL作用并给出研究方向。

深度学习自然语言处理
新闻资讯7

大模型IMO25数学竞赛成绩公布了

大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。

量子位
新闻资讯8

资本视角下的智造落地战:五位投资人划定关键赛道与投资红线|甲子引力X

在「2025甲子引力X中国科技产业投资大会」上,五位投资人共议智能制造。他们认为当前制造业面临降本增效等挑战,投资时“团队”是关键,中国智能制造在多领域有成长空间,创业者要内修能力、外抓需求。

甲子光年
开源动态8

一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成

新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。

AIGC开放社区
算法论文8

谷歌助力神经科学飞跃,破解斑马鱼全脑活动密码

谷歌等机构科学家联合发布开创性研究成果ZAPBench,这是预测斑马鱼全脑活动的基准测试平台。它含超70000个神经元4D光片显微镜记录,设计多种刺激条件采集数据,有特定基准测试任务和评估指标。

AIGC开放社区
新闻资讯8

突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达

OpenAI公布自研推理芯片Jalapeño(墨西哥辣椒)测试结果,它专为大语言模型推理设计,能同时提升吞吐量和降低延迟,在多模型测试中超NVIDIA系统。该芯片与Cerebras合作,计划2026年底部署。

机器之心
开源动态8

开源模型首次物理奥赛IPhO夺金!上海AI Lab 235B模型击败GPT-5和Grok-4

上海AI Lab的P1 - 235B - A22B在国际物理奥林匹克竞赛夺金,在HiPhO基准测试获12金1银,超越GPT - 5等闭源模型。团队构建HiPhO基准测试,用多阶段强化学习训练模型,开发PhysicsMinions系统提升推理能力。

量子位