「智能体评测」共找到 3944 篇相关文章
仅100种子题,合成数据质量超GPT-5,阿里、上交提出Socratic-Zero框架
阿里巴巴与上交大联合提出 Socratic-Zero 框架,仅从 100 个种子问题出发,通过三智能体协同进化生成高质量课程。该框架合成数据质量超 GPT - 5 等,Solver 性能提升显著,工程友好,开启零数据自进化新路径。
机器人连续叠衣120分钟!仅用0.9B参数实现五大SOTA|清华AIR & 上海AI Lab开源
清华大学智能产业研究院与上海人工智能实验室联合发布通用跨本体具身基座模型X-VLA。它是首个实现120min无辅助自主叠衣的全开源模型,仅0.9B参数量就在五大权威仿真基准刷新纪录。
百度:和大家一起讲 「超级有用」的故事
作者参加百度AI DAY智能云创新行业专场,看到百度全栈AI解决方案矩阵及应用案例。百度通过构建生态、全栈自研、推动科技平权等举措发力AI,诸多应用已取得商业成果,有望在AI商业化长跑中胜出。
智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开
上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。
2027年实现AGI?计算物理学家怒怼:纯属无稽之谈!
知名博主Scott Alexander领衔的项目称AI将在2027年达超人智能。但计算物理学家经研究指出,该预测模型漏洞百出,如数学错误、曲线选择无依据、图表与模型不符等,即便新模型改进部分问题,多数批判仍成立。
4000万样本炼出AI读心术,刷新七榜SOTA,最强「人类偏好感应器」开源
Skywork-Reward-V2全新发布,构建超高质量千万级人类偏好样本,刷新七大评测基准SOTA。8款模型覆盖6亿至80亿参数,小体积也能媲美大模型性能。团队引入多样大规模真实人类偏好数据,提升数据规模与质量。
首个转型AI公司的新势力,在全球AI顶会展示下一代自动驾驶模型
上周,小鹏 G7 亮相,首发自研芯片与 VLA - OL、VLM 模型。同时,小鹏在 CVPR 2025 分享研发进展。其世界基座模型展现高智能,还将结合世界模型迭代。此外,小鹏验证 Scaling Laws,转型 AI 公司,全链路优化技术。
如何通俗的读懂算力?
文章以拼图比赛作比,介绍了通用、科学、智能、AI专用这四种算力类型及其作用,指出摩尔定律失效下工程师探索创新提升算力。还阐述算力生态各环节,最后点明未来AI成算力市场核心引擎,中国算力发展亮眼。
谷歌开源移动端AI自动化测试神器
本文介绍谷歌最新开源的移动端AI自动化测试工具ARTEMIS,它可将自然语言指令转化为Android自动化操作,支持跨App测试、多模态定位,在AndroidWorld基准评测中取得99%+任务完成率,提供多场景使用方式,可一键快速上手。
最懂科学的开源基础大模型『书生-S2』发布:科学能力比肩顶尖闭源,通用性能居开源第一梯队
上海人工智能实验室在2026浦江创新论坛发布开源基础大模型书生-S2,该模型科学能力比肩顶尖闭源模型,通用能力居开源第一梯队,创新架构支持专业知识持续扩展,强化长程科研与智能体能力,可为真实科研任务提供支撑。