双维度评估框架」共找到 2365 篇相关文章

开源动态8

NeurIPS 2025 | 中科大、港中深、通义千问联合发布CoRT:仅30个样本教会大模型高效推理,token消耗降低50%

大型推理模型在精确数学计算上存在问题,如认知冲突、行为低效、数据稀缺。中科大、港中深、通义千问联合推出CoRT框架,用创新数据合成与多阶段训练,提升模型推理能力和效率,成果已开源。

机器之心
算法论文8

上海AI Lab提出CANON:让RLVR自主识别优质推理模式

上海AI Lab与上海交大团队提出创新框架CANON,解决将人类先验知识融入RLVR训练的难题。它通过条件分组与对比机制,自适应放大有益指标变化趋势,在数学和逻辑推理任务上成果卓越,还能提升推理效率。

深度学习自然语言处理
算法论文8

AI里最大的Bug,却也是人类文明最伟大的起点。

OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。

数字生命卡兹克
新闻资讯7

金融智能体真的是大模型落地“最后一公里”?

InfoQ《极客有约》X AICon 直播栏目邀请业内人士探讨金融 AI 大模型实践现状。指出大小模型融合是主要方案,智能体有应用但也有问题。还分享了评估 AI 项目的要点、智能体应用案例及未来布局方向。

InfoQ
产品应用8

长文本推理 5 倍提速!面壁MiniCPM4 端侧模型发布,0.5B模型效果秒杀同级

近日,面壁发布 MiniCPM4.0 端侧模型,有 8B、0.5B 两种规模。其在基准测试表现出色,长文本推理提速,缓存锐减,还做了架构创新。此外,面壁有自研推理框架,科学化建模产线,6 月 27 - 28 日 AICon 北京站将探讨 AI 趋势。

AI前线
算法论文8

告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍

视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。

机器之心
产品应用8

CES深思考:没做人形机器人的石头,如何抢占家庭具身智能第一入口?|甲子光年

2026年CES上,石头科技推出全球首款能扫楼梯的轮足扫地机器人G - Rover,它重新定义空间维度,可在台阶稳定作业。石头科技以场景需求定义形态,研发围绕用户需求,在全球市场表现出色。

甲子光年
新闻资讯7

烧钱,能解决 AI 存储的焦虑吗?

存储短缺焦虑或延续至 2026 年,传统云存储因 AI 落地面临性能、成本等压力。InfoQ 联合腾讯云邀行业人士探讨成因、策略与竞争主线,还给出存储价值评估与规划方法,介绍文远知行和腾讯云实践。

InfoQ
开源动态8

RLinf上新πRL:在线强化学习微调π0和π0.5

近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。

机器之心
推荐文章7

深度讨论 Online Learning :99 条思考读懂 LLM 下一个核心范式|Best Ideas

文章围绕Online Learning展开深度讨论,指出其或为LLM下一个核心范式。探讨了它是通往更高层次智能的关键路径,分析概念定义、非共识,还阐述做好它的方法,以及架构、算力和评估范式等问题。

海外独角兽