任务性能」共找到 3534 篇相关文章

算法论文8

重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析

上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。

AI科技评论
算法论文8

为什么给机器人装上昂贵的触觉传感器,反而让它变笨了?

伊利诺伊大学香槟分校等多校合作研究发现,当前机器人学习主流的多传感器融合算法(特征拼接)在处理任务时存在局限,给机器人加触觉数据会使抓取成功率暴跌。研究提出组合策略解决问题,经测试效果显著。

机器之心
新闻资讯8

国货之光!全球AI存储基准测试MLPerf Storage 3.0结果发布,斩获九项第一|甲子光年

9月1日,MLPerf Storage 3.0基准测试结果发布,XSKY星辰天合旗下MeshFS首次参赛,在并行文件存储赛道获九项第一。该测试覆盖多类负载,可多维度衡量存储系统性能,MeshFS兼顾性能与成本效率。

甲子光年
算法论文8

SIGIR 2025 | 解决扩展和迁移难题,华为新加坡提出InstructRAG,提升高达19%

大语言模型任务规划面临可扩展性和可迁移性挑战,华为新加坡团队提出 InstructRAG 方案,通过多智能体协同架构实现指令图扩展与少样本任务迁移,在多数据集测试中性能提升高达 19.2%。

机器之心
产品应用8

豆包专业版实测:2亿人都可以体验能干活的Agent了!

6月24日,豆包上线专业版,搭载首个Agent驱动的办公任务模式。实测显示其在办公场景交付质量对标Claude Opus 4.6。2亿日活用户可体验,免费用户功能升级,专业版满足复杂任务额度需求。

新智元
新闻资讯8

今夜无显卡!老黄引爆Rubin时代,6颗芯狂飙5倍算力

CES 2026上,英伟达黄仁勋发布Vera Rubin超算架构,推理性能比Blackwell提升5倍,训练性能提升3.5倍,成本降10倍,已投产,下半年商用。还展示自动驾驶模型等,且无新显卡发布。

新智元
产品应用8

一年磨一剑,今年最炸机器人Demo来了!1亿美元种子轮团队出手,单个模型解锁单手打蛋解魔方弹钢琴

Genesis AI发布机器人基础模型GENE - 26.5,让机器人可自主完成烹饪、实验室操作等复杂任务。该团队全栈自研,从硬件、数据、模型到训练评估都有独特方案,曾获1.05亿美元种子轮。

量子位
算法论文8

ICLR 2026|人大&通义:别再只会堆上下文了!IterResearch用40K上下文轻松实现2048轮交互不退化

中国人民大学与阿里巴巴通义实验室团队提出 IterResearch 迭代式深度研究范式。它能让 Agent 在 40K 上下文下完成 2048 次工具交互且性能不衰减,解决了传统范式上下文臃肿问题,论文已被 ICLR 2026 接收。

机器之心
算法论文8

大模型转行土木工程!首个「打灰人」评估基准:检验读、改工程图纸能力

首个工程自动化任务评估基准DrafterBench,可测试大模型在土木工程图纸修改任务中的表现。它模拟真实工程命令,考察模型四方面能力。评测发现主流大模型有一定能力,但未达工程一线要求。

新智元
开源动态8

小扎又开源了:7B实现自监督学习SOTA

Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。

量子位