长任务跑分」共找到 2651 篇相关文章

算法论文8

手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里

中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。

量子位
算法论文8

CVPR 2026 Oral|告别模型合并冲突!南大等提出OrthoReg:极简正交正则化,揭开任务算术的底层机制

南京大学等团队为任务算术建立底层理论框架,提出「任务特征特化」属性,推导出几何约束方法OrthoReg。该方法引入极简正交正则化项,提升模型合并性能,论文被CVPR 2026接收并评为Oral,代码等已开源。

机器之心
算法论文8

破解在线时序重建难题!纯视觉、单卡实时的公里级流式3D重建|CVPR'26

在自动驾驶等领域,序列3D重建落地难,存在精度退化等问题。即将到来的CVPR 2026中,LongStream模型开源,它重新设计,解决了序列难题,在多基准测试表现强,推动3D视觉走向在线建模。

量子位
产品应用8

全球首创!B站推出影视级TTS语音模型,支持零样本语音+情绪双克隆,精准时控制!

近日,B站语音团队推出全新一代语音合成模型IndexTTS2,提供影视级音质、情绪克隆和时控制。其情绪与时精细控制功能全球首创,还具备零样本语音克隆等能力,支持本地运行与中英文双语。

开源星探
产品应用8

离谱!现在的Agent都卷成100个成团了?3分钟并行干完5个复杂任务,还能随时改需求

百度文库、百度网盘联合发布全球首个全端通用Agent——GenFlow2.0,能让100+AI专家Agent天团并行工作,3分钟交付5、6个复杂任务,还能随时改需求。它依托权威资料,可控性强,多任务并行,已上线百度文库Web端/APP。

量子位
产品应用8

中文版Nano Banana来了?Qwen-Image-2.0炸场:1K文本硬吃,中文生图彻底不拧巴了

AI生图曾有文本易糊、指令复杂就出错、中文渲染差等问题。阿里新发布的Qwen-Image-2.0能处理1K token文本,理解复杂指令,中文渲染佳,还能多图编辑,国际评测表现也靠前,阿里云百炼已开通API邀测。

量子位
新闻资讯8

机器人界的「Imagenet 时刻」,李飞飞团队官宣全球顶级具身智能挑战赛

李飞飞团队与斯坦福AI实验室官宣首届BEHAVIOR挑战赛将登陆NeurIPS 2025。这是具身智能“超级benchmark”,涵盖1000个日常任务,以50个时段任务为核心赛题,还是全面的具身智能研究资源。

机器之心
开源动态8

AI记忆革命爆发!Clawdbot如何像大脑般记住一切

2026年初开源个人AI助手Clawdbot引爆社区。它可本地运行、集成聊天平台、自主处理任务,有时记忆和任务执行能力。AI研究工程师Manthan Gupta复盘其记忆机制原理,涉及上下文、记忆存储、搜索等内容。

新智元
算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视上下文建模难题

文章指出上下文模型处理文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
产品应用7

不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案

作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,文本处理不如 Gemini,硬实力也不如 Claude。

歸藏的AI工具箱