「长时任务」共找到 2896 篇相关文章
AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒
清华大学等联合研发的 AgentCPM-Explore 智能体模型,基于 4B 参数在深度探索类任务表现出色,有打破参数壁垒等亮点,还全流程开源,解决小模型性能提升挑战,邀伙伴共建端侧智能体生态。
LangChain 推出开源异步编码智能体 Open SWE
LangChain发布开源异步编码智能体Open SWE,可在云端处理复杂开发任务,能集成到开发者工作流。它连接GitHub仓库,在沙箱运行,强调人在回路控制,多智能体架构保障代码质量,早期反应褒贬不一。
重新审视SFT的泛化能力:优化动态、数据与模型能力的条件性分析
上海人工智能实验室等联合研究质疑了‘SFT倾向于记忆,RL实现泛化’观点,指出SFT泛化是条件性现象,受优化动态、训练数据、基模型能力影响,还揭示长思维链SFT会带来安全性能退化。
小米陈龙团队首作:统一具身与自动驾驶的开源模型
小米具身智能团队发布首篇论文,提出统一具身智能与自动驾驶的新模型MiMo-Embodied。该模型在多任务中领先,其四阶段训练框架打通两领域边界,为行业提供新范式。
2M大小模型定义表格理解极限,清华大学崔鹏团队开源LimiX-2M
大语言模型在结构化表格数据处理上表现不佳,清华大学崔鹏团队开源的 LimiX-2M 模型,仅 2M 参数,却能同时支持分类、回归等任务,性能超越经典模型,且训练、运行成本低,科研友好。
1.58bit不输FP16!微软推出全新模型蒸馏框架,作者全是华人
微软推出蒸馏框架BitNet Distillation,实现几乎无性能损失的模型量化。它含三阶段,经实验在多下游任务表现近全精度模型,降内存开销、提推理速度,作者全是微软研究院华人。
The Batch: 876 | Gemini 的环境影响测算
谷歌研究人员对驱动 Gemini AI 助手的模型进行一年研究,发现处理一个提示的环境影响小。其能耗、水耗和温室气体排放量远低于此前估算,2024 - 2025 年处理中位提示时能耗、排放大幅降低。
GAN之父Ian Goodfellow病后归来,剑指高效世界模型
GAN之父Ian Goodfellow等提出,利用符号化表示和游戏虚拟世界数据,或为构建动作条件多模态世界模型最佳路径,该模型可支持长时序任务预测与规划,还探讨构建原因、数据来源等。
10B超越Gemini-2.5-Pro!阶跃星辰端侧多模态天花板开源
阶跃星辰多模态智能团队开源STEP3-VL-10B多模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在多任务上表现出色,为小模型发展提供新思路。
X爆火Overleaf科研辅助神奇PaperDebugger
当下学术写作借助大语言模型辅助时,流程繁琐且上下文易丢失。新加坡国立大学团队推出的 PaperDebugger 是基于插件的多智能体系统,寄生在 Overleaf 编辑器内,可完成多任务,解决现有工具不足。