长任务时代」共找到 3501 篇相关文章

算法论文8

NeurIPS 2025 Spotlight | 让检索、推理真正「合体」的小而强模型,AceSearcher来了

近期,多所高校研究团队发布 AceSearcher 模型,它是让同一语言模型在推理时兼任双角色的合作式自博弈框架,以两阶段训练为骨架,将推理与检索结合,提升复杂检索任务效果,在多任务上表现出色。

机器之心
算法论文8

斯坦福7B智能体全面超越GPT-4o,推理流登顶HF

传统智能体系统难兼顾稳定性和学习能力,斯坦福等团队提出AgentFlow框架,通过模块化和实时强化学习优化策略,使7B参数模型在多任务上超越GPT - 4o等大模型,为AI发展提供新思路。

新智元
产品应用7

千问接入淘宝、闪购、飞猪,意味着什么?

2026 年初千问升级,上线任务助理并接入淘宝、闪购等。其能处理常见任务,但更重要的是可解决用户衣食住行等实际问题,虽目前部分场景待优化,但阿里有优势,不过千问也面临体验、协同和商业化挑战。

刘言飞语
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
产品应用7

打工人五一自救指南:把活全甩给AI,准备免打扰出门

五一将至,为避免假期工作内耗,可安装百度智能云打造的AI助手DuMate。它支持多模态理解与生成,能跨应用完成复杂任务。经测试,它可高效处理整理文件、生成报告等工作,还能并行处理多项任务

量子位
推荐文章8

Pokee.ai 朱哲清:用 RL 搭建智能体的「骨骼与神经」| AI 产品十人谈

《AI 产品十人谈》对话 Pokee.ai 朱哲清,探讨强化学习与 Agent。朱哲清是强化学习信徒,曾带领 Meta 团队突围。他认为单靠预测难完成复杂任务,强化学习是超人类智能的关键,介绍了 Pokee.ai 产品优势及对通用 Agent 的看法。

AI科技评论
新闻资讯8

新瓶旧酒or涅槃重生?操作系统的 AI 进化终将走向何方?

本文基于「AI 进化论:智算时代 OS 的破局之路」直播实录,解码 AI 时代 OS 破局之道。探讨国内外 OS 的 AI 进化差异、内核价值重构、技术跃迁、算力适配等,还提及未来趋势、Agent 生态挑战及 OS 进化关键。

InfoQ
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
算法论文8

Qwen团队发布上下文Reasoning模型QwenLong-L1,超越o3-mini

Qwen团队发布上下文Reasoning模型QwenLong - L1。当前大模型处理文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。

深度学习自然语言处理
产品应用7

OpenCode AI编程实践:利用推理路由低成本开发游戏

文章介绍用 OpenCode 结合 DigitalOcean 推理路由器开发点球大战游戏 PK Shootout。其按任务选模型,多数任务路由到 MiMo V2.5 和 GLM - 5.2,成本约 8.25 美元,远低于只用前沿模型。文中还分析开发各环节及适用场景。

AI工程化