「复杂任务控制」共找到 2890 篇相关文章
Claude Fable 5.1 发布:缓存读降价 75%,但实际更贵了
Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1。Fable 5.1 性能全面上涨,但出现价格悖论,缓存读降价 75% 实际更贵。在 Agent 类任务与 Opus 5 基本持平,推出 EFS 应对数据留存争议,还有多项科研演示。
英伟达笑到最后!训练2000步,1.5B逆袭7B巨兽,Scaling真来了
英伟达团队提出ProRL训练法,将强化学习扩展到超2000步。用此方法训练的15亿参数模型媲美70亿参数的Deepseek - R1 - 7B,在多任务中表现出色,解决了熵崩溃和训练不稳定问题。
推理能力再突破!蚂蚁 | 提出Agentic Deep Research新范式,可信度同步增加
尽管LLM能力提升,但复杂任务表现受静态知识限制。业界提出Agentic Deep Research系统,现存系统训练有梯度冲突和奖励稀疏问题。蚂蚁团队提出Atom - Searcher,创新推理范式,构建细粒度奖励,结合奖励训练,实验效果佳。
MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀
MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。
AI Agent 距离真正替人「全自动办公」,还有多远?
Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大模型表现糟糕,智能体存在长周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。
抗干扰能力提升近40% !无需对抗训练,北航上海AI Lab新蒸馏方法提升模型鲁棒性 | ICML 2025
在人工智能模型规模持续扩大的今天,数据集蒸馏方法能提升训练效率、降低成本,但蒸馏模型在安全性要求高的任务中抗干扰难。北航上海AI Lab团队提出ROME方法,无需对抗训练,显著提升模型鲁棒性,成果被ICML 2025接收且已开源。
李飞飞、Jim Fan和徐丹飞联合重磅论文:机器人灵巧手,可能走错了路
李飞飞等学者联合发表论文,分析当前触觉融合方案缺陷,提出 T - Rex 架构。它改变触觉输入方式,使用新编码方法和数据集,经三阶段训练,在 12 项任务评测中平均领先 30 个百分点,也指出了局限与未来方向。
多 AI 协同 + SDD 编程实践:一个 AI 全流程交付实录
2025 年以来 AI Coding 技术发展迅速,但在复杂业务场景中存在诸多问题。文章基于 SDD 范式,构建由 Claude Code、CodeX 与 Gemini 协同驱动的工作流,介绍 SDD 理念、技术选型,详述多模型协作机制、工作流程与保障机制,分享实践步骤。
为什么我用了那么多提示词模板甚至用了 AI 帮忙还是写不好提示词?
现在很多人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整。
NIPS 2025 Spotlight | 港大提出TreeSynth方法,一句话生成百万规模数据集
港大团队提出TreeSynth方法,受决策树启发,将数据合成问题映射到其空间分割机制。它采用两阶段流程,能从零合成数据,还可优化现有数据集。实验显示其在多基准任务上性能提升显著,可扩展性佳。