任务交付」共找到 2133 篇相关文章

新闻资讯7

撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍

J - Space Cognition Suite社区项目在X上传播,称不修改DeepSeek V4 - Pro模型权重,用推理时Harness能提升其在多项Agent Benchmark表现,超Fable 5,但未第三方复现,且Token开销可能翻倍。

InfoQ
算法论文8

Auto-Research「终极大考」:新基准撕下大模型科研伪装

来自多所高校的研究者提出MLS - Bench,用于解决现有Auto - Research评测的归因问题。它含140个真实研究任务,校准受控修改范围,主实验显示当前模型在方法发现上有明显缺口,Auto - Research需更严格评测标准。

机器之心
8

浙大开源HugAgentOS:三引擎一体自进化,每步可归因/回放/回滚

过去一年,Agent任务执行能力提升,但不会自主积累与进化。浙大开源的HugAgentOS把Harness拆成三个可自我成长的引擎,设归因和本体两道关卡,解决经验成能力等问题,还覆盖智能体完整链路。

新智元
推荐文章7

自构建智能体:一项 LangChain4j 实验

作者将LangChain4j文档交代码助手,让其参照构建智能体,设计多智能体系统编写、测试和调试代码。实验展示了LangChain4j优势,还对比监督者和工作流两种智能体实现模式,揭示速度与自主性权衡关系。

InfoQ
推荐文章7

当 Token 成为商品,AI 基础设施会怎么变化?

在大模型时代,智能生产和交付未实现工业化,存在性能鸿沟。九章云极提出AI工厂战略,发布Alaya NeW Cloud 3.0,将从资源计量转向智能计量,打造训练和Token工厂,提升算力到有效Token的转化效率。

InfoQ
推荐文章7

为什么堆算力救不了大模型

文章指出大模型和人类大脑归纳规律路径不同,AI追求精确但脆弱的拟合,人追求粗糙但不变的压缩。大模型在可收敛系统表现惊艳,不可收敛系统则崩盘,未来AI产品核心是打造可收敛封闭环境。

AI科技评论
产品应用8

阿里Qwen 3.7 Max:35小时自主编程,Claude跟不上了?

阿里云峰会发布的Qwen 3.7 Max,在优化平头哥芯片推理内核任务中,35小时让推理速度快10倍。它在多基准表现出色,编程、推理、办公自动化全面开花,但闭源且实验室场景与现实有差距。

CourseAI
新闻资讯7

Qwen最新3.7 Max预览版空降!两代超大杯并行迭代,林俊旸走了但还在加速

Arena公布Qwen3.7-Max-Preview和Qwen3.7-Plus-Preview成绩,文本和视觉领域均为国产第一。Qwen3及以后迭代提速,大版本间隔缩至2-3个月,反映阿里Qwen团队进入快速实验、高频交付阶段。

量子位
新闻资讯7

微软AI CEO:倒计时18个月,AI将接管这些美国白领

微软AI CEO苏莱曼称未来12 - 18个月,诸多白领工作将被AI自动化。微软启动大规模自愿退休买断计划,虽未提AI,但各项动作都指向它。不过,现实中AI对岗位的替代情况复杂,也创造了新岗位。

新智元
算法论文8

ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量

现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。

机器之心