「任务交付引擎」共找到 2412 篇相关文章
The Batch: 948 | GLM 5.1:面向长时任务的能力提升
Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能体任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。
ACL 2025杰出论文!用能力显著向量让大模型下游任务性能预测更精准
上海人工智能实验室与复旦大学联合研究成果《Capability Salience Vector》获ACL 2025杰出论文奖。提出能力显著向量(CSV)解决验证损失与下游任务能力脱节问题,实验验证其提升了下游任务表现可预测性。
机器人需要一个「思考系统」:τ0-VLA让具身智能迈向长程任务时代
2026 WAIC落幕,具身智能成焦点。当前VLA模型在长程任务中有局限,上海创智学院和智元机器人联合发布τ(0)-VLA,提出分层架构和新推理机制,用大量真机数据训练,在长程任务表现出色。
Harness Engineering 实践:Fitness Function 如何成为 AI 交付的防腐层
文章探讨 Harness Engineering 实践中,Fitness Function 如何成为 AI 交付防腐层。指出在 AI Agent 参与开发时,判断任务完成是难题,介绍 Routa 项目构建 Fitness 架构及规则执行等实践。
为什么「高价值任务」成了所有 AI Labs 的T0 级战略?| 拾象 AGI 备忘录
过去一季度模型进步显著,头部 AI labs 战略对齐,将 coding 列为 T0 级战略,争抢高价值任务。文中还探讨了 AI 对企业 SaaS 的冲击、ToC/ToB 二分法的过时、硬件挑战及高价值任务的二八结构等问题。
Seedance 2.0刷屏后,字节还有个硬核模型——3个复杂任务实测Seed 2.0
作者作为AI编程工具深度用户,没追热门的Seedance 2.0,而是实测同期发布的豆包大模型Seed 2.0。设计3个日常复杂任务,在TRAE接入其Pro版测试,展现出强大的自主纠错和多任务处理能力,也指出了不足。
Anthropic最新经济指数:AI让高学历任务提速12倍,但也可能让你的工作“降级”
Anthropic通过‘经济指数’项目,对Claude.ai和其API对话分析。最新报告引入‘经济基元’,基于2025年11月样本分析,揭示AI对任务、职业和总体影响,如让高学历任务提速12倍,也可能致岗位‘技能降级’。
拖拽式搭建分布式Agent工作流!Maze让非技术人员几分钟搞定复杂任务
大模型智能体落地有诸多问题,Maze分布式智能体工作流框架可提供一站式解决方案。它是集成分布式执行引擎的全能平台,有四大核心优势,还有可视化工具让非技术人员也能轻松搭建工作流。
知识增强LLM与搜索引擎用户的感知信息价值差异比较研究
研究选取文心一言与百度搜索引擎,探究不同任务复杂性、信息获取场景下,用户使用两种工具后的感知信息价值差异。发现两者在部分指标有显著差异,还给出两类工具优化建议。
当 Agent 开始接管工作流,企业最在意的三件事:安全运行、稳定交付、持续进化
Agentic AI 开发落地使基础设施问题凸显。AI 产业转向重视模型部署等,CPU 受关注,云计算角色转变,容器重要性凸显。Agent 应用规模化落地,AI 负载变化,Agent Infra 要解决四个问题,云和 CPU 任务也在改变。