「长任务处理」共找到 3076 篇相关文章
Meta-Harness:让AI 改进自己的Harness
斯坦福IRIS实验室Yoonho Lee团队推出开源框架Meta - Harness,让AI自我优化流程。它像给AI用的‘时间机器’,记录源代码、执行轨迹和评估分数。在任务上表现出色,但也面临耗时、数据爆炸等挑战。
15个前沿大模型,100个职业场景:谁才是最强AI打工人?
通义千问与港中文联合发布OccuBench,用语言世界模型评测AI Agent职业能力。评测15个前沿模型,发现无全能选手,隐式故障难处理,Scaling定律有效,做Agent和环境模拟器能力不同,还给出具体案例。
开源模型首超Opus4.6!智谱GLM-5.1登场,14小时后CUDA专家被冲了
智谱开源模型GLM - 5.1带来重大突破,14小时完成CUDA Kernel优化,加速比大幅提升。它解锁与顶尖闭源模型Claude Opus 4.6全面对齐,在多测试中表现优异,展现长程任务能力,改写行业叙事逻辑。
你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」
港中深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。
阿里“悟空”上线!钉钉给企业送来龙虾大军
AI钉钉2.0年度新品发布会上,阿里发布AI toB旗舰应用“悟空WuKong”,它以企业智能体为核心,能落地办公场景。悟空开启全球邀测,也会内置到钉钉AI 2.0。它还带来行业解决方案,补齐安全短板。
ICLR 2026 | 从「聚合」到「引导」:FedDRM开启客户端智能路由新范式
传统联邦学习中,统计异质性是障碍,本文提出 FedDRM,将联邦学习从「聚合范式」拓展到「路由范式」,让服务器能把问题交给最合适的客户端处理,在多数据集上提升系统准确率,为多场景提供新可能。
刚刚,GPT-5.4 发布,百万上下文、最强全能模型
OpenAI发布GPT - 5.4,集推理、编程等能力于一体,支持百万级上下文窗口。有三个版本,功能全面升级,如支持中途打断、电脑操作、视觉能力提升等,还更省token、少幻觉,安全机制完善,价格有调整。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。
AI参与战争的时代正式拉开帷幕?
美以对伊朗军事行动或已运用AI,美军投入大量资金研发相关技术,并通过实战迭代提升AI定点清除成功率。AI在军事中有多方面应用,美国已启动相关计划,引发全球军备竞赛,中国应迎头赶上。
Claude被美封杀后,Anthropic CEO回应一切!
2025年7月Anthropic与五角大楼签2亿美元合作合同,因提出AI不得用于全自主武器及大规模国内监控遭拒。美国防部长称其技术有“国家安全供应链风险”,Anthropic CEO回应坚持红线是捍卫美国价值观。