「长程任务能力」共找到 4638 篇相关文章
感知、控制与数据:ICRA 2026 中国企业报告的三个交汇点
ICRA 2026期间,速腾聚创等六家中国企业分享机器人领域进展。他们关注感知底层基础、接触‘最后一毫米’问题、数据与模型关系,且技术路径和产品侧重有差异,具身智能注重工程落地和系统能力建设。
腾讯混元最新开源:一套RL框架打通多个模态,庞天宇团队新作
大语言模型的RL技术已成熟,但多模态生成模型的强化学习训练仍“各自为战”,制约AIGC模型能力上限。腾讯混元庞天宇团队开源UniRL框架,打通多模态RL后训练,覆盖多种模型,内置算法与奖励组件。
ICML 2026 | Agentic强化学习训练的信息自锁问题
随着大语言模型走向真实交互,强化学习训练LLM agents时出现信息自锁问题。香港中文大学等研究者分析其原因并提出AREW方法,在多场景实验中表现稳定且具鲁棒性。
从OpenAI AI Phone到Gemini on Android:AI手机时代需要怎样的Agent Harness?
过去一年,AI与手机关系被重新定义,腾讯混元等机构研究PhoneHarness,关注AI在手机上行动及任务完成验证问题。它让手机Agent行动不止GUI,还有Bench检验执行结果,推进AI手机基础设施建设。
Claude不到4%,全军覆没!一场大考撕碎Agent「全自动办公」幻想
新智元报道,UniPat AI的SaaS - Bench实战考卷,用23个真系统、106个任务测试Agent。结果显示,Claude Opus 4.7完全通过分数仅3.8%,多数模型全军覆没,暴露了Agent在真实环境中的四种致命缺陷。
当 AI Coding 进入复杂企业系统,为什么提效远没有宣传里那么美好 ?
以Claude Code、Codex为代表的自主编码智能体席卷开发者生态,但夸大能力现象严重。在复杂企业系统中,AI Coding提效远没宣传美好,存在诸多问题,企业应分级应用、进行约束下的人机协作。
1个月干完15个月!Claude Mythos猎杀271个漏洞,有的藏了20年
Mozilla深度复盘显示,Firefox团队用Claude Mythos Preview,单月修复423个安全漏洞,超此前15个月总和。它挖出271个漏洞,含180个高危,还找到沙箱逃逸漏洞。此外,Anthropic与OpenAI在AI安全能力竞赛中路线不同。
马斯克22万张GPU救场后,Claude勉强恢复“三个月前体验”,Gary Marcus却警告:GPU将严重过剩,很快不值钱
当地时间5月6日,Anthropic宣布用SpaceX算力,提升Claude服务能力。此前其算力紧缺致口碑下滑,此次合作让Claude恢复到3个月前体验。同时,纽约大学学者警告GPU将过剩,而Anthropic发新功能争企业客户。
AI学会梦里干活!Claude发布3大进化,Dario:单人公司10亿美金爆发
在 Code with Claude 大会上,Anthropic 为 Claude Managed Agents 上线三项功能。‘做梦’解决记忆退化,成果评估自动检查工作,多 Agent 协作让复杂任务分工处理。Dario 称 AI 时代单人公司或达 10 亿美金营收。
末日来临,会古法编程的我成了救世主
文章介绍网络小说《AI 编程末日,只有我会古法编程》,讲述 2038 年超级 AI 接管代码生产后自毁,全球瘫痪,前腾讯工程师凭手写代码拯救世界。还探讨作者身份,分析不同阶段程序员对 AI 的焦虑,指出小说预言正成现实。