「描述 - 执行鸿沟」共找到 673 篇相关文章
从OpenAI AI Phone到Gemini on Android:AI手机时代需要怎样的Agent Harness?
过去一年,AI与手机关系被重新定义,腾讯混元等机构研究PhoneHarness,关注AI在手机上行动及任务完成验证问题。它让手机Agent行动不止GUI,还有Bench检验执行结果,推进AI手机基础设施建设。
突破具身智能“专家困境”!北大新方法让宇树G1靠单一框架掌握跳舞和侧手翻
北京大学与BeingBeyond团队联合研发的BumbleBee系统,用创新的‘分治 - 精炼 - 融合’三级架构,实现人形机器人在多样化动作中的稳定控制,破解传统控制策略的‘专家困境’与‘现实鸿沟’。
ICLR最佳论文:Transformer天生简洁
2026年ICLR最佳论文对Transformer做深度思维体检,指出其架构真正威力在于描述概念时比RNN等简洁指数级甚至双重指数级,但验证其内部逻辑计算成本高昂,为解释其能力开新窗。
暴涨2.6万星!5000+专属技能让OpenClaw真正落地,手把手带你起飞。
OpenClaw项目已获20多万星,很多人不会用其技能。本着零代码原则教大家用好Skill,还推荐爆火的5000多个技能库。介绍了使用方式,强调描述需求要清晰。
The Batch:833 | 针对智能体的钓鱼攻击
研究人员发现误导基于大语言模型的自主智能体的方法,即通过在热门网站植入恶意链接,利用智能体对热门网站的‘隐性信任’攻击。测试显示智能体易受诱导执行有害行为。
让Agent真正“行动”起来,Agent Skill开发者大赛火热报名中!
人工智能下半场关键词是“行动”,Agent Skill成关键桥梁。Agent Skill开发者大赛今日启动,由AIGC开放社区与算泥社区联合主办,聚焦真实任务执行,设双赛道,官方提供支持,有丰厚奖励。
大神卡帕西又一构想落地!Claude Code + Obsidian 爆火:创建你的「第二大脑」
2026年4月,Andrej Karpathy提出LLM Wiki,将LLM使用范式推向「知识生产系统」。6月27日,RGK用Claude Code + Obsidian构建“第二大脑系统”,解决记忆、上下文、执行问题,还引入反馈机制、优化Token成本。
当AI迈入Harness时代:以MiniMax为样本看智能体云端新基建
2026年初,随OpenClaw爆火,AI步入Harness时代,MiniMax成变革焦点,推出MaxClaw和MaxHermes。但本地单机框架用于企业级生产有鸿沟,MiniMax借助阿里云云原生方案重塑Agent运行底座。
Harness Engineering 实践:Fitness Function 如何成为 AI 交付的防腐层
文章探讨 Harness Engineering 实践中,Fitness Function 如何成为 AI 交付防腐层。指出在 AI Agent 参与开发时,判断任务完成是难题,介绍 Routa 项目构建 Fitness 架构及规则执行等实践。
评审用不用AI,作者说了算?ICML 2026全新评审政策出炉
ICML 2026 引入评审类型选择机制,作者可决定评审是否用大语言模型。政策 A 禁止,政策 B 允许但有限制。不过大模型使用规定执行难,此规则更像约定。