「harness engineering」共找到 227 篇相关文章
浙大开源HugAgentOS:三引擎一体自进化,每步可归因/回放/回滚
过去一年,Agent任务执行能力提升,但不会自主积累与进化。浙大开源的HugAgentOS把Harness拆成三个可自我成长的引擎,设归因和本体两道关卡,解决经验成能力等问题,还覆盖智能体完整链路。
美团面试题:如何设计多轮对话智能客服Agent。评论区吵翻了,但答案可能就一句话。
文章围绕美团面试题,探讨如何设计多轮对话智能客服Agent。指出AI Agent核心是Context Engineering,介绍业内架构,强调给AI不同容忍度、分步骤处理复杂问题,还提及解决体验问题,认为产品要知边界。
微调已死?Agentic上下文工程登场,无需微调实现模型进化
斯坦福大学等团队提出 Agentic Context Engineering 技术,让语言模型无需微调自我提升。它将上下文视为作战手册,引入三种协作角色与三项创新,实验显示其在两类任务上表现优异,成本和延迟显著下降。
最新!Karpathy:Vibe Coding只是抬高了地板,真正的战场在这里
Andrej Karpathy在AI Ascent 2026上与红杉合伙人对话,分享自提出“vibe coding”一年来的变化。谈到技术转变、Software 3.0、模型“锯齿状”特征等,还区分了vibe coding和agentic engineering,指出人类需保留品味、判断力等。
从GLM-4.5到GLM-5,我见证了一个模型从码农晋升为架构师
智谱以匿名方式将GLM - 5放到OpenRouter公测,其表现亮眼。在AI编程从Vibe Coding转向Agentic Engineering的背景下,GLM - 5参数规模提升,成绩优异,实测决策有架构师思路,持久力强,不再只是‘平替’。
从Prompt到Context:为什么Think Tool是形式化的必然?
文章从编译原理视角,为AI工程实践提供理论根基。分析了Prompt和Context Engineering的形式化程度,介绍Anthropic的Think Tool,指出其优势及对CoT的超越,还提及未来需为Agent System发展全面形式化理论。
红杉对话 LangChain 创始人:2026 年 AI 告别对话框,步入 Long-Horizon Agents 元年
红杉访谈 LangChain 创始人 Harrison Chase,探讨 Long-Horizon Agents。其认为 2026 年是 Doers 元年,这类 Agent 能处理长时程任务。还提及 Harness 架构、Coding Agent 等,指出 Memory 是壁垒,交互需同步与异步结合。
Coding Agent 在百度的落地实践:从反馈闭环到工程范式重构
本文整理自百度文心快码研发经理牛万鹏演讲,介绍了Coding Agent在百度的落地实践。包括落地成效、Agent Loop框架问题、Feedback Loop构建、Benchmark评测及Agent Engineers理念,还提及企业级Agent落地的工程问题。
撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍
J - Space Cognition Suite社区项目在X上传播,称不修改DeepSeek V4 - Pro模型权重,用推理时Harness能提升其在多项Agent Benchmark表现,超Fable 5,但未第三方复现,且Token开销可能翻倍。
OpenClaw 技术闭门:测试将比代码更值钱,Agent Computer 会是新的硬件形态
OpenClaw 持续发酵,从极客「玩具」变为生产力工具。闭门分享中,开发者们探讨了其在实际业务中的应用。如代码成负债,测试更重要;不同用户对 OpenClaw 认知差异大;Platform Engineering 成工程师核心,还提及 Agent Computer 新硬件形态等。