「agent能力」共找到 5209 篇相关文章
深度解析 Claude Code 在 Prompt / Context / Harness 的设计与实践
本文深度解析Claude Code在Prompt、Context、Harness三方面的设计与实践。介绍了Prompt动态组装过程,探讨CLAUDE.md项目说明、上下文压缩体系和记忆系统,还阐述了系统级提醒、多Agent及安全体系等内容,文末分享了项目有趣彩蛋。
微信今天上线了 ClawBot,这是腾讯打出的一张大牌
微信推出 ClawBot 插件,将 OpenClaw AI agent 接入聊天界面。OpenClaw 原是开源项目,能让普通人用自然语言指挥电脑干活。腾讯同步推产品矩阵,想成 AI agent“入口”和“管道”,但也有体验粗糙等风险。
Cursor就是最强知识库应用,没有之一
作者认为最好用的知识库应用是Cursor,它有RAG能力,能处理代码和纯文本,可创建修改文档,具备搜索能力且会及时支持先进模型。作者还分享用Cursor配合文档工作的规则及使用示例。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
Codex 的野心,MCP 和 Skill 的下一步
作者密集使用Codex App等Agent应用,发现顶尖Agent收敛到相同界面布局。Codex野心大,要处理多格式文件、支持专业工作流。MCP和Skill未解决用户二次编辑问题,插件机制或是出路,Codex已有原始插件市场。
GPT-5仅23.3%,全球AI集体挂科!地狱级编程考试,夺金神话破灭
最新基准测试SWE-Bench Pro评估AI编程智能体,直面真实企业级工程任务。顶尖模型几乎溃败,GPT - 5仅23.3%。该测试解决现有基准数据污染、任务简单问题,能成未来LLM编码能力标尺。
Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光
苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。
Genspark 发布 GenOffice:AI 时代的 Office,免费、开源,抢占办公人群的第一工作入口
8月3日,Genspark创始人景鲲在AGI Playground 2026大会发布GenOffice,这是面向Windows和Mac的本地Office客户端,免费、开源、无广告,将AI引入高频办公场景。GenOffice Alpha版已发布,后续会和用户、AI Agent共建迭代。
Cursor Origin 上线,GitHub 的老玩法还够用吗?
8月17日,GitHub服务异常,同日Cursor向付费计划开放Origin early beta。代码仓库接入更多Agent,现有设施适应人的节奏,而Agent工作节奏更快。Origin重写协作成本,与GitHub设计前提有差异,马斯克布局延伸到软件生产链。