「底层系统能力」共找到 4713 篇相关文章
63页的面向AI搜索范式:Multi-agent、MCP、DAG、RL
百度搜索发布63页《迈向人工智能搜索范式》Paper,介绍模块化、多智能体框架,新范式协调四个专门LLM代理处理搜索事务,还提及新内容及重要性,为下一代AI搜索系统提供基础。
刚刚,Gemini 2.5 Pro升级,成编程模型新王
Google DeepMind发布Gemini 2.5 Pro (I/O edition),编程能力大幅提升,在编程排行榜超Claude 3.7 Sonnet。用户用一个提示词或草图+描述就能构建应用,谷歌大佬站台,网友实测效果佳。
GPT-6 Astra突袭:正面对垒 Fable 5.1,多项编码测试反超!OpenAI 总裁:欢迎来到 AGI 时代
今天凌晨,OpenAI 发布 GPT-6 Astra,公司称是多年研究成果。它在多项测试表现出色,编程、电脑操作等能力提升,还加强了安全措施。将面向部分用户及通过 API 和 AWS 推出。
第九章 编码 Agent 实战——用 Deep Agents 构建代码审查助手
文章围绕用 `deepagents` 框架构建代码审查 Agent 展开。介绍 `deepagents` 核心能力、安装配置,给出最小可运行示例。还阐述自定义工具及使用方法,添加审查 Skill 明确审查标准和流程。
RPA要没了
Codex更新Record & Replay功能,虽与RPA表面都是录制操作、重复执行,但底层逻辑不同。RPA是指令式,有诸多缺陷;Codex是目标式,是RPA替代品,还构建了企业自动化体系。
首个长程Doc2Repo训练集!代码Agent不止修bug,开始造仓库
中国人民大学高瓴人工智能学院发布DeNovoSWE数据集,专注长程软件工程任务。它通过特定机制构造高质量数据,为代码智能体长程能力训练提供支持,实验显示能显著提升模型仓库生成能力。
Claude「永久大脑」,真的来了!
著名AI追踪平台TestingCatalog爆出,Anthropic正为Claude测试「双模记忆系统」,包括「经典记忆」和「文件记忆」。此外,「梦境」预览版亮相,还有终极Agent平台Claude Conway登场,7x24h永不下线。
Andrej Karpathy爆料:自己家被Claude Code入侵了
Andrej Karpathy做实验让Claude Code入侵自家Lutron智能家居系统,成功接管全屋设备。此前网友用其控制烤箱等,引发连锁反应。但这也暴露物联网设备安全问题,还带来新威胁。
Karpathy力荐必读博客:代码功底,决定AI「开挂」倍数!
Karpathy推荐Atharva博客,指出AI是工程师能力放大器,扎实编程基础搭配精准提示,能借AI打造极致产品。文章还给出用AI开发的策略、战术,以及数据库优化实例。
端到端GUI智能体首次实现“犯错-反思-修正”闭环,模拟人类认知全过程
南洋理工大学MMLab团队提出框架GUI - Reflection,让端到端多模态GUI智能体有“自我反思”能力。它在各训练阶段引入“反思与纠错”机制,实验证明该框架能提升智能体能力。