系统级工程能力」共找到 4973 篇相关文章

推荐文章8

Anthropic:我们如何构建多智能体研究系统

Anthropic分享构建多智能体研究系统的经验,该系统用多个Claude智能体探索复杂主题。介绍了多智能体系统优势、架构、提示工程、评估方法,也提及生产环境的挑战,此系统处理开放式研究任务价值大。

宝玉AI
产品应用8

GPT-5.4 发布,OpenClaw的能力要被取代?OpenAI 新模型不仅会自己用电脑,编程能力也拉满了

今天 GPT-5.4 发布,整合推理、编程及原生计算机使用能力。其原生电脑操作能力提升,与 OpenClaw 竞争。还带来工具搜索降成本、减少幻觉,编程能力增强但价格也升级。

AI前线
推荐文章8

系统架构思维,告别“意大利面条式”系统提示词

本文作者分享编写系统级提示词经历,指出‘规则清单式’设计有规则打架、维护难、价值稀释问题。引入系统架构思维,构建四层设计框架,给出编译原则与模板,还重构‘AI编程助手’提示词,实现从‘规则管理者’到‘系统设计师’转变。

阿里云开发者
推荐文章7

评论送书 | 一文读懂多Agent系统演进趋势

文章指出多Agent系统成大模型应用重要方向。分析大模型交互的上下文瓶颈,如语义膨胀、信息密度不均等;阐述Agent间协同结构演化,包括松耦合编排、语义协同等;还说明传统Prompt工程局限及通信与上下文协议的作用。

AIGC开放社区
算法论文8

14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~

有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。

PaperAgent
算法论文7

姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench

腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。

AI寒武纪
算法论文7

正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?

研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
新闻资讯7

DeepMind华人研究员Lun Wang离职,「评估」成制约模型能力飞跃的瓶颈

谷歌DeepMind研究员Lun Wang离职后发文指出,当下评估体系难以应对新模型,制约模型能力飞跃。现有评估多针对当前模型,新能力出现时往往无法预测,需构建能自我进化的评估系统

机器之心
算法论文8

ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力

美国东北大学等机构研究者提出OPeRA数据集,采集真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。

机器之心
新闻资讯7

GPT-5.2考赢人类!OpenAI警告:大模型能力已过剩,AGI天花板不是AI

GPT - 5.2在ARC - AGI - 2基准测试超人类,Poetiq系统让其准确率从60%提至75%。OpenAI称大模型进入‘能力过剩’阶段,未来AGI进展不止靠模型,更需人机协同。

新智元