工程决策」共找到 1014 篇相关文章

推荐文章7

Agent = Model + Harness,一个可能成为2026年出圈的新概念

文章提出新概念Harnesses Engineering,认为Agent = Model + Harness,阐述了Harness的作用、核心组件,还提及模型训练与Harness设计的耦合及Harness工程未来,指出需‘Harness思维’让AI驱动工业革命。

AI工程化
算法论文8

一篇双引擎进化的长程Agents系统性综述

人大、北大、清华等联合发表149页长时程Agent综述,给出首个统一形式化定义,梳理出‘外化Harness工程×内化模型优化’双螺旋共演化主线,用六个视角串起技术版图。

PaperAgent
开源动态8

高智商 ≠ 高财商?50天实盘测试:LMArena 高分王者也可能是「韭菜」

伊利诺伊大学厄巴纳 - 香槟分校团队开发 LiveTradeBench,让大模型在真实金融市场交易,检验其能力。它全面开源,有实时数据、组合决策等创新,50 天实测揭示模型财商差距。

机器之心
算法论文8

Kimi新论文太硬核了!马斯克和Karpathy相继点赞~

马斯克和Karpathy点赞Kimi新论文《Attention Residuals》。该论文由杨植麟带队、苏剑林等参与,提出注意力残差(AttnRes),解决深层网络信息稀释问题,还通过工程折中降低成本,实验效果良好。

PaperAgent
算法论文7

正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?

研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
新闻资讯7

中美安全公司经营对比及原因分析

国内网络安全上市公司财报多显示亏损,而美国同类公司增长与盈利能力强。分析指出,差距源于市场国际化、产品能力和人的因素。国内市场内卷,产品竞争力弱,部分公司决策和态度存在问题。

AI与安全
推荐文章7

第 3 章 Agent 核心功能技术详解

本章以Claude Code及其生态为主参照,介绍现代Agent平台提供类似‘操作系统’机制,包括命令、记忆等。面向熟悉Python与LLM的开发者,按是什么、解决什么问题等展开,还分析了Agent工程核心挑战。

CourseAI
新闻资讯7

Claude Code越更越废?!大厂AI主管公开怒喷思考深度暴跌,官方回应更被怼爆 :菜成AI“玩具”

Claude Code在2月更新后无法用于复杂工程任务,AMD AI团队主管Stella Laurenzo分析发现其思考深度下降67%、算力消耗增加。开发者不满,Claude Code负责人回应未获认同,部分开发者考虑转用Codex。

InfoQ
新闻资讯7

刚刚,OpenAI任命新印裔CTO!11亿美金连公司打包收购,接管ChatGPT产品核心

OpenAI斥资11亿美金收购实验平台Statsig,其CEO Vijaye Raji成应用部门新CTO,将负责ChatGPT等产品工程。同时启动「OpenAI for Science」项目,打造AI驱动的科学发现平台。

新智元
推荐文章7

Agent架构搭建 ≠ 堆Skills

现在很多Agent架构以大量Skills为基础,但这种做法大概率会翻车。Skills机制让模型自行判断是否使用及何时使用技能,其判断不可靠,随着技能数量增多,系统可靠性变差,设计上需平衡灵活性与可控性。

newtype AI