知识评估」共找到 1171 篇相关文章

新闻资讯7

92% 工程师都在用 AI 后,Uber 开始给 AI “限额”了

Uber的‘零增长技术栈’解耦容量与业务需求,优化Go运行时性能。还将生成式AI集成开发,92%工程师在用,但成本压力大。为此,Uber限额每位开发者,审查代码效果,完善评估指标。

InfoQ
产品应用7

80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」

Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。

机器之心
推荐文章7

翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”

前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。

DeepTech深科技
推荐文章8

Shopify 经验贴:如何搞出一个生产级别可用的 AI Agent 系统?

Shopify 以 AI 助手 Sidekick 为例,分享从简单工具调用系统演变为复杂 AI Agent 平台的经验,包括架构设计、评估方法和训练技术等方面,还给出构建生产级别可用的 AI Agent 系统的四条核心建议。

Founder Park
开源动态8

MemOS:一种用于 AI 应用的记忆操作系统

大型语言模型缺乏记忆管理系统,限制其发展。MemTensor与高校联合开源MemOS,它将记忆视为可管理资源,有三层架构,系统化三种记忆类型。评估显示其在推理、检索、加速等方面表现优异。

PaperAgent
开源动态7

开源,本体驱动的GraphRAG新范式,零噪声~

分享开源项目trustgraph,重点介绍本体驱动的零噪声GraphRAG。常规GraphRAG在实际应用中问题多,如数据重复、冲突、缺数据等,而本体可构建自我完善的知识图谱,作者为此造了“本体驱动GraphRAG”。

PaperAgent
算法论文7

会解题不等于懂人心,腾讯混元提出Sentient Agent,提高高阶社交认知能力

过去评判LLM像考核‘做题家’,但会解题不等于懂人心。腾讯团队提出SAGE框架,用会闹情绪的agent评委评估模型高阶社交认知能力。实验显示不同模型表现差异大,未来需懂人心的AI。

深度学习自然语言处理
算法论文7

有人只用API就猜出了GPT、Claude、Gemini的参数量?社区吵翻了

研究人员李博杰在arXiv发布论文,提出“不可压缩知识探针”评测框架,仅通过黑盒API调用逆向估算LLM参数规模,给出GPT-5.5等模型参数量估算,引发社区广泛讨论与争议。

机器之心
推荐文章7

鹅厂员工怎么看Agent自动持续进化?

落地一个Agent容易,但让其自动持续优化很难。文章分享了9位鹅厂同事对“Agent如何自动持续进化”的看法,如建立评估体系、记录真实任务反馈、结合强化学习等。

腾讯技术工程
推荐文章7

听说,大家都在梭后训练?最佳指南来了

大模型时代,Scaling Law 边际效益递减,业界转向后训练。《Post-training 101》博客可助初学者入门,涵盖从预训练到指令微调、SFT 原理、多种强化学习技术及模型评测方法等内容。

机器之心