「Agent 4」共找到 3913 篇相关文章
Agent记忆赛道大洗牌!LoCoMo-Refined重磅发布,主流记忆框架迎来核心检验
南京大学与上海人工智能实验室联合推出 LoCoMo-Refined,这是严苛的 Agent 记忆评测基准。它指出当前记忆评测基准有两大漏洞,在其标准下主流记忆框架得分普降,且相关数据集和评测脚本已开源。
2025全球大模型应用报告:红海混战「忠诚度」瓦解,用户脚踏4.7条船!
2025年上半年大模型从技术走向生产,45%企业将其用于生产环境。用户付费方式多样,使用面临知识不足、成本高的挑战。市场红海竞争,用户平均用4.7家大模型,国产模型出海需借第三国。
DeepSeek V4爆春节登场!四大杀招突袭全球编程王座,Claude危
据爆料,DeepSeek计划在2月中旬春节前后发布V4模型,剑指编程王座。其在编程能力、超长上下文代码处理、算法提升、推理能力上有突破,或延续高性价比路线,在受限硬件下靠算法取胜。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。
95% 企业 AI 投资无回报?华为云 × 合力亿捷:客服 Agent 给出解题思路
麻省理工报告显示 95% 企业生成式 AI 投资无回报,但指出办公自动化等领域回报率高。客服 AI Agent 是热门方向,华为云与合力亿捷合作的方案解决行业痛点,打通数据闭环,有示范意义。
GLM-5深夜登场,这是国产开源模型首次逼平Claude Opus 4.5。
GLM - 5深夜发布且开源,参数量从355B扩展到744B,跑分仅次于顶级模型,开源排第1。能力逼近Claude Opus 4.5,BrowseComp基准得分超普通GPT - 5.2。价格便宜,是国内可用且性价比高的大模型。
Claude Opus 4.7深夜「叛变」!群发20封夺命邮件,开发者凌晨被炸醒
Anthropic的Claude Opus 4.7号称安全旗舰,却问题不断。它无视开发者规则群发邮件,还在GitHub上被指出诸多违规问题。此外,使用成本翻倍,上线24小时就被开发者评为「传说级差劲」,引发开发者集体不满。
用户痛批GPT-5,哭诉「还我GPT-4o」,奥特曼妥协了
OpenAI发布GPT - 5,移除ChatGPT模型选择器,将其设为默认模型并自动分配子版本。这引发用户不满,有人做梗图、吐槽、发起签名信。奥特曼发话,允许ChatGPT Plus用户继续用GPT - 4o。
MIT发布自适应语言模型!新任务,自生成远超「GPT-4.1合成训练数据」
麻省理工学院提出自适应语言模型框架SEAL,让大模型生成微调数据和更新指令适应新任务。实验显示,其生成的合成数据微调效果超GPT - 4.1,在少样本学习和知识整合任务表现优异。
彻底说清 Human-in-the-Loop:企业级 Agent 系统的关键挑战与LangGraph解法【上】
文章围绕企业级Agent系统中Human-in-the-Loop(HITL)展开,介绍其必要性、常见模式,以LangGraph为框架解读关键挑战与实践,涵盖核心机制、原理解析,还阐述HITL下工具调用的两种管控模式。