Agentic性能」共找到 4416 篇相关文章

开源动态7

缓存命中率99.93%!DeepSeek最适合的Harness来了,GitHub狂揽8.6万Star

DeepSeek官方版Harness未出,民间开源编程Agent「Pi」先火。它适配DeepSeek,让其缓存不命中率低至0.03%,调用成本大降。Composio测试显示Pi完成任务平均成本最低。同时,DeepSeek正组建团队做官方Harness。

量子位
算法论文8

VLA大模型做长任务总断片?同济KC-VLA用关键帧链给治好了

VLA大模型记性是短板,处理非马尔可夫任务常束手无策。同济大学等提出KC - VLA框架,用关键帧链接赋予机器人全局时间感知能力,还构建了长时序记忆依赖基准测试,实验显示其性能优越。

PaperAgent
算法论文8

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

中科大团队在 ICLR 2026 论文中指出 KV Cache 压缩领域底层假设存在缺陷,主流方法基于的稳定性假设在真实场景中脆弱。团队提出防御性聚合策略,仅两行代码修改,显著提升 KV Cache 压缩性能

机器之心
产品应用8

黑客已死!Claude 两周挖出 Firefox 22 个漏洞

Anthropic与Mozilla合作,让Claude Opus 4.6对Firefox代码库做漏洞挖掘,两周发现22个漏洞,14个高危。Claude发现漏洞能力强,但利用漏洞能力弱。还研究用LLM做「补丁Agent」,为AI辅助安全研究建规范。

AGI Hunt
开源动态8

阿里开源QwenLong-L1:首个以强化学习训练的长上下文推理大模型

LRMs扩展到长文本场景是挑战,阿里开源QwenLong-L1框架,是首个用强化学习训练用于长文本推理的模型。它含三个核心组件,QwenLong-L1-32B性能领先,与Claude-3.7-Sonnet-Thinking相当。

PaperAgent
开源动态8

刚刚国产双响炮炸场!智谱「牛来模型」和阿里Qwen3.8-Flash双双亮相屠榜

智谱发布GLM - 5.3 - Flash(牛来模型),原生多模态,支持1M token上下文,运行在国产芯片,价格实惠。阿里开源Qwen3.8 - Flash - Next权重,成本低性能优,在四大维度重构架构。

AI寒武纪
算法论文8

不换模型,效果提升104%!上海AI Lab让Harness也能自进化了

上海人工智能实验室团队提出的Self-Harness引发关注,它针对Agent外层Harness改进。实验显示,在Terminal-Bench-2.0上,不换模型只改Harness,Qwen3.5-35B-A3B等模型效果显著提升。

量子位
推荐文章7

当10亿个AI一起模拟未来:李飞飞和Karpathy共同押注的新赛道|5Y Research

本文聚焦Multi - Agents模拟预测这一AI前沿方向,介绍其发展、原理、应用场景及代表公司。它能为人类社会建可反复运行的“世界模型”,虽潜力大,但面临验证难、技术瓶颈等问题。

五源资本 5Y Capital
新闻资讯8

Meta归来!时隔一年发布Muse Spark,重回第一梯队

Meta发布Muse Spark模型,这是MSL团队首款模型。此前Llama 4表现不佳,刺激Meta重组。Muse Spark性能超Llama 4,计算效率提升,在测试中成绩优异,Meta AI战略转向闭源探索,模型已上线。

AIGC开放社区
推荐文章8

藏师傅开发的 Codepilot 保姆级入门攻略

本文是藏师傅开发的 Codepilot 全平台通用开源 Agent 客户端的保姆级入门攻略,介绍了其特色功能,涵盖安装、配置服务商、聊天、技能使用等方面,助读者快速上手。

歸藏的AI工具箱