智能体基准」共找到 4103 篇相关文章

开源动态8

DeepSeekV3.2技术报告还是老外看得细

ChatGPT三岁生日时,DeepSeek两款开源模型DeepSeek-V3.2和DeepSeek-V3.2-Speciale引发热议。它们在智能评测中表现出色,缩小了开源与闭源模型差距,还降低了成本,给硅谷闭源AI公司带来压力。

量子位
新闻资讯8

马斯克发布“地球最强AI模型”Grok 4:横扫所有榜单,在“人类最终测试”超越人类博士”!

北京时间7月10日,马斯克团队发布Grok 4,其基准测试成绩惊人,在‘人类最终测试’等表现出色。它成功源于多智能协作、追求真相哲学和高算力投入,还在多领域展现应用潜力,同时公布定价并坦言短板。

AI科技大本营
产品应用8

获NVIDIA致谢:悟空Agent的实践、复盘与迭代

本文以悟空Agent获NVIDIA致谢为切入点,介绍多智能架构闭环及实战挑战,如上下文断流、调度失衡。还阐述架构设计、迭代优化、数据飞轮系,指出AI infra存在安全隐患,强调安全融入业务的重要性。

腾讯技术工程
算法论文8

LLM 驱动的 AI Agent通信:协议、安全风险与防御对策

论文围绕智能通信的协议、安全风险及防御对策展开探讨。介绍兴起与重要性、定义分类、解析多种协议,分析不同交互的安全风险,提出防御对策,还以MCP和A2A为例做攻击实验,给出未来研究方向。

PaperAgent
开源动态7

The Batch: 948 | GLM 5.1:面向长时任务的能力提升

Z.ai将旗舰开源权重大语言模型升级为GLM - 5.1,可在单个任务自主运行八小时。它专为编程和智能任务设计,有推理等特性,在多榜单表现佳,但推理和数学能力落后闭源模型,价格有提升。

DeeplearningAI
开源动态7

4 万星开源项目被指造假!MemGPT 作者开撕 Mem0:为营销随便造数据,净搞没有意义的测试!

高人气开源智能记忆项目 Mem0 发布论文,称在 LOCOMO 测试打败对手。MemGPT 创始团队 Letta AI 联合创始人公开指控其造假,称测试无意义,自己轻松超其基准数据。二者都为解决大模型长期记忆问题而诞生。

InfoQ
开源动态7

全网首份「龙虾」安全部署指南来了!360出品

近日,开源AI智能OpenClaw走红,多地出台扶持政策,部署成趋势。但它带来新安全挑战,工信部、信通院等已预警。360集团率先发布国内首份《OpenClaw安全部署与实践指南》,为政企和开发者提供安全参考。

量子位
新闻资讯7

创始人押宝AI让公司死而复生,如今市值逼近百亿!CEO:我鼓励年轻人每天拼12个小时

本文讲述对讲机企业 Intercom 创始人 Eoghan McCabe 押宝 AI 使公司逆袭的故事。Eoghan 回归后带领公司转型,推出 AI 代理 Fin,实现业务增长,还进行战略聚焦、文化重建等改革,同时探讨了 SaaS 与智能、AI 对就业影响等话题。

AI前线
新闻资讯8

阿里千问落地谷歌UCP+A2UI,中国率先进入AI办事时代

谷歌联合零售巨头发布UCP和A2UI协议,试图定义智能商务全球标准。而阿里千问App上线千问任务助理1.0,打通淘宝、支付宝等核心业务,接入多项生活与政务服务,快速落地应用,让中国进入AI办事时代。

AIGC开放社区
新闻资讯8

MagicOS已成世界「第三极」,荣耀拿下AI大战叙事权

全球智能手机进入AI决战期,苹果、谷歌、三星等厂商各有局限。荣耀推出MagicOS 10及YOYO智能,其具备自进化能力,背后有魔法大模型3.0矩阵支撑。荣耀在技术、生态、市场等方面全链路突破,有望执掌全球AI终端话语权。

新智元