评测榜单」共找到 1218 篇相关文章

算法论文7

基于Memory Bank的Cursor长会话记忆内存库理论研究与实践

文章围绕Memory Bank展开,介绍其为解决大模型长会话记忆瓶颈而设计的机制,包括存储、检索、更新模块。阐述其在编程和知识库建设的应用,还评测了Codelf等工具,指出Memory Bank是AI迈向智能的重要一步。

阿里云开发者
7

别让故障复盘流于形式:用AI挖掘每一次“跌倒”的价值

文章指出传统故障复盘存在诸多问题,借助AI能力可解决专业性和深度问题。介绍了智能复盘Agent,包括其核心使命、目标用户、核心价值和解决方案,还阐述了核心技术架构、实现方式及评测机制等,最后给出实战案例。

阿里云开发者
算法论文8

分享两篇Claude Skills最新论文,有3个核心结论

文章分享两篇Claude Skills最新论文,总结出技能安全漏洞、技能数量与准确率关系等结论。还探讨智能体技能系统能否取代多智能体,通过实验验证其效率优势,并提出解决技能选择过载的方案,也对Agent Skills做了安全分析。

PaperAgent
算法论文8

只需一次指令微调,大模型变身全能专家天团,8B模型性能反超全微调基线 | ACL25 Oral

预训练大模型适应专业领域需高昂微调成本,稀疏混合专家架构虽能提升推理效率,但从头训练耗资源。浙大与Thomson Reuters团队提出SIMoE,阶段微调就能升级大模型,还解决传统方法两大局限,在性能和效率上双突破。

量子位
开源动态8

阿里 Qwen3:持续开源,SOTA 连连!

很多从业者有‘闭源模型一定比开源强’的刻板印象,而 Qwen 正打破此认知。最近阿里连发三款模型 Qwen3-235B、Qwen3-Coder、Qwen3-235B(Thinking),在多方向发力且拿下多个开源第一。

特工宇宙
产品应用8

跨本体、长任务、可预测……Motubrain双登顶只是一个开始

本文围绕具身机器人展开,指出当前大多具身机器人干活存在局限。Motubrain 双登顶,确立通用机器人大脑干活能力参照系,它具备一脑多能、一脑贯通等能力,生数科技已开启产品落地布局。

AI科技评论
新闻资讯7

跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了

Claude Opus 4.7发布48小时口碑两极撕裂。官方并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。

新智元
产品应用8

智能老师的“成人礼”:一只中国独角兽如何在《时代》岸边重新定义“教育奇点”

2025年《时代》周刊“最佳发明”中,松鼠Ai多模态智适应教育大模型作为教育科技领域唯一中国力量入选。其创始人栗浩洋锚定L5级自主教学目标,成果经多地实践验证,还推动教育公平走向全球,牵头制定AI教育标准。

AI科技评论
产品应用8

AI Coding新王登场!MiniMax M2.1拿下多语言编程SOTA

MiniMax发布旗舰级Coding & Agent模型M2.1,在Multi - SWE - bench中以10B激活参数拿下49.4%成绩,超越竞品成SOTA。它解决模型‘偏科’问题,适配开发工具链,实测在多语言编程任务中表现出色。

量子位
新闻资讯8

从“能用”到“敢用”:企业级 AI 落地的终极答案 | AICon 2025 收官

12月19 - 20日AICon 2025大会落幕,众多企业专家参与,探讨企业级AI落地。InfoQ王一鹏谈AI落地趋势与流畅度构建;大会发布「2025中国技术力量年度」,多位嘉宾演讲分享AI见解,还有17个分论坛和合作展区。

InfoQ