「记忆评测基准」共找到 1796 篇相关文章
10 小时连崩 4 次、Claude 疯狂宕机!刚把 ChatGPT 干到 295% 卸载量,就没顶住二次“爆红”?
3月2日,Anthropic旗下Claude及Claude Code服务中断,10小时连崩4次。此前特朗普下令停用,Claude却因禁令用户量激增。受OpenAI与国防部合作影响,ChatGPT卸载量涨295%,Claude推记忆搬家功能促用户迁移。
又是中国团队!一条链接出片,电商AI视频迎来「DeepSeek时刻」
电商AI视频此前生成效果不佳,难以用于投放。营赛AI发布的inSai Hilight是“下一代营销视频解决方案”,在权威评测中表现出色,能保证商品和数字人一致性,靠知识图谱等技术实现高质量视频生成。
必须得让AI明白,有些不该碰的东西别碰(doge)
近期类o3模型在视觉推理任务表现优异,但陷入‘盲目用工具’状态。港中文MMLab等团队提出AdaTooler-V模型,具备自适应工具使用能力,还引入指标、算法,构建数据集,在多基准测评中优势明显。
以孔子命名,超越Claude 4.5 Opus,Meta发布工业级自我进化AI软件工程师CCA
Meta与哈佛联合推出工业级软件工程师CCA,它是一套让AI在工业级代码库协作的方法论,解决长上下文推理等难题。其三维解耦设计、精细记忆机制、自我进化能力获数据验证,还适合引入强化学习。
DeepSeek-V3.2正式版发布,将开源模型的能力推向极致
DeepSeek-V3.2正式版开源,包含标准版和Special版。它采用稀疏注意力机制,降低计算复杂度。后训练阶段有多项算法改进,支撑高难度推理。还融合思考与工具使用,合成训练数据,在智能体评测表现优异。
缺数据也能拿SOTA?清华&上海AI Lab破解机器人RL两大瓶颈
现有机器人视觉 - 语言 - 动作(VLA)模型训练范式存在数据采集成本高、泛化能力不足等问题。清华和上海AI Lab团队提出SimpleVLA-RL,解决了VLA模型训练的核心瓶颈,在多基准测试中实现SoTA性能。
社区供稿 | GLM-4.5技术博客:原生融合推理、编码和智能体能力
文章介绍 GLM-4.5 和 GLM-4.5-Air,二者旨在统一推理、编码和智能体能力。在 12 个基准测试中表现良好,采用 MoE 架构等技术,还开源 slime 框架。文中展示其多方面应用,并说明使用方式。
“美国大豆包”Gemini翻身:输出速度碾压同行、智能水平重回第一梯队
过去 Gemini 被吐槽,如今 Google 推出 Gemini 3.8 Flash,六周内第三款 Flash、四个月内第四次更新。新模型成绩佳,输出快,成本低,智能体评测进步大,从经济型选项成生产主力,但实际表现待检验。
Qwen3-VL-Seg 深度解读:当多模态大模型学会"像素级精准手术",仅用0.4%参数碾压8B模型
文章深度解读阿里通义实验室发布的Qwen3-VL-Seg,它解决开放世界指代分割问题,用仅17M参数(占基础模型0.4%)在4B规模超越8B模型。介绍其原理、架构、数据、实验结果,还给出实战代码。
VL-LN Bench:模拟「边走边问找具体目标」的真实导航场景
上海人工智能实验室等研究者完成VL - LN Bench,模拟真实导航场景。它构建自动化数据收集管线,依托InternVLA - N1训练评测。结果显示主动对话可提升表现,但当前方法在实例感知对齐等环节有短板。