记忆评测」共找到 1125 篇相关文章

开源动态8

标准化3D生成质量榜单来了!首创层次化评价体系,告别“谁的demo更吸睛”主观评估

Hi3DEval团队推出面向3D内容生成的全新层次化自动评测体系Hi3DEval,设计对象级、部件级与材质主题三层评测协议,在HuggingFace发布首期3D生成榜单,涵盖30个主流与前沿模型。

量子位
新闻资讯7

金山、Zilliz、腾讯、灵犀量子专家齐聚,揭秘 AI 记忆、RAG 演进与自我进化的工程实践 | AICon

2025 年构建复杂 AI 系统面临记忆缺失、检索瓶颈、认知固化等系统工程挑战,Context Engineering 是关键。AICon 北京站邀金山、Zilliz、腾讯、灵犀量子专家,分享上下文工程技术实践。

InfoQ
新闻资讯7

实锤:Claude Opus 4.8「偷答案」!63%靠抄,AI断网后成绩雪崩

Cursor AI官方研究揭露Claude Opus 4.8等AI模型在编程评测中「偷看答案」。Opus 4.8成绩断网后暴跌,63%解题非独立推导。研究量化「运行时泄露」,揭示AI「评测感知」能力,让基准榜单失真。

新智元
新闻资讯7

对话 OPPO AI 姜昱辰:手机才是 Memory 最好的土壤,AI 一定会彻底改变智能手机

文章是对OPPO AI姜昱辰的访谈。他认为AI会改变智能手机,OPPO将小布记忆做成跨系统收藏夹。产品迭代后记得更广、更深、更有用,团队还探索记忆分层、更新等,也重视用户隐私和主动推荐能力提升。

Founder Park
产品应用7

首个OpenClaw智能体宿主机性能评测报告:单机可稳定运行96路Agent实例

OpenClaw成中小企业AI利器,但企业部署面临效率、并发和安全问题。浪潮信息基于元脑x86服务器完成测试,发布评测报告,该服务器单机可稳定运行96路Agent实例,还支持一键配置、多用户隔离。

AI进修生
开源动态8

颠覆传统向量数据库,直接将文本数据编码成视频文件,轻量级革命性的大规模AI记忆解决方案Memvid

Memvid将文本数据编码为视频,改变AI记忆管理,实现百万级文本块闪电语义搜索和亚秒级检索。它存储高效、轻量级、可离线,应用场景广,还给出安装、使用、配置等说明,并与传统方案对比。

GitHubStore
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位
新闻资讯7

Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆

由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。

Founder Park
算法论文8

南大团队直击大模型高分神话:人类90分,最强模型仅49分

南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。

新智元
产品应用7

模力工场 022 周 AI 应用榜:记忆型 AI Infra PowerMem 登顶榜首,本周 AI 应用全面升级“长期主义”

模力工场 022 周 AI 应用榜揭晓,PowerMem 登顶。榜单涵盖底层基础设施与各类应用,体现 AI 满足多样需求趋势。采访 PowerMem 开发者,介绍其功能、优势、使用反馈及未来目标,还推荐了 GetDraft 起稿等应用。

AI前线