测试成绩」共找到 1889 篇相关文章

开源动态8

Meta开源首个320亿参数代码世界模型CWM

Meta FAIR发布320亿参数的研究模型Code World Model (CWM),用“世界模拟”方式处理代码,试图真正“理解”代码逻辑。它在Math - 500数据集测试成绩亮眼,模型权重开放,可多渠道下载。

AI工程化
新闻资讯8

刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+

北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。

机器之心
开源动态8

刷新SOTA高出19.05分!英伟达开源OmniVinci全模态理解模型,只用1/6的数据,实现全方位超越

英伟达研究团队发布OmniVinci研究,该全模态理解大语言模型用六分之一训练数据,在全模态理解基准测试成绩超现有顶尖模型19.05分。它靠创新架构和数据策略实现效率与性能双突破。

AIGC开放社区
新闻资讯7

上下文窗口限制被打破:Subquadratic推出了一个1200万Token的窗口

2026 年前沿模型宣传至少 100 万 Token 上下文窗口,但利用不佳。Subquadratic 推出能处理 1200 万 Token 窗口的模型,称可绕过问题,还将推 5000 万窗口模型,其 SSA 架构有优势,基准测试成绩佳。

InfoQ
开源动态8

商汤SenseNova U1深度拆解,原生统一架构终结缝合时代

文章深度拆解商汤科技开源的新一代模型「日日新 SenseNova U1」,介绍其基于 NEO - Unify 原生统一架构,在数据、训练与推理深度协同,多维度测试成绩亮眼,代表多模态从拼接走向原生建模新方向。

机器之心
开源动态8

字节Seed团队发布Seed1.5-VL,用仅20B活跃参数在60个主流测试中狂揽38项第一!

字节Seed团队发布Seed1.5-VL,仅200亿活跃参数就在60个主流测试中获38项第一。介绍其架构、预训练、后训练等情况,评估表现出色,虽处理复杂场景有局限,但仍在多模态任务取得显著进展。

深度学习自然语言处理
新闻资讯7

GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍

Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。

量子位
开源动态8

《生化危机》女主演跨界AI拿SOTA了!打造免费“AI记忆系统”爆火GitHub

《生化危机》女主角Milla Jovovich与程序员老友及Claude合作,打造开源免费的AI记忆系统MemPalace。该系统在多项测试成绩优异,采用“记忆宫殿法”,检索效率提升34%,还设计了AAAK语言,成本低且精度高。

量子位
开源动态8

8.5K星 Agent 记忆准确率 94.6%,RAG那套被打穿了

AI Agent常没记忆,每次对话像白纸。Hindsight(vectorize-io/hindsight)有8500+ star,是仿生记忆系统,分三层记忆,检索系统TEMPR四路并发,在测试成绩优异,且上手简单,能让Agent从经验学习。

CourseAI
开源动态8

谷歌Gemma 4全系开源:3.8亿激活超越20倍体量模型,手机秒变AI工作站

谷歌发布Gemma 4全系列开源模型,有4个尺寸。它在硬件适配、注意力机制等方面革新,能在手机等设备运行,在测试成绩出色,还获多平台支持,谷歌发起挑战赛鼓励开发者。

AIGC开放社区