信息质量」共找到 1262 篇相关文章

算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试和精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
新闻资讯7

Meta发布40页报告,具身智能的下一步是「心智世界模型」:能听,能看,能理解,会共情

Meta发布40页报告,首次将对人心智状态的推断概念化为心智世界模型,与物理世界模型实现“双轨建模”。还指出要结合系统A和B让AI自主学习,心智世界模型在多智能体协作潜力大。

量子位
算法论文8

无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention

质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。

机器之心
新闻资讯7

Sam Altman邮件证实,OpenAI将开发硬件语音AI Agent

今天凌晨,OpenAI的Sam Altman回应删除与Jony Ive信息一事,公布与iyO交涉邮件,透露收购io是为开发硬件语音AI Agent。iyO曾邀OpenAI投资、合作,演示失败后被弃,双方因名字打官司。

AIGC开放社区
产品应用7

Claude Code 强大的秘密究竟是什么?

Claude Code 强大源于其强大模型基础、丰富实用的内置工具、不压缩上下文信息及无 IDE 包袱等优势。相比之下,OpenAI 的 Codex 因模型能力、强化训练不足等落后,Anthropic 还靠亏本推广积累数据。

宝玉AI
算法论文8

AI哪怕答案正确,逻辑链却惨不忍睹,奥数级不等式证明成功率不到50%| 斯坦福&伯克利&MIT

斯坦福、伯克利、MIT等联合研究,系统评估29个大模型在奥数级不等式证明任务的能力。研究发现,模型答案正确多靠猜,推理漏洞多,参数大、思考久也不能提升推理严谨度,但自我反思和定理线索策略有改善效果。

量子位
产品应用7

为什么又是杭州?杭州初创团队打造全球第一个AI旅行伙伴

杭州初创团队打造的iMeanAI Coyage是全球首个AI旅行伙伴,能解决旅行规划中选择困难和信息过载问题,如订机票、酒店、行程,经测试表现出色,还将开放多语言语音导览功能。

AI工程化
新闻资讯7

o3-pro答高难题文字游戏引围观,OpenAI前员工讽刺苹果:这都不叫推理那什么叫推理

OpenAI“最新最强版”推理模型o3 - pro引发关注。首位全职提示工程师给它设难题,它推理后答对。OpenAI前员工借此讽刺苹果。各大评测榜单显示其表现与官方有差异,苹果&SpaceX前工程师分享使用心得,肯定其表现。

量子位
算法论文8

5700问答对全面评估拷问AI空间感!最新空间智能评测基准来了丨浙大&成电&港中文

当前视觉语言大模型空间信息学习片段化,缺乏多维度空间推理能力。浙大、成电和港中文团队提出ViewSpatial - Bench基准体系,评估主流模型,揭示其缺陷,并开发MVSM优化跨视角空间理解。

量子位
开源动态7

一文彻底搞懂 MCP:AI 大模型的标准化工具箱

MCP(模型上下文协议)是 Anthropic 于 2024 年 11 月开源的新技术,是 AI 大模型的标准化工具箱。它能让大模型与外界互动、获取信息、完成任务,整合 Function Call 标准,几乎所有大模型都可接入。

机器学习AI算法工程