和差集」共找到 7385 篇相关文章

算法论文8

AI"学霸"也解不出高中题?耶鲁、复旦发布MMSciBench,揭示AI理科推理能力短板

耶鲁、复旦等推出MMSciBench评测基准,揭示主流模型复杂科学推理短板。它有高质量数据、多模态多题型测试精细知识分类体系。测试发现模型图文融合及推理能力弱,英文推理或效果更好。

深度学习自然语言处理
算法论文8

ACL 2026 | OPeRA Dataset: LLM真的能模仿人类行为了吗?首次系统评估LLM的人类行为模拟能力

美国东北大学等机构研究者提出OPeRA数据,采真实用户在线购物行为,支持系统评测LLM个体化行为预测能力。实验显示当前主流LLM在模拟人类行为上表现有限,揭示其能力边界。

机器之心
新闻资讯7

微软急了!紧急腰斩AI产品销售指标,内部拉响红色警告

微软AI市场遇冷,多个AI产品部门下调销售目标,如Azure AI等。原因一是自身产品未落地,体验;二是过度依赖OpenAI、英伟达等伙伴。而谷歌势头正劲,抢占其份额。

量子位
开源动态8

SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster

香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码数据均已开源,在各项指标上优于SOTA方法。

机器之心
开源动态8

刷新复杂Agent推理记录!阿里通义开源网络智能体超越DeepSeek R1,Grok-3

互联网信息检索中,复杂问题让普通开源模型力不从心。阿里通义实验室提出WebSailor方案,通过SailorFog - QA数据DUPO算法等创新,提升模型能力,在多基准测试中超越诸多开闭源模型。

量子位
算法论文8

超越 VTM-RA!快手双向智能视频编码器BRHVC亮相NeurIPS2025

视频编码中双向编码潜力待挖掘,快手音视频技术团队提出BRHVC方法,解决长跨度帧运动处理参考贡献不平衡问题,其成果被NeurIPS 2025录用,在压缩性能上超越VTM - RA编码。

机器之心
算法论文8

AI画手总是六根手指?阿大/美团/上交首次系统量化扩散模型计数幻觉

阿德莱德大学、美团上海交通大学团队首次系统研究扩散模型“计数幻觉”问题。构建CountHalluSet数据套件量化该问题,揭示其与采样条件的关系,还提出JDM模型缓解计数幻觉。

量子位
开源动态8

96.6%召回率,0美元成本:这款开源AI记忆系统凭什么超越一切付费方案

AI记忆困扰技术人,MemPalace开源AI记忆系统解决痛点。它可本地运行、0成本,召回率最高达100%,采用独特结构设计AAAK语言,还能通过MCP提供工具能力,且团队诚实说明偏

小华同学ai
新闻资讯7

DeepSeek V3.1 突发离谱「极」字Bug的原因找到了~

DeepSeek V3.1被曝恶意漏洞,生成文本时会突然插入“极”字。该漏洞在第三方API平台官方Playground均有出现,可能因数据“污染”或模型“偷懒”,严重影响高精度场景。

PaperAgent
算法论文8

复旦提出自适应Reasoning方法ARM,“能屈能伸”

复旦提出自适应Reasoning方法ARM,解决LLM‘过思考’问题。ARM内置四种解题策略三种决策模式,还搭配Ada - GRPO算法,在23个数据测试中表现出色,省token、提速度且准确率高。

深度学习自然语言处理