大模型推理」共找到 9477 篇相关文章

算法论文8

联手通义实验室发布ZeroSearch:成本暴降88%,无需搜索即可激活语言模型的检索能力!

与通义实验室发布ZeroSearch框架,可无需真实搜索激活语言模型检索能力。它引入语言模型模拟搜索、采用结构化模板等策略,成本降88%,多项实验显示其性能超越基线与真实搜索方法。

深度学习自然语言处理
产品应用8

揭秘夸克首个高考志愿模型!蒸馏数百名人类专家经验、Agent 可完整生成志愿报告

6月12日,夸克发布国内首个高考志愿模型,上线‘高考深度搜索’等三核心功能。其‘志愿报告’以Agent运行,能输出完整报告;模型经多阶段训练,搭载最高考知识库,为考生提供精准志愿填报服务。

AI科技大本营
新闻资讯8

AI秒破18世纪「天书」账本!谷歌新模型盲测刷屏全网

谷歌AI Studio上一神秘模型引发关注,它识别200多年前商人的「天书」账本,修正格式错误与模糊表述,推理能力令历史学家震惊。该模型解决手写识别和推理难题,或为谷歌将推的Gemini - 3。

新智元
算法论文8

均值至上假繁荣!北新作专挑难题,逼出AI模型真本事

当强化学习成模型后训练核心工具,主流方法陷入「均值优化陷阱」,推理能力停滞。北团队提出RiskPO,将风险规避理念融入优化目标,用MVaR+捆绑策略双管齐下,三任务表现优异。

新智元
开源动态8

浙江学联合华为发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础模型

2025年9月18日,浙江学任奎教授团队联合华为在“华为全联接会2025”发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础模型,提升了我国AI系统自主安全防控水平,该模型已全面开源。

AIGC开放社区
算法论文7

多模态模型具备“物理推理能力”了吗?新基准揭示:表现最好的GPT-o4 mini也远不及人类!

来自多机构研究人员构建PhyX基准测试,评估多模态模型物理推理能力。测试显示,即便表现最佳的GPT - o4 mini准确率仅45.8%,远不及人类的75.6%,且模型在多方面存在结构性缺陷。

量子位
算法论文8

语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
新闻资讯8

突发!OpenAI「掀桌」:自研推理芯片「墨西哥辣椒」跑赢英伟达

OpenAI公布自研推理芯片Jalapeño(墨西哥辣椒)测试结果,它专为语言模型推理设计,能同时提升吞吐量和降低延迟,在多模型测试中超NVIDIA系统。该芯片与Cerebras合作,计划2026年底部署。

机器之心
新闻资讯8

全球顶尖模型一夜惨遭血洗!最难测试人类拿满分,AI第一名得0.2%分

全球最难AGI测试ARC - AGI - 3上线,人类满分通关,最强模型Opus 4.6仅得0.2%。测试从静态题变为互动游戏,评分看效率。前沿模型得分低,非LLM方案表现更好,AI缺乏元认知能力。

新智元
算法论文8

ACL 2025 | GALLa:给代码模型装上“透视眼”,看懂程序的“骨架”!

蚂蚁集团与上海交合作的 GALLa 研究被 ACL 2025 主会录用。它利用图神经网络将代码图结构信息注入模型,在 7 个模型和 5 个任务上提升性能,推理与普通 LLM 一致,不增成本。

PaperAgent