多领域推理」共找到 6394 篇相关文章

算法论文8

BRIGHT榜单SOTA!人大&百度ReasonRank:用推理增强的段落重排序器

传统listwise在复杂查询表现差,近期工作泛化性不佳。人大与百度等提出ReasonRank,通过全自动合成13K推理数据及两阶段训练,在BRIGHT等榜单表现优异,且ReasonRank-7B比Rank1-7B快2.5倍。

PaperAgent
开源动态8

仅用图像也能Think:Google等提出一种视觉规划的全新推理范式!

剑桥和Google等提出并开源视觉规划范式,通过纯视觉表示规划,独立于文本。还引入VPRL框架,用GRPO后训练大型视觉模型。实验选三个视觉导航任务,VPRL表现最佳,显著优于其他方法。

PaperAgent
开源动态8

不只DeepSeek,阶跃等开源JetSpec:大模型解码提速近10倍

近期,DeepSeek 推出 DSpark,阶跃星辰提出 JetSpec,都关注大模型推理效率。DSpark 关注验证效率,JetSpec 提高有效 Token 生成率。二者切入点不同,但都显示大模型行业进入新阶段,推理效率成 Agent 落地基础变量。

机器之心
新闻资讯7

The Batch:836 | 基准测试成本攀升

独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。

DeeplearningAI
算法论文7

AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板

MMAR基准测试对30款音频相关模型进行测试,结果显示,数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。

量子位
新闻资讯8

Gemini 3 Flash 发布,、快、好、省,Coding 能力不输大哥Gemini 3 Pro

Google DeepMind 发布 Gemini 3 Flash,成本极低。它在项测试表现出色,速度快、效率高,代码能力超 Gemini 3 Pro,获企业客户好评,今日起向全球开发者和普通用户推送。

AGI Hunt
算法论文8

告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜

DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决模态过程奖励模型训练难题,能与模态大模型集成,提升推理能力,实验效果显著。

机器之心
新闻资讯8

2025宝山·智能机器人产业大会暨嘉年华隆重开幕

2025年11月21日,‘2025宝山・智能机器人产业大会暨嘉年华’在智慧湾科创园开幕。领导、院士专家、企业代表齐聚。会上发布行动方案,启动个平台与中心,完成项目签约与揭牌,还有主旨演讲及场活动。

机器之心
产品应用8

Codex 大更新:一个 AI,接管你所有软件。

Codex 迎大更新,有望成 OpenAI 超级应用核心。它能与工具协作,超 300 万开发者在用,近半使用场景非写代码。具备跨应用 Agent、非编码任务处理等功能,还增添图像生成等特性。

AI进修生
产品应用7

智能PPT生成系统

MultiAgentPPT是基于A2A + MCP + ADK的智能体系统,能流式并发生成高质量PPT。它通过智能体协作,从大纲生成到内容汇总,提高效率与准确性,还介绍了使用界面、项目结构、快速开始步骤等。

GitHubStore