多步推理」共找到 5589 篇相关文章

产品应用8

UCSD首个智能体浏览器发布!页面设计,颠覆传统交互

加州大学圣地亚哥分校推出Orca浏览器,把网页视为可塑材料,浏览器变为可塑空间。用户能在无限画布中浏览、管理网页,调度智能体完成任务,还可进行大规模查看、管理等操作,项目将开源。

新智元
新闻资讯8

马斯克公布SpaceX火星新计划,迈向行星生命之路!

马斯克在德州Starbase公布SpaceX火星最新计划,介绍从Starbase发展、星舰生产目标、技术突破到火星城市建设等方面内容,展示人类成行星物种的清晰路线,还提及火星时间表等信息。

AGI Hunt
算法论文8

沉默的进化:LatentMAS 如何通过“潜意识通信”重塑智能体协作?

这是对智能体协作领域突破性研究的深度解读。论文提出LatentMAS框架,让智能体直接交换“思维向量”,实现“机器心灵感应”,在性能、速度和Token消耗上全方位碾压传统文本交互模式。

深度学习自然语言处理
产品应用8

实测爆火的阶跃星辰Step 3,性能SOTA,开源模态推理之王

在 WAIC 2025 前一天,阶跃星辰推出新一代基座模型 Step 3,它是开源 VLM 新晋之王,性能超同类别开源模型,与顶尖闭源 VLM 也有一战之力。该模型具备开好省特点,还展示了宏大技术生态与商业化布局。

机器之心
算法论文8

SeePhys Pro:重新审视模态物理推理中的视觉理解与训练收益

来自中山大学等的研究者提出SeePhys Pro,是面向模态物理推理的细粒度评测与训练诊断框架。发布了benchmark、训练集等,测评显示当前模型在信息模态转变时不稳定,为模型评测和训练研究提供基础。

AI科技评论
开源动态8

模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源

阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示个证明案例。

量子位
开源动态7

刚刚,OpenAI开源了两个大模型~

OpenAI开源基于GPT - OSS的安全推理模型GPT - OSS - Safeguard - 120B和GPT - OSS - Safeguard - 20B,用于安全用例。有安全推理训练、自带策略等亮点,适配不同显存,采用宽松许可证。

PaperAgent
产品应用8

揭秘!腾讯如何训练智能体像专家一样设计游戏场景

腾讯游戏提出游戏场景自动布局生成系统IntelliScene 2.0,利用图像引导生成3D场景。它构建智能体工作流,结合高质量数据集,经模型微调、视觉解析等骤生成场景,经评估效果良好,为AI生成三维信息提供新路径。

腾讯技术工程
算法论文7

无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%

当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。

深度学习自然语言处理
算法论文8

突破通用领域推理的瓶颈!清华NLP实验室强化学习新研究RLPR

现有基于可验证奖励的强化学习(RLVR)应用范围局限,清华自然语言处理实验室提出 RLPR 技术,通过 Prob - to - Reward 提高概率奖励质量,有领域无关等特点,相关代码等已开源。

机器之心