多步推理」共找到 5594 篇相关文章

新闻资讯8

通用Agent是伪命题?昆仑万维方汉现场拆解:垂直推理才是胜负手|新智元十年峰会

在新智元十周年峰会上,昆仑万维董事长方汉分享公司转型故事与模态AGI见解。他认为通用Agent非万能,垂类推理数据是关键,还提出AI商业落地逻辑,展示款产品成果。

新智元
新闻资讯7

GPT-5终于来了!在惊喜不的时代,它是否值得我们的等待?|甲子光年

北京时间8月8日凌晨1点,OpenAI正式发布新模型GPT-5。它是目前最强通用模型,在方面全面进化,将成ChatGPT默认模型。不过它虽有进,但未掀起革命,GPT系列或难有飞跃,而OpenAI仍规划了未来发展。

甲子光年
产品应用8

神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

小米全新一代面向 Agent 的大模型家族官宣,包括 MiMo-V2-Pro Preview、MiMo-V2-Omni 和 MiMo-V2-TTS。MiMo-V2-Pro 性能优异,在场景实测表现出色,技术有创新,API 开放且定价低,已融入小米业务与生态。

机器之心
算法论文7

视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K

视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 个任务、2.6 万个决策骤,有细致模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估个模型。

带你学AI
算法论文8

突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的轮强化学习框架MGPO

先进模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。

机器之心
算法论文8

攻克AI过度思考难题!美团新研究让通过“可验证”过程奖励激活LRM的高效推理

美团等机构研究团队针对LRM“过度思考”问题,提出可验证的过程奖励机制(VSRM)。它结合可验证奖励与骤级奖励,为推理骤分配奖励信号。实验显示其能降低输出长度并保持性能。

量子位
开源动态7

单Agent时代结束,AI们开始组团上班

月之暗面发布并开源K2.6,重点升级代码能力与Agent协作的“Agent集群”能力。K2.6在Artificial Analysis上取得全球开源第一,实测能并行交付格式成果,还展现出强大的全栈应用开发能力。

量子位
开源动态8

模态大模型学会“反思”和“复盘”,上交&上海AI Lab重磅发布MM-HELIX&AHPO,破解模态复杂推理难题

上海交通大学和上海人工智能实验室研究团队带来MM - HELIX,这是完整生态体系,赋予AI长链反思性推理能力。其含基准测试、数据集、优化算法,搭载相关技术的模型表现优异,部分成果已开源。

量子位
产品应用7

Qwen“半成品”推理模型刷下AIME满分,俘获大批国外开发者!实测碾压GPT-5 Thinking、还能写侦探小说

阿里发布 Qwen3-Max-Thinking 早期预览版,虽是‘半成品’,在数学推理竞赛中达 100% 正确率。Qwen3-Max-Preview 项测试领先,速度超 ChatGPT,还成 AnyCoder 默认选项,但未开源。实测表现有优有劣。

AI前线
开源动态8

腾讯智能体开源大动作!关键技术都拿出来了,开发平台还全面升级

在2025腾讯全球数字生态大会上,腾讯云智能体开发平台3.0(ADP3.0)面向全球上线,关键智能体技术将持续开源。新版本功能更新,还有个落地案例,如帮伊利、华住等落地智能体。腾讯优图实验室也有开源计划。

量子位