推理训练」共找到 3553 篇相关文章

开源动态8

突破传统检索瓶颈!阿里通义实验室发布 WebDancer,开启多步推理智能体新范式!

在信息爆炸时代,传统检索技术缺乏动态决策能力,难以满足多步推理需求。阿里通义实验室发布的 WebDancer 基于 ReAct 框架,通过四阶段构建,在测试中表现优异,未来规划拓展工具生态、突破任务边界等。

开源星探
新闻资讯8

OpenAI杀疯了!内部神秘模型首次斩获信息学奥赛IOI 2025金牌,碾压98%人类选手

OpenAI研究员官宣其内部研发的AI推理系统在2025年国际信息学奥林匹克竞赛获金牌,超越98%人类选手。该系统在模拟人类环境下靠推理解题,用通用模型,一年间成绩大逆转,近期在多赛事表现出色。

AI寒武纪
算法论文8

提示工程死亡?不,它刚刚重生为计算科学:一篇讲透Prompt设计的科学基础

大型语言模型在多步推理任务中受挫,因Transformer架构有计算深度限制。本文建立提示设计理论框架,揭示提示是信息选择器,优化提示可使推理性能提升超50%,将提示设计从试错艺术变为可计算科学。

深度学习自然语言处理
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所、腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。

深度学习自然语言处理
算法论文8

LLM内部竟藏着众多策略模型?自所&腾讯团队首次揭示大模型RL新机制

中国科学院自动化研究所与腾讯AI Lab团队从可解释性分析出发,发现LLM内部含多个可采样内部策略,揭示不同模型推理熵模式,提出BuPO算法,在复杂推理任务上性能显著优于传统算法。

深度学习自然语言处理
算法论文7

英伟达发现RL Scaling!创造力暴涨,做基座模型做不了的事!

过去学界争论强化学习(RL)对语言模型的作用,此前研究认为其效果有限。本文发现问题出在训练时间短,提出ProRL,让训练突破2000步以上,结果惊人,小模型也能有出色表现。

深度学习自然语言处理
算法论文7

SOTA大模型遇上加密数据评测:Qwen3未破10%,o1也栽了丨上海AI Lab等联合研究

当前推理模型在基准测试中性能卓越,但在密码学领域推理能力待探索。上海AI Lab等推出CipherBank评测,用海量真实隐私场景数据和多类型密码算法挑战SOTA大模型,结果显示模型表现不佳,还分析了模型“犯难”原因。

量子位
算法论文7

多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合

清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。

量子位
算法论文8

最新研究揭示视觉模型与人脑的对齐机制

FAIR与巴黎高等师范学院通过训练自监督视觉Transformer模型(DINOv3),评估脑 - 模型相似性。发现模型大小、训练数据量和图像类型影响相似度,DINOv3学到的表征会逐步与人脑一致。

量子位
推荐文章8

她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽

本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。

量子位