可验证推理」共找到 6064 篇相关文章

开源动态8

首个开源实现100%复现的稳定RL训练框架来了!2次结果完全重合

SGLang团队联合slime团队开源实现100%复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。

量子位
产品应用8

Claude Opus 4.1 上线,SWE-bench 验证率 74.5%,重构靠性与安全性全面升级

Anthropic推出Claude Opus 4.1,是Opus 4重要升级版。SWE - bench验证率从72.5%提至74.5%,多文件代码重构靠性及长链交互推理能力增强,无害响应率提升,合作率下降,定价不变。

InfoQ
产品应用7

小哥硬核手搓AI桌宠!接入GPT-4o,听得懂人话还能互动,方案复现

国外小哥Matthieu Le Cauchois受皮克斯台灯机器人启发,手搓AI桌宠Shoggoth,接入GPT - 4o,能与人互动。它结构简单复现,采用低级和高级控制层,策略经仿真和真实环境验证有效。

量子位
算法论文8

突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力

多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。

量子位
新闻资讯8

深度访谈:阿里云X平头哥,模型推理提升13倍背后的秘密

这篇深度访谈聚焦阿里云与平头哥,探讨模型推理提升13倍背后的秘密。随着AI焦点转向推理,行业面临算力、成本、监管等矛盾。嘉宾分析推理范式现状与变化,探讨推理加速技术及优化策略,还谈及瓶颈、未来发展及竞争方向。

InfoQ
算法论文8

面对无解问题大模型竟会崩溃?港中文&华为联合提出首个大模型推理靠性评估基准

港中文和华为诺亚实验室联合提出ReliableMath基准,探究大模型推理靠性。提出评估准则,构建含解与不解问题的ReliableMath数据集,实验揭示大模型缺陷,还提出提高靠性的对齐策略。

机器之心
新闻资讯7

GPT-5正以o3的三倍速度打宝梦,现已抵达冠军之路,直播进行中

GPT - 5直播独立运行宝梦红版,速度比o3快近三倍,6105步抵达冠军之路,而o3需16882步。原因是其幻觉少、空间推理和规划能力强。直播已进行9小时,超2000人关注,OpenAI总裁点赞。

AGI Hunt
产品应用7

苹果憋一年终超同参数 Qwen 2.5?三行代码即接入 Apple Intelligence,自曝如何做推理

今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。

AI前线
产品应用7

自写驱动越狱!Gemini 3 Pro零败绩通关宝梦:效率碾压前代8倍「Agent进化太快了」

在全自动《宝梦 水晶版》对决中,Gemini 3 Pro击败Gemini 2.5 Pro,通关速度至少快2倍,前代或慢8倍。它还展现出诸多能力,如自写驱动绕过限制等,但也存在不验证假设等局限。

AI寒武纪
开源动态8

4B小模型数学推理首超Claude 4,700步RL训练逼近235B性能 | 港大&字节Seed&复旦

香港大学NLP团队联合字节跳动Seed、复旦大学发布Polaris强化学习训练配方,让4B模型数学推理能力超商业大模型,且Polaris-4B在消费级显卡部署,相关内容已全部开源。

量子位