「测试时强化学习」共找到 3001 篇相关文章
Meta|提出RECAP,通过动态目标重加权回放,解决RLVR遗忘【文末送书!Agent相关】
近年来,可验证奖励强化学习(RLVR)提升了大模型在多任务上的性能,但带来“能力退化”问题。Meta等提出RECAP策略,结合“回放”与“动态目标重加权”,保持模型通用能力,提升推理性能,还提高推理效率。
Mira Murati 创业公司首发长文,尝试解决 LLM 推理的不确定性难题
OpenAI前CTO Mira Murati创立的Thinking Machines Lab首发文章《克服LLM推理中的不确定性》,指出大语言模型推理难获可复现结果,深入探究其不确定性根源,提出使核函数具备批次不变性的方法并给出实现与实验。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
独家 | 腾讯X Lab 韩磊即将离职,将加入诺亦腾科技
AI 科技评论独家获悉,腾讯具身智能技术中心副总经理韩磊 7 月底离职,将加入诺亦腾科技。韩磊在多智能体强化学习成果多,其参与研究登上《Nature Machine Intelligence》2024 封面,加入诺因该司有大量动捕数据。
从网页截图到精准复刻只需30秒:这个新模型刷新了我的认知
智谱AI发布GLM - 4.6V系列模型,是首个支持工具调用的视觉模型。作者对其进行7个场景测试,如识别鸟类、分析赶海地点等,展现出不错性能。该模型速度快、开源,有优势也有小问题,适合开发者和普通用户。
OpenAI 广告续命遭全网骂,用户要跑路Gemini!需烧 400 亿,18个月破产预警
OpenAI计划在ChatGPT对话界面向美区免费版和低价订阅用户测试广告投放,旨在拓展营收缓解成本压力。此举动引发批评,用户转向Gemini。OpenAI虽营收增长,但算力投入大,首席财务官称加广告会坚守三大原则。不过,有预测称其18个月内或破产。
纯血国产!4B模型越级打怪,杀入万亿赛道
9月1日,Hugging Face上线星火X2.5-4B和1.7B开源端侧模型,在多指标测试中表现优异,实现“越级打怪”。该模型基于全国产算力平台训练,在断网笔记本上实测效果惊艳,使用了两项技术提升能力,适配性强。
参数破万亿!阿里Qwen3-Max-Thinking发布,编程能力“踢馆”Gemini与Claude
阿里发布总参数超万亿的Qwen3 - Max - Thinking,预训练数据规模达36T Tokens。在多项权威测试中表现优异,能与顶级闭源模型竞争。引入两项核心创新,千问App等已上新,网友认可其能力与更新速度。
刚刚,中国AI闯入全球编程前二!前面只剩Claude
Code Arena最新榜单出炉,Qwen3.7 - Max以1541分冲进全球第四,是前五中唯一非Claude模型。它在多项测试中表现出色,是为长时间自主执行任务设计的Agent基座模型,编程跃升或与环境扩展、长程自主执行训练方法升级有关。
Claude 通过率不到 4%,SaaS-Bench 撕碎了 Computer-Use 的「全自动办公」幻想
UniPat AI用SaaS - Bench测试,让Agent在真实工作环境中执行任务。结果显示,Claude Opus 4.7端到端完全通过分数仅3.8%,多数模型表现差,还暴露Agent四种致命缺陷,揭示其与真实工作能力有巨大鸿沟。