验证者法则」共找到 1239 篇相关文章

开源动态8

给机器人一个会预测未来的Critic,VLA强化学习直接起飞

OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。

机器之心
新闻资讯8

人类最后考试已不够用,Agent最后考试来了!

AI飞速进步,人类最后考试(HLE)已不够用,伯克利牵头推出智能体最后的考试(ALE)。ALE真实、全面、可验证,当前最强AI在最难档通过率仅8.6%,主流系统平均2.6%,显示AI距替人干活尚远。

AIGC开放社区
开源动态8

准确回答视频细节!11B模型挑战视频理解「证据级」任务,开源可商用

近日,复旦大学邱锡鹏教授领衔的OpenMOSS团队联合模思智能开源11B参数的多模态视觉理解模型MOSS-VL。它能准确回答视频里可被验证的细节、时间、过程和空间关系,有六项证据级能力,架构设计独特,采用Apache2.0开源许可。

量子位
算法论文7

MOE RL实战:统一FP8全流程训练

SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。

GiantPandaLLM
算法论文7

苹果提出新型反向传播:一台iPhone 15 Pro Max就能微调LLM

苹果提出内存高效型反向传播(MeBP),可在内存使用量和计算时间上比零阶优化(ZO)有更好权衡,收敛更快、性能更优,还在iPhone 15 Pro Max验证其有效性,且公开了实现链接但目前为空。

机器之心
新闻资讯7

也许,该庆幸在这个时代被裁员

文章借一位失业基于AI做产品的感慨,引出对GPT - 5发布的讨论。GPT - 5升级后被中外用户吐槽没人味,OpenAI 24小时内恢复GPT - 4o访问权限,还推出三种响应模式,这引发了对AI与人关系的思考。

MacTalk
算法论文8

超越GPT-4o!华人团队新框架让Qwen跨领域推理提升10%,刷新12项基准测试

加拿大滑铁卢大学与TikTok新加坡的华人团队提出全新训练框架General - Reasoner,让Qwen系列大模型跨领域推理准确率提升近10%,在多项基准测试中超越GPT - 4o。该框架有全领域推理数据集和生成式答案验证器两大创新。

量子位
推荐文章7

用AI写代码的真实体验:聪明却“不靠谱”的顾问,你敢用吗?

Luke Kanies曾是AI与LLM怀疑,试用Vibe Coding后,认为要把AI当不太靠谱的外部顾问。用AI学Swift编程,发现它是糟糕架构师,但找语法错误快,相处中可让其做琐碎工作,不能全信它。

宝玉AI
开源动态7

14k颗星!你的电脑屏幕,正在成为AGI的“眼睛”!这款开源神器让你一键记录所有操作

介绍开源项目ScreenPipe,它是跨平台桌面数据抓取API,能全维度记录数据,有沙盒化插件系统等功能。因能为AGI提供数据、对开发友好而火,还给出安装和创建插件命令,称其有成为AGI时代“现实采集器”的野心。

GitHubStore
新闻资讯7

OpenAI自研芯片270天光速成功!谷歌TPU大将主导,老黄一夜大客户变对手

OpenAI发布自研推理加速芯片Jalapeño,与博通和Celestica合作打造,专为大模型优化,9个月就流片。操刀是前谷歌TPU核心成员Richard Ho,计划2026年底部署。此前谷歌、微软等已自研芯片,英伟达客户变对手。

量子位