「两阶段后训练方法」共找到 3685 篇相关文章
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
MiniMax重磅开源M1模型:百万上下文超DeepSeek R1,实现性能与效率双杀
MiniMax正式开源首个推理模型M1,原生支持百万级上下文长度,在推理效率、计算成本和复杂任务能力上有独特表现。其在性能和效率上超越DeepSeek R1等模型,还提出创新强化学习算法。
不盲目跟风:消息代理选型实战指南
消息系统在分布式架构中至关重要,消息代理选型常缺系统方法。文章剖析 Apache Kafka 与亚马逊 SQS 特性,对比它们在命令、ECST、事件通知三种消息模式下的适配性,为选型提供参考。
OpenAI官方发布【Codex 上手指南】
OpenAI 昨晚推出 Codex 研究预览版,这是强大的远程编码智能体,能导航代码库、解答疑问等。官方还发布使用指南视频,介绍了快速上手步骤、工作方式,以及提升效能的方法。
王炸!微软AI Agent支持A2A、MCP协议,智能体黄金时代降临
今天凌晨微软官网宣布Azure AI Foundry和Microsoft Copilot Studio支持Agent开发协议A2A,还会与谷歌合作扩大该协议。此前微软已支持MCP,两协议能打破智能体诸多壁垒,提升开发、自动化效率。
刚刚,中国语音AI连拿多项全球第一!
本文报道阶跃星辰推出StepAudio 3全系列五款音频大模型,覆盖听、说、理解、交互、创作全语音链路,拿下三项第三方评测全球第一,分析了语音AI行业从单点竞赛转向全栈体系竞争的新趋势。
让代码接管世界演化,西湖大学发布Code视频世界模型
西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。
“大脑在硅谷,身体全靠中国!”机器人泰斗揭秘真相:后空翻只是杂耍,端起咖啡才是真AI
在最新一期播客中,机器人学泰斗 Sergey Levine 与 Ryan Peterman 深度对话,触及行业焦点如机器人发展阶段、波士顿动力淡出原因等。他强调,机器人技术尚处底层搭建期,需重视先验知识、软硬件结合,跨越鲁棒性门槛。
刚刚,Claude两个新模型曝光!
开发者在Anthropic的API中发现Claude的两个新模型代号claude - marshmallow - eap和claude - melon - eap,目前处于内部测试阶段。社区有多种推测,且Anthropic命名风格改变,新模型或下月发布。
刚刚,GPT-6代号再泄露!或将周四见
据传GPT - 6本周将发布,OpenAI「义父」爆料Codex接入最强Astra模型,其内部代号「mewfour」泄露。Astra内部版已解决多个数学难题,成本仅约2000美元,还或达网络安全最高能力阈值,可能开启多智能体原生时代。