两阶段后训练方法」共找到 3667 篇相关文章

新闻资讯8

躲了科学家几十年的流体不稳定奇点,被DeepMind用AI找到了

谷歌DeepMind与多所高校合作,用物理知情神经网络(PINN)+高精度数值优化的方法,找到了流体方程里的不稳定奇点。这种奇点很“挑剔”,此前难寻踪迹,此次发现为非线性流体动力学研究提供新范式。

量子位
产品应用8

kimi 的RL end2end ON LLM

文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。

Agent的潜意识
开源动态8

最大开源第一视角数据集 EgoLive 来了,名校站台、近百家机构争相申请

今年4月京东开源业界最大人类第一视角数据集EgoLive,已获近百家机构申请。它用自研设备采集,经多模态处理,覆盖多场景任务。其数据用于JoyAI - RA训练,在真实场景验证效果好,还推动具身智能数据标准化。

InfoQ
算法论文8

ACL 2026|打破推理同质化!阿里达摩院新作让RLVR从重复采样走向有效探索

阿里达摩院智能决策团队提出面向RLVR后训练的探索增强框架I²B-LPO,改进rollout策略,在关键节点生成更具区分度的推理轨迹,结合信息瓶颈自奖励机制,在多个数学基准上提升准确率与语义多样性。

机器之心
产品应用7

Unsloth让大模型跑在手机上!

Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。

AI工程化
开源动态8

Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型

Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。

AGI Hunt
产品应用7

为什么Cline不对你的代码库进行索引(以及为什么这是好事)

用户常问Cline如何处理大型代码库,是否用RAG索引全部代码。Cline特意选择不对代码库进行索引,因为传统RAG方法用于代码库有逻辑切割、索引过时、安全风险等问题。Cline像开发者一样处理代码,有独特优势。

宝玉AI
推荐文章7

对话蚂蚁吴伟:训推一体池化调度,如何把GPU用到极限

AICon大会前,与蚂蚁集团吴伟深度对话,探讨GPU资源调度解法。他指出CPU和GPU有结构性差异,只在推理或训练内优化有资源闲置,国产卡缺全链路生态,软件优化有天花板。还分享架构思路、算法及落地效果等。

InfoQ
开源动态7

一年后,DeepSeek-R1的每token成本降到了原来的1/32

几天前,DeepSeek更新R1论文至86页,公开训练全路径等细节。英伟达发表博客展示在Blackwell GPU上对其降本增效,通过软硬协同提升每瓦特Token吞吐量,还介绍了TensorRT - LLM软件及相关技术提升性能的情况。

机器之心
推荐文章7

别再设计 Prompt,顶尖工程师已经开始写 Loop 了!

2026年6月,“Loop Engineering(循环工程)”一词热门起来。其核心主张是不用再亲自给AI写提示词,而是设计驱动Agent的循环。Anthropic的工程师还写成了完整手册,介绍搭建方法、关键及最佳实践等。

特工宇宙