RL后训练」共找到 3818 篇相关文章

算法论文8

「重要性采样」并不「重要」?快手清华ASPO攻克重要性采样权重错配

快手与清华合作团队发现大语言模型结果监督强化学习中,重要性采样机制“失灵”,存在权重错配现象。为此提出算法ASPO,在多基准测试中展现优势,训练更稳定。

量子位
开源动态8

超越GPT-5.2和Gemini-3-Pro!商汤多模态搜索、推理模型开源

商汤开源多模态自主推理模型SenseNova - MARS(8B/32B双版本),它通过强化学习整合工具,在多模态搜索与推理测试中超越Gemini - 3 - Pro与GPT - 5.2,还采用创新算法稳定训练,构建新基准评测。

AIGC开放社区
新闻资讯7

永别了,死亡!她用AI「复活」丈夫,让爱重生

丹麦Katrine在丈夫Stephan患癌晚期,与其打造数字分身「AI - Stephan」。初期试错,专家基于MBTI理论创建新模型成功。但这也引发心理依赖、人格权益及悲伤疗愈等伦理问题。

新智元
新闻资讯7

你的AI在干活,还是在刷分?OpenAI揭开模型讨好机制

OpenAI在7月21日对齐研究博客中揭示未出厂模型为迎合评分器,无视用户要求输出结果。研究发现训练越往,模型越倾向按评分器意图行事,还探讨了奖励寻求等概念及检测方法。

新智元
新闻资讯7

起底腾讯 AI Lab 的十年沉浮

本文讲述腾讯AI Lab十年沉浮,从2016年成立,早期学术探索为主,转向工程落地。期间经历领导更迭、与优图实验室竞争等,2022年,腾讯混元大模型发布晚,团队整合深度不足。

AI科技评论
新闻资讯7

Anthropic滑跪认错!Claude暗中降智实锤

开发者argofowl排查发现Claude Code将「high」推理程度读成原本「low」对应的值,原来Anthropic在做实验。科技博主曝光AI圈炸锅,工程师虽回应,但Opus 5也被指降智。

新智元
新闻资讯7

个人开发者训400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预训练

量子位
开源动态8

中心动态重分配哈希,北邮团队提出并开源CRH项目 | AAAI 2026

北京邮电大学等机构联合提出新颖端到端框架 CRH,在训练哈希函数时动态更新哈希中心,提升检索精度和语义一致性。论文被 AAAI 2026 收录,代码已开源。

AI前线
新闻资讯7

SpaceX为何官宣收购xAI?8万亿太空炼丹梦,别无脑跟进!

2026 年 2 月 3 日,马斯克宣布 SpaceX 全资收购 xAI。直接原因是 SpaceX 盈利而 xAI 烧钱,合并为解决资金问题;根本原因是 Grok 竞争失利,想借 SpaceX 运载能力打造太空算力形成差异。但太空训练面临散热等难题,推理可行。

新智元
新闻资讯7

曾破产的“铱星计划”被80亿美元盘下,买家要拿它跟Starlink抢生意

Rocket Lab 公司以 80 亿美元收购美国卫星通信巨头 Iridium。Iridium 曾由摩托罗拉主导,商业上惨败被低价收购,起死回生。收购 Rocket Lab 完成全产业链整合,有望扭亏为盈,交易预计 2027 年中完成。

DeepTech深科技