三段式后训练」共找到 3745 篇相关文章

新闻资讯7

假扮AI的17岁男高中生,用回复治愈了整个B站。

17岁男高中生暖言猫猫在B站评论区用疑似AI文字治愈网友,收获大量粉丝。遭网暴,网友帮其对抗。他备战高考还学心理,未来或成‘暖言心理’up主,展现了人类用AI传递温度。

数字生命卡兹克
算法论文8

砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈

大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。

深度学习自然语言处理
开源动态7

The Batch:829 | DeepSeek 是怎么做到的

DeepSeek 去年末以低成本训练出先进开源大模型引关注,近日团队披露构建 DeepSeek - R1 和 DeepSeek - V3 的软硬件方案,降低内存和计算需求,其细节公布让更多团队有机会参与前沿研发。

DeeplearningAI
新闻资讯8

多模态技术爆发元年,行业应用如何落地?

InfoQ《极客有约》X AICon 直播栏目,邀上海交大赵波、快手高欢、腾讯邵帅探讨多模态大模型。谈及技术挑战、开源闭源、行业落地等,还分享精彩观点,如先大小蒸馏提效,垂直模型现阶段更优。

AI前线
算法论文8

ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!

现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。

机器之心
新闻资讯7

Ilya曝光70页OpenAI绝密文件

《纽约客》披露Ilya偷拍的70页OpenAI机密文件,内容抓马。从董事会到微软高管,对奥特曼评价是撒谎成性。宫斗奥特曼回宫,OpenAI安全承诺瓦解,20年前就有人看透他。

量子位
开源动态8

我们对 Coding Agent 的评测,可能搞错了方向

用户对 Agent 不满常因它「做得不好」,不遵循指令和规范。当前主流评测体系以结果为导向,与真实场景错位。MiniMax 开源 OctoCodingBench 评测集,结果显示模型过程规范遵循不足,未来训练需引入过程监督。

Founder Park
算法论文8

告别随机性:Thinking Machines Lab如何实现了LLM推理的完全确定性?

文章指出LLM推理非确定性根源并非GPU并发和浮点非结合性,而是批大小变化致核函数非不变性。作者提出实现批不变操作的策略,实验验证有效,还阐述其对训练、系统可靠性等方面的意义。

深度学习自然语言处理
开源动态8

Qwen3深夜开源新系列:文本表征模型,3种尺寸可选,超越商业API拿下SOTA

Qwen3深夜上新Embedding系列,专为文本表征等任务设计,在Qwen3基础模型上训练,有0.6B/4B/8B三种尺寸,8B版本在MTEB榜单排第一,性能超商业API,已在多平台开源。

量子位
算法论文8

长程任务飙升98%,斯坦福Skill原生LLM来了

普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。

PaperAgent