「泛化能力」共找到 3349 篇相关文章
用SFT打出RL的效果?微软联合提出高效后训练算法
大模型后训练阶段,SFT 和 RL 各有优劣。微软等联合提出新工作,量化 SFT 和 RL 在数据层面的差距,提出 IDFT 和 Hinted Decoding 等高效后训练技术,实验显示新方法泛化超 SFT、效率超 RL。
GitHub 狂揽 12K Star!把 OpenClaw 以及所有 Code Agent 工具装进一个界面!
AionUi是本地优先、开源免费的AI Cowork平台,将散落终端的命令行AI工具统一到图形界面。它兼容主流工具,有统一平台、多工具支持等特点,还具备多任务并行等核心能力,适合多Code Agent用户。
从「知题」到「知人」:UserRL让智能体学会「以人为本」
大语言模型距成真正用户伙伴缺‘知人’能力。来自UIUC与Salesforce团队提出UserBench和UserRL方案。前者将‘用户特性’制度化,构建评测环境;后者搭建统一强化学习框架,探索奖励建模,二者让‘以用户为中心’落地。
DeepMind 颠覆机器人学习范式:让机器像人一样 “自由成长”
谷歌DeepMind受大模型微调中强化学习阶段启发,提出面向机器人学的两阶段后训练方法,含监督微调与自我提升。实验显示该方法让机器人自主习得新技能、广泛泛化,但研究也存在标注成本高等局限。
103K「硬核」题,让大模型突破数学推理瓶颈
现有大语言模型在数学推理训练时面临数据瓶颈,腾讯AI Lab与上海交大团队推出DeepMath - 103K数据集。它规模大、难度高、数据新颖、严格去污染,让DeepMath系列模型达SOTA,还能实现推理泛化。
重新认识具身行业,从自变量的这封邀请函开始
具身智能行业存在评分、技能、样品、商业四大‘气泡’,即认知偏差。自变量机器人将在发布会上戳破‘气泡’,打破认知差,重建评价标准。行业‘拐点时刻’需大脑能力突破、真实场景稳定运行、跑通ROI闭环。
CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己
美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。
性价比搏击:Grok 4 Fast 推理成本直降 98%
xAI上周五发布旗舰模型轻量化版Grok 4 Fast,推理成本直降98%。它通过强化学习在基准测试表现佳,有原生工具调用能力,采用统一架构,性价比高,或改写大模型竞争规则。
Claude Opus 4.1被曝即将发布!Anthropic靠两大客户API收入超OpenAI
Claude Opus 4.1被曝正在内部测试,或重点提高推理和规划能力。Anthropic过去7个月ARR涨至50亿美元,API收入超OpenAI。但它收入依赖AI编程,面临GPT - 5、Grok等竞争。
并行革命,32倍吞吐量跃升!英伟达Helix架构突破百万Token推理瓶颈
英伟达推出受DNA结构启发的Helix并行技术,能解决大模型处理长任务时的卡顿问题,提升上下文长度、并发能力并降低响应延迟。不过也有人认为其技术与实用性有差距。