「任务递进训练」共找到 3640 篇相关文章
AIGCode宿文:我就是要自训练大模型,直接做「L5」| AI产品十人谈
AIGCode宿文坚信Coding是培育大模型的最佳场景,公司自训练66B基础模型,发布锡月大模型,开启AutoCoder内测。宿文认为AI Coding能解决代码供给问题,目标是实现AGI,虽面临诸多质疑,但他坚持直接做L5。
KDD 2025 | UoMo来了,首个无线网络流量预测模型,一个框架搞定三类任务
在 ACM KDD 2025 大会上,清华与中国移动联合发布 UoMo,全球首个面向移动网络的通用流量预测模型。它结合扩散模型与 Transformer,能理解地理与人流变化,一个框架搞定三类流量预测任务。
训练时间减半,性能不降反升!腾讯混元开源图像生成高效强化方案MixGRPO
混元基础模型团队提出全新框架MixGRPO,结合SDE和ODE,简化MDP优化流程,提升效率与性能。还推出更快变体MixGRPO - Flash。MixGRPO训练时间降近50%,MixGRPO - Flash再降71%,效果和效率优于DanceGRPO。
Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3
Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。
Anthropic首次揭秘下一代Claude怎么造!用户吐槽直接喂模型,连AI“做梦”都被训练
Anthropic研究团队产品经理Alex在访谈中透露Claude演进方向,如将模型开发产品化、向“持续运行Agent”演化,还解释“dreaming”机制等,也提及训练“人格”、研究意识等,展现了长远思考。
刚刚,智谱和华为搞波大的:中国首个国产芯片训练出的SOTA多模态模型!
智谱与华为合作开源新一代图像生成模型GLM-Image,是中国首个全程用国产芯片训练的SOTA多模态模型,擅长文字渲染,拿下多项榜单第一,API调用一张图只要0.1元,还解析了其技术架构。
美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈
美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。
“Claude Code更新废了”!热议Issue:思考深度下降67%,已无法胜任复杂的工程任务
AMD的Stella Laurenzo分析发现,Claude Code某次更新后思考深度降67%,无法胜任复杂工程任务,行为走样。团队回应redact - thinking是UI改动,2月两项改动或有影响,但网友并不买账。
500美元刷新SOTA!训练成本砍到1/200,华人团队重构视频生成范式
香港城市大学等团队发布图像 - 视频生成模型Pusa V1.0,在基础大模型上引入VTA机制,用3860对视频 - 文字数据、约500美元微调,在I2V超越Wan - I2V - 14B实现SOTA,还解锁零样本任务能力。
无损减少80%激活值内存,提升5倍训练序列长度,仅需两行代码
港中文(深圳)和上海交通大学团队提出 StreamBP 算法,通过线性分解和分步计算,将大语言模型训练激活值内存降至梯度检查点的 20%,在相同内存下最大序列长度为其 2.8 - 5.5 倍,代码已开源。