模型训练难题」共找到 8736 篇相关文章

推荐文章8

RSI离我们有多远?这家中国团队给出了第一梯队的工程解

目前行业探讨大模型的RSI时,常陷入思维定势。EvoMap团队没有盲目跟风,而是提出极具现实意义的工程新路径,构建自进化智能体,让经验在网络流转,还以硬核数据证明其体系有效性。

机器之心
新闻资讯7

裁4000人换来的AI全白搞?Salesforce悄悄改架构:用 “老技术”故障少还省钱,网友怒喊:CEO零遣散费滚蛋

Salesforce曾大举部署AI并裁员,宣称Agentforce能降本。但如今高管称不过度依赖大模型时运行更好,已引入基础自动化技术。其应用遇瓶颈,故障频发、成本高,还面临AI“漂移”等问题。

AI前线
开源动态8

AGI 新技术路线:下一代稀疏注意力机制 Monte Carlo Attention 开源

超对称技术公司在新版基座模型 BigBang - Proton 中使用的 Monte Carlo 注意力开源。它基于二进制块编码技术,用块间代表交流机制实现线性复杂度,兼具多种注意力机制优点,可满足宇宙尺度建模的上下文长度需求。

AI科技大本营
算法论文8

MIT & Google | 提出异步并行生成新范式,LLM推理效率大幅提升!

MIT与谷歌团队在研究PASTA中探索异步生成范式,开发标记语言PASTA - LANG,采用双阶段训练流程,设计推理系统。实验显示PASTA平衡性能与质量,有可扩展性,为LLM推理效率优化开创学习驱动新路径。

AINLPer
算法论文8

「边思考、边搜索、边写作」WebThinker开启AI搜索&研究新纪元!

大型推理模型有推理能力,但静态知识限制其在复杂任务表现。WebThinker 让 LRM 推理中自主搜索、导航及写报告,集成探索器,有自主策略和训练工具,实验显示性能强,还指明未来探索方向。

机器之心
产品应用8

编程能力开源SOTA,网络安全提升2倍!智谱发布GLM-5.3

智谱发布GLM-5.3,743B参数模型,编程能力达开源SOTA。网络安全能力涌现,基准得分是GLM-5.2两倍多。全部提升来自后训练缩放,还自研Z.ai Code Bench评估,安全评估加固后权重将开源。

AIGC开放社区
算法论文8

砍掉70%内存!陈丹琦团队破解LLM长文本瓶颈

大型语言模型处理长文本时,KV缓存占用内存巨大。陈丹琦团队提出KV足迹作评估标尺,推出分块驱逐与PruLong训练技术,在128K长文本任务中最高降低70%内存,性能损失仅10%。

深度学习自然语言处理
开源动态7

The Batch:829 | DeepSeek 是怎么做到的

DeepSeek 去年末以低成本训练出先进开源大模型引关注,近日团队披露构建 DeepSeek - R1 和 DeepSeek - V3 的软硬件方案,降低内存和计算需求,其细节公布让更多团队有机会参与前沿研发。

DeeplearningAI
算法论文8

AI又封神了!华人新作直出憨豆+《猫和老鼠》,平行宇宙对上戏了

新智元报道,阿联酋MBZUAI团队论文提出CCE和CCA机制,解决AI让不同风格角色同框时的“风格错乱”问题。让憨豆、汤姆等角色自然互动,模型在多角色任务指标上领先,或重写虚构边界。

新智元
开源动态8

告别“音画割裂”与“人物崩坏”!AutoMV:首个听懂歌词、卡准节拍的开源全曲级MV生成Agent

现有AI视频生成模型做全曲MV有时长限制、音画割裂和一致性差等问题。AutoMV作为开源多智能体系统,模拟人类影视制作流程,能生成长达数分钟、叙事连贯且音画同步的完整MV。

量子位