「预训练范式」共找到 2915 篇相关文章
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
Nature发表、Science点赞!清华揭秘AI让科学家走捷径却让科学走窄路
清华大学基于超4100万篇论文研究发现,AI虽提升科学家个人产出与职业进程,却使科学探索领域变窄固化。研究发表于Nature,被Science深度报道,揭示了AI在科学发展中的利弊。
Anthropic:大模型开始意识到自己在想什么!
Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。
梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷
新智元报道,梁文锋署名的DeepSeek新论文提出全新Engram模块,解决Transformer记忆难题。论文联手北大提出与MoE互补的“条件记忆”稀疏轴,通过Engram模块实现近似O(1)的确定性知识查找,或成稀疏LLM主流路线,下一代V4可能集成该方法。
微软:DeepSeek-R1等推理模型循环的原因找到了
前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。
QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5
通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。
深度拆解:如何在 LangChain DeepAgents 中复现 Claude 的 Skills 机制 ?
本文探讨在LangChain的DeepAgents框架复现Claude的Skills机制。先回顾Skills,它是Anthropic提出的Agent能力注入方式,有渐进式加载特点。接着介绍让通用框架支持Skills的环节,最后测试验证其效果和收益。
AI体育教练来了!中国团队打造SportsGPT,完成从数值评估到专业指导的智能转身
现有智能体育系统多停于‘打分+可视化’,通用大模型处理体育生物力学分析有局限。中国团队提出SportsGPT框架,实现从‘动作评估’到‘训练处方’智能闭环,各模块优势明显,超越基线。
谢赛宁REPA得到大幅改进,只需不到4行代码
Adobe Research等团队对REPA展开研究,发现驱动目标表征生成性能的是空间结构而非全局性能。基于此构建iREPA,代码不到4行,能提升REPA收敛速度,在多方面表现出色。
Google 开源 InkSight,把手写笔记直接变成可编辑数字笔记!
Google 开源 InkSight,能将手写照片转为数字墨迹,与传统 OCR 不同,它可「还原书写方式」。具备离线转在线、多语言支持等功能,核心是「阅读 + 书写」双重训练,有两种使用模式。