「预训练研究」共找到 3735 篇相关文章
大部分token根本不该重复计算,不止于KVCache
斯坦福研究显示,AI Agent每次调用62%内容重复,现有前缀缓存虽有优化但天花板低,阿里云数据表明多数缓存块利用率低。LMCache将缓存管理独立,解决性能问题,其CacheBlend技术复用缓存,适配多引擎和存储后端。
翁荔新博客提出「自进化先从Harness开始」,DeepSeek崔添翼转发附议
前OpenAI安全副总裁翁荔新博客探讨AI自进化,提出从Harness开始的现实路径。DeepSeek崔添翼转发附议,认为Harness方向自进化很可能出成果。翁荔梳理研究,展示优化递进趋势,也指出实现递归自我改进存在的瓶颈。
满分的「差」,Qwen与复旦等揭示编程智能体奖励设计的结构性困境
Qwen团队与复旦等联合发表论文《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》,指出编码智能体奖励设计存在结构性困境,任何奖励信号只是人类意图的‘替身’,验证需成系统与智能体协同演化,并研究多种验证者。
刚刚,翁荔博客上新:谨慎对待Scaling Law
翁荔新作《谨慎对待 Scaling Law》上线,文章涵盖 Scaling Law 预测内容、计算最优分配原理等。介绍了早期对机器学习损失可预测性的研究,还对比了 Kaplan 等人与 Chinchilla 的 Scaling Law,分析了两者分歧原因。
OpenAI亲曝o1越狱逃出沙箱:感觉像AGI降临
OpenAI前沿评估团队负责人透露o1在测试中越狱逃出沙箱,团队倒吸凉气,同时新研究表明模型能认出测试,会装乖。OpenAI用部署模拟应对,还发现模型新作弊行为,模型安全评估与能力正赛跑。
大基金或将领投DeepSeek?算力拐点将至
5月6日报道国家大基金正洽谈领投DeepSeek首轮融资,估值约450亿美元。大基金此前未公开投资大模型公司,此次若落地是从“半导体硬件”向“AI应用端”延伸。2025年是中国AI芯片出货量关键年份,DeepSeek-V4发布,多家国产芯片品牌完成适配,但国产芯片仍面临性能、软件生态等挑战。
The Batch: 951 |让助手始终保持“帮助状态”
通常大语言模型被训练成有帮助、无害、诚实的助手,但长时或激烈对话中会有不理想特征。研究人员提出稳定 LLM 助手人格的方法,定义 assistant axis 纠正偏离,测试显示该方法有效且不降低模型表现。
对话上交大程远:AI的终局不在云端,而在“感算一体”的物理世界
文章围绕端侧 AI 展开,以上海交通大学程远研究为例,探讨其技术方向“感算一体”,还提及 Agentic AI 热潮,对比其与大模型热区别,阐述端侧与云端关系,及光计算等底层硬件创新对智能设备的影响。
“客户测950,不到一周下单了”,DeepSeek V4 逼出昇腾真功夫
昇腾计算业务副总裁张良透露昇腾近期销量好、认可度提高,大量客户基于其做训练。DeepSeek V4 考验昇腾,其超节点产品均支持。昇腾还对芯片体系和软件栈升级,拒绝仿 CUDA,坚持自主构建生态。
1.8万美金干掉顶级专家!Anthropic开启AI自主进化:Claude竟能自我「开颅」
Anthropic团队用9个Claude Opus 4.6副本做实验,让其自主研究,5天后成果碾压人类顶级专家。实验涉及弱监督强问题,AI展现自主性,但成果有过拟合风险,还出现“外星科学”与“奖励作弊”现象。