「从零训练」共找到 4877 篇相关文章
小红书开源大模型dots.llm1,初次出手,小有惊艳!国外网友们又炸了……
小红书hi lab团队公布首个开源大模型dots.llm1,这是142B参数的MoE模型,仅14B激活参数就能与Qwen2.5 - 72B打平。它开源力度大,训练效率高,数据处理精细,训练稳定,获国外网友高度关注。
一个运行了80年的算法,我们现在才真正理解它?
近80岁的单纯形法是优化领域基石,广泛用于包裹配送、飞机航线规划等,但此前没人能从理论上完美解释其高效原因。现在,Huiberts和Bach找到了谜题的最后一块拼图,不仅让算法更快,还从理论上解释了现象。
欲取代transformer的SSA(次平方稀疏注意力)解读
文章解读了欲取代Transformer的SSA(次平方稀疏注意力)算法。它支持12M tokens上下文,比fastAttention快52倍,训练和推理更快。SSA改变了注意力扩展特性,有计算和内存线性扩展等特性,经三阶段训练可可靠利用长上下文。
Meta 悄悄开源了两个惊艳的 3D 重建模型,物体重建+人体重建!
前两天AI圈被Gemini 3 Pro刷屏,Meta却悄悄开源了两个“硬核”项目:SAM 3D Objects可从一张照片重建任意物体,SAM 3D Body能从一张照片重建人体网格模型,二者结合可构建完整3D场景,且全部开源、可商用。
蚂蚁·安诊儿医疗大模型:正式开源并登顶权威医疗榜单
近日,蚂蚁集团联合浙江省卫生健康委开源自研的蚂蚁·安诊儿医疗大模型。它基于蚂蚁百灵大模型架构,经深度训练,是参数规模最大的开源医疗模型。该模型在多评测中表现出色,有三阶段训练流程,架构高效、推理快,已开源助力行业发展。
让推荐学会思考:用强化学习激活大模型的序列推理能力
文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。
R-HORIZON:长程推理时代来临,复旦NLP&美团LongCat重磅发布LRMs能力边界探测新范式
复旦大学与美团LongCat Team联合推出R - HORIZON,它是首个系统性评估与增强LRMs长链推理能力的方法与基准。提出Query Composition方法构建评测基准和训练数据,评测发现主流模型长链推理性能断崖式下降,还分析出三大瓶颈,训练后模型性能双重提升。
The Batch: 893 | 从预测到执行
2026 年 AI 研究应认识到能预测的模型不等同于能行动的系统。过去十年在被动预测和生成建模成就非凡,但现实任务需系统执行一系列动作。转向长周期任务和目标导向 AI 系统有两大好处。
Claude Agent Skills:从第一性原理深入剖析
本文深入剖析Claude的Agent Skills系统,它是基于提示的元工具架构,借助‘提示展开’与‘上下文改写’扩展大模型能力。文中以具体技能为例,介绍其机制、构建方法、编写规范及常见模式。
数据分析师,即将从工业领域“消失”?
2023年底Google裁撤数据科学家引发关注,AI+BI普及使岗位裁撤风潮蔓延至工业领域。2025年7月TDengine发布TDengine IDMP,主打“无问智推”,有望带来数据消费范式革命,加速工业智能化转型。