「模型架构创新」共找到 8869 篇相关文章
AI 的下一个战场:端侧模型崛起
大模型退烧,小模型接棒。腾讯、阿里等大厂纷纷官宣小模型成果,英伟达、OpenAI 等也有相关动作。端侧模型赛道广阔,但技术含量不低,面壁智能在端侧模型探索上成果丰硕,其 MiniCPM 系列不断迭代,还在多领域落地。
图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来
AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。
Kimi新模型数学反超DeepSeek!北大校友刘征瀛等领衔
Kimi新定理证明模型超越DeepSeek,基于Qwen2.5 - 72B打造,采用Kimi k1.5强化学习训练流程。有两大技术创新,还有精简版本,官方有Demo。双方此前比赛就打得有来有回。
面壁MiniCPM-SALA模型,稀疏-线性注意力,单卡吞吐百万上下文
面壁智能团队提出SALA,基于此训练的MiniCPM-SALA模型,在单张A6000显卡实现百万token超长上下文推理,训练成本降约75%。它结合稀疏与线性注意力,采用混合架构,继承权重降低成本,在长文本处理上优势明显。
Zed 为什么不用自己造 Agent?OpenAI 架构师给出答案:Codex 重划 IDE × Coding Agent 的分工边界
文章围绕Coding Agent展开,介绍其构成、构建Harness的挑战,还阐述Codex作为集成系统优势、使用方式及未来发展。强调将模型与Harness共同开发,能更好理解模型行为,Codex可助力构建差异化产品。
微软深夜发布SambaY架构,Phi-4min加速10倍推理
微软基于Phi - 4 - mini微调出Phi - 4 - mini - Flash - Reasoning 3B模型,扩展到200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行速度比前代快10倍,有诸多优点。
LeCun离职后不止创一份业!押注与大模型不同的路线,加入硅谷初创董事会
离开Meta后,Yann LeCun创立AMI,还加入Logical Intelligence任技术研究委员会主席。该公司推能量 - 推理模型,与主流大模型路线不同,其Kona模型在数独测试上表现远超大模型。
让机器人在“想象”中学习世界的模型来了!PI联创课题组&清华陈建宇团队联合出品
斯坦福Chelsea Finn课题组与清华陈建宇团队联合提出可控生成世界模型Ctrl - World,可让机器人在“想象空间”预演任务。该模型使用零真机数据,提升下游任务指令跟随成功率。其相关论文已发布于arXiv平台。
从GLM-4.5到GLM-5,我见证了一个模型从码农晋升为架构师
智谱以匿名方式将GLM - 5放到OpenRouter公测,其表现亮眼。在AI编程从Vibe Coding转向Agentic Engineering的背景下,GLM - 5参数规模提升,成绩优异,实测决策有架构师思路,持久力强,不再只是‘平替’。
Anthropic顶级Claude模型被逆向开源,这几个模块借鉴了DeepSeek
22岁开发者逆向开源Anthropic的Claude Mythos Preview模型架构,名为OpenMythos。其核心模块借鉴DeepSeek,采用带混合专家路由机制的循环Transformer,有独特设计和稳定机制,重新框定扩展性争论。