「架构模式」共找到 2643 篇相关文章
南洋理工、北大、上海AI实验室开源长记忆世界模型
目前世界模型模拟方法在维持长期一致性上有挑战,南洋理工大学、北京大学王选计算机技术研究所、上海人工智能实验室联合开源长记忆世界模型WORLDMEM,介绍了其记忆机制、基础架构、训练技术及检索策略等。
清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练
清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。
ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA
传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即时适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。
腾讯AngelSlim升级,首个集LLM、VLM及语音多模态为一体的投机采样训练框架,推理速度飙升1.8倍
随着大模型应用成本与延迟问题凸显,腾讯混元升级 AngelSlim 训练框架,将投机采样技术拓展至全模态场景。它以 Eagle3 架构让推理速度最高飙升 1.9 倍,还具全模态训练、面向部署等亮点,有开源代码。
Google DeepMind 联合创始人、首席 AGI 科学家:如何构建一个让 AGI 有助于人类繁荣发展的世界?
Google DeepMind联合创始人、首席AGI科学家Shane Legg在播客中称AGI可能2028年到来。他探讨AGI定义、伦理等,认为其分多层级,还指出社会模式或改变,部分工作将受影响,也强调利用好它或带来黄金时代。
jina-embeddings-v5-omni 发布!全模态向量小模型
Jina AI发布`jina-embeddings-v5-omni`,将`v5-text`能力拓展到多模态。`v5-omni-small`参数量小却追平LCO - 7B,在多模态评测中表现优异,但视频是短板。其采用‘冻结 + 投影’架构,训练快、省显存。
十分钟破解加密货币!谷歌在量子计算领域发现了什么?
谷歌提前后量子密码迁移截止日期至2029年,两篇论文从不同层面优化Shor算法,显示量子计算机破解现有密码体系所需资源比预想少。以太坊架构使其面临更广攻击面,比特币也有局部隐患。
大模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!
Qwen团队等最新研究打破传统认知,揭示‘对齐税’现象。提出置信解码策略,在多架构、评测集上表现出色,能绕过‘对齐税’,提升推理准确率,且工程开销低,为大模型发展提供新思路。
这张信息图,居然是8B开源模型做的??
商汤新开源的 8B 多模态模型 SenseNova U1,架构独特,图像评测表现好,信息图生成能力强、延迟低。它具备图文交错能力,适合自媒体、敏感行业等,有在线体验和开源代码入口。
OpenClaw 爆火背后 | GAIR Live 026期预告
2026年初OpenClaw爆火,上线两月成GitHub Star最高项目。GAIR Live 026期圆桌将从OpenClaw切入,探讨IoA本质,涉及热点复盘、架构之争、生产力重构、未来展望等核心议题,还有业内嘉宾参与讨论。