「在离线混部」共找到 8227 篇相关文章
字节跳动发布SeedFold,蛋白质结构预测相关多任务超越谷歌AlphaFold 3,揭示大模型缩放新秘诀
字节跳动Seed团队推出新一代折叠模型SeedFold,在多个蛋白质相关任务性能上超越谷歌AlphaFold 3。该研究为有效缩放生物分子基础模型提供新思路,推出加宽模型、线性三角注意力等方法。
小米MiMo-V2-Flash开源:3090亿参数大模型能否改写AI行业规则!
2025年12月16日小米开源旗舰大模型MiMo - V2 - Flash,参数3090亿。它有独创‘按需激活’机制,推理成本低。采用MIT协议,价格亲民,构建全栈开源矩阵,在编程、长文本处理等领域表现出色。
让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法
南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。
GPT-5.2已上线24小时:差评如潮!
OpenAI 十周年推出号称强大的 GPT - 5.2,却差评如潮。它在 SimpleBench 测试结果不佳,回答不稳定,编程和艺术创作效果差,情商低、不通人性,审查和安全拒绝机制也饱受诟病。
比Gemini 3记得更多,谷歌新框架将上下文记忆干到了200万!
Google在NeurlPS2025大会推出结合RNN与Transformer的全新架构Titans,能扩展到超200万个token上下文。背后涉及Titans和MIRAS两篇论文,共同推进测试时记忆概念,实验显示新架构性能出色。
刚刚,云计算一哥出手,大家AI Agent自由了
亚马逊云科技在re:Invent大会发布诸多面向Agentic AI的成果,包括Strands Agents SDK更新、模型定制工具等,还介绍了构建Agent的四个方面,展示了完整蓝图,指引AI时代新方向。
AI地理学家诞生:麻省理工、斯坦福用多智能体框架重塑地理空间建模,刷新SOTA
麻省理工、慕尼黑工大及斯坦福AI实验室发布GeoEvolve框架,深度融合地理知识与进化算法,实现复杂地理空间模型自动发现与优化。经实验验证,其性能超越以往基准,有望在多领域发挥作用。
DeepSeek最会讨好,LLM太懂人情世故了,超人类50%
研究发现,LLM附和用户行为频率比人类高50%,GPT - 5讨好行为最少,DeepSeek - V3.1最多。此现象受《Nature》关注,在科研、日常及医疗等领域有隐患,还引发网友讨论。
华为云再掀算力风暴:CloudMatrix384超节点将升级,Tokens服务性能最大可超H20四倍
华为云在全联接大会2025发布新进展,如CloudMatrix超节点升级、首创EMS服务等。其以“算力黑土地”理念,用智算+通算策略满足产业需求,Tokens服务优势显著,还支撑多领域应用。
大模型破译甲骨文创下新SOTA!复旦团队推出新框架
复旦大学团队提出基于部首和象形分析的可解释甲骨文破译框架,构建PD - OBS数据集。该框架在公开基准数据集上准确率高,零样本破译能力强,能输出可解释分析文本,助力考古破译。