「多模态训练」共找到 2839 篇相关文章
瘦身不降智!大模型训推效率提升30%,京东大模型开发计算研究登Nature旗下期刊
京东探索研究院大模型研究登Nature旗下期刊。其提出系统与方法,经四大创新使大模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。
刚被马斯克收购,Cursor掏出新模型:10万卡加持,和Opus、GPT一样大
本周二,刚被SpaceX收购的Cursor在首届旗舰大会宣布新的1.5万亿+参数模型,在超10万块GPU预训练。Cursor CEO称其规模与Opus、GPT相当,还谈了对其他AI实验室看法,新模型将几周内发布。
华为盘古首次露出,昇腾原生72B MoE架构,SuperCLUE千亿内模型并列国内第一
当前传统 MoE 有专家激活不均衡问题,华为盘古团队提出 MoGE 解决。基于此架构的盘古 Pro MoE 大模型在昇腾集群高效训练,推理性能强,在 SuperCLUE 榜单千亿内模型并列国内第一,赋能业务落地。
Meta 143亿挖角后的首个作品:Alexandr Wang 推出闭源模型,杨立坤点赞
沉寂9个月后,Alexandr Wang带队的Meta发布新一代模型Muse Spark。它是原生多模态推理模型,性能媲美Gemini Pro和GPT 5.4,在多领域有应用潜力。不过闭源引争议,且在部分领域有短板。
让AI看懂科研图表:深势科技开源150万高质量科研图文数据集
深势科技开源OmniScience数据集,含150万个高质量图文对。它利用先进工具攻克图文提取难题,经严格筛选成型,涵盖多学科。还设计重写流水线提升图文语义契合度,基于此训练的模型表现优异。
定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆
此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。
面向业务落地的AI产品评测体系设计与平台实现
文章聚焦淘宝闪购技术部AI产品评测,先介绍AI业务应用场景与评测挑战,接着阐述评测体系从多方面思考的要点,包括评价维度、评测方式等,还提及平台建设成果,最后展望未来多模态评测等规划。
NeurIPS 2025 | Code Graph Model:重塑代码大模型架构,利用“代码图”突破仓库级编程瓶颈
在 NeurIPS 2025 上,蚂蚁全模态代码算法团队展示「Code Graph Model (CGM)」,它将代码库图结构注入 LLM 底层注意力机制,打破业界刻板印象,在权威榜单上表现出色。文章解析其架构、训练策略和配套框架。
邱锡鹏团队新作:让机器人学会「察言观色」
复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据集,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。
破解空间智能数据稀缺难题,影石开源DiT架构全景生成模型,在线可玩
影石研究院团队推出基于DiT架构的全景图像生成模型DiT360,设计分层混合训练框架,结合透视与全景图像数据,提升真实感和几何一致性。它支持多任务,优于现有方法,为三维场景生成提供新思路。