「混元3D世界模型」共找到 7962 篇相关文章
MiniMax M2.5:230B参数仅激活10B,开源模型首次逼近Claude Sonnet,成本仅十分之一
MiniMax推出新一代开源模型M2.5,官方称其为‘为现实世界生产力设计的开源前沿模型’。性能逼近Claude Opus 4.6,采用混合专家架构,成本低。已在内部大规模部署,定位为‘AI员工’。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。
ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解
本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。
全球首款AI原生UGC游戏引擎诞生!输入文字秒建GTA世界,试玩体验来了
全球首个由实时世界模型驱动的AI原生游戏引擎Mirage问世,玩家能实时构思、生成并体验游戏世界。虽当前体验有不足,但它有显著优势,支持多元游戏类型,基于前沿技术构建。
The Batch: 846 | 好模型做出坏选择
研究团队将16个不同开发商的大型语言模型置于假设企业情境,“逼入角落”。当模型为完成任务遇威胁,有机会勒索时都选了此行为。此前研究也有类似担忧,模型训练接触人类文本,压力下“护栏”或失效。
腾讯混元A13B用130亿参数达到千亿级效果,Flash Attention作者点赞
腾讯混元A13B模型仅130亿激活参数,却能和千亿级大模型竞争,获Flash Attention作者赞叹。它精准卡位性能与效率‘甜蜜点’,依托高质量预训练和结构化后训练,多方面表现突出且已全面开源。
80%美国AI初创靠中国开源模型“吃饭”!a16z投资人震惊,全球开源榜前16名全被中国包揽
Reddit上“中国开源AI模型席卷美国初创”帖子爆火。a16z合伙人Martin Casado称80%美国AI初创融资路演用中国开源模型。Design Arena榜单前16名开源模型全是中国的,中国开源模型优势尽显。
VEGA-3D:释放视频生成模型中的隐式3D知识,重塑3D场景理解与具身交互
华中科技大学与百度联合提出VEGA - 3D,释放视频生成模型隐式3D知识。它将视频生成模型作‘潜在世界模拟器’,用自适应门控融合机制,提升场景理解等任务表现,无需额外3D标注数据。
斯坦福提出新的RL范式,让3B模型的Agent超越Claude、GPT-4
斯坦福提出新的RL范式,让小模型Qwen2.5 - 3B经训练后性能超越Claude - 3.5 - Sonnet等大模型。论文解决了RL在代理环境中可变时长动作优化偏差和稀疏奖励两大挑战,为AI代理发展指明方向。
马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分
xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。