「3D世界模型2.0」共找到 8903 篇相关文章
定义RAG新基准?谷歌发布 Gemini Embedding 2:首个原生多模态嵌入模型,延迟骤降70%
谷歌昨夜推出首个基于 Gemini 架构的原生多模态嵌入模型 Gemini Embedding 2,通过 Gemini API 和 Vertex AI 向开发者公开预览。它可将多类型数据映射到统一嵌入空间,多项基测排名第一,还获早期合作伙伴高度评价。
Grok 4刷新ARC-AGI-2纪录:15.9%碾压所有公开模型,我们离AGI还有多远?
xAI的Grok 4在ARC-AGI-2测试中获15.9%,成全球最强公开AI模型。ARC Prize主席还原测试过程,虽成绩亮眼,但网友有质疑,且离人类表现差距大。Grok 4在多基准测试领先,定价便宜。
硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构
本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。
开放世界任务成功率82%!美的攻克机器人泛化控制难题
美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。
中山大学HCP Lab联合拓元智慧提出高效世界模型DDP-WM,机器人规划效率提升9倍
中山大学人机物智能融合实验室联合拓元智慧提出新型高效世界模型框架DDP - WM。它解耦动态预测,在提升推理速度同时,提高规划成功率,如Push - T任务规划速度提9倍、成功率从90%升至98%。
把视频变成图文博客:Agent + 豆包 Seed2.0 lite 重做 Karpathy 两年前的工作流
本文以重做 Karpathy 两年前工作流为例,介绍用 Agent + 豆包 Seed2.0 lite 将视频转为图文博客的方法。详述四步流程,指出其局限,还说明该模式可用于竞品直播追踪、在线课堂报告、游戏赛后复盘等场景。
上海AI实验室发布 Intern Lumina U2:全离散扩散建模,让模型既能“看懂”也能“生成”
上海人工智能实验室发布新一代多模态统一模型 Intern Lumina U2,基于全离散扩散建模路线,支持多任务,适配两大硬件生态,在昇腾千卡级集群训练效率提升 1.85 倍,性能优异且将开放资源。
中英双语、29项第一、像素级理解:360 FG-CLIP2登顶全球最强图文跨模态模型
360推出FG-CLIP2图文跨模态VLM模型,在八大类任务、29项测试中超越Google与Meta。它能像素级看图,中英文皆强且已开源。其优势源于高质量数据集和先进训练方法,还在多业务落地并开放API。
比Vibe Coding强100倍!字节 Trae 2.0 携“上下文工程”登场:一句话,从需求干到上线!
字节跳动的AI编程助手Trae发布2.0版本,新增SOLO模式,支持端到端开发流程。上下文工程热度攀升,能解决AI代码落地问题。Trae迭代快,从基础问答进化为智能体系统。
“机器人一次性卖完太亏!”真机智能刘智勇:今年中国本体厂商将大淘汰,拼的是世界模型?
本文是《2025 年度盘点与趋势洞察》系列之一,InfoQ 采访真机智能刘智勇,探讨具身智能。涉及 VLN 技术进展、世界模型作用、落地瓶颈等,还提及商业模式创新,认为 2026 年本体厂商将收缩。