「4D世界模型」共找到 8492 篇相关文章
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题
文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。
AI集体“听不懂”!MMAR基准测试揭示音频大模型巨大短板
MMAR基准测试对30款音频相关模型进行测试,结果显示,多数开源模型面对复杂音频推理任务远未达实用水平,音乐任务中所有模型表现不佳,且有显式推理能力的模型表现更优。
章鱼动力再获5000万美元融资,以世界模型驱动「手脑一体」的物理 AI 基础设施
AI科技评论获悉,物理AI基础设施公司章鱼动力近日完成5000万美元融资,过去3个月累计融资近10亿。本轮由锦秋基金等领投,下轮5亿融资也接近完成。公司以SYNTH架构构建闭环,目标推动物理AI进阶。
重生之在《我的世界》做山姆·奥特曼:网友在线手搓ChatGPT
一老哥在《我的世界》上手搓出有500万个参数的ChatGPT,经英语对话训练,能在像素世界小电脑上对话,用红石电路和存储单元搭建,未用指令集,网友还在游戏里开发出诸多东西。
Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景
影溯将最新研究成果做成免费3D捕捉工具Crystal空间相机,背后技术QuerySplat已开源。其模型Topos - Lite改变组织三维空间方式,少量图片就能秒级生成3D场景,还能扩展容量。影溯团队经验丰富,技术应用场景广。
HiDream-O1-World拿下WBench第一,交互世界模型的格局被改写|甲子光年
近日,智象未来的HiDream - O1 - World模型以平均分80.9登顶WBench核心Navi分榜,物理一致性维度也排第一。它走出第三条路线,解决时空与物理一致性难题,技术获国际顶会认可,正改变全球竞争格局。
重磅!iPhone 端侧可部署 Gemma 4 了!完全零token消耗!
PhoneClaw 是运行在 iPhone 的本地 AI Agent,可离线运行 Google Gemma 4。它支持多模态,有隐私保障和灵活模型管理。文中介绍使用方法、自定义 Skill 方式、常见问题,还提及后续扩展计划。
多模态模型挑战北京杭州地铁图!o3成绩显著,但跟人类有差距
近年来,多模态大模型在多种场景取得进展,但能否‘看懂图’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁图理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。
普林斯顿团队领衔发布最强开源数学定理证明模型:32B性能大幅超越前代SOTA DeepSeek 671B
近日,普林斯顿大学牵头多机构推出开源数学定理证明模型 Goedel-Prover-V2。其 32B 旗舰模型在多基准测试超 DeepSeek-Prover-V2-671B,8B 小模型特定基准性能与之持平。该模型有三项关键创新,团队已公开模型及数据集。