「混元世界模型1.5」共找到 9278 篇相关文章
Veo何止生成视频:DeepMind正在用它模拟整个机器人世界
通用型机器人策略发展带来挑战,传统评估方法有局限,前沿视频模型虽有潜力但面临困难。Google DeepMind团队提出基于Veo的机器人策略评估系统,经实验验证有效,展示了视频仿真评估的可行路径。
腾讯重磅开源!端到端视频音效生成模型HunyuanVideo-Foley
腾讯混元正式开源端到端视频音效生成模型 HunyuanVideo-Foley,适用于多场景。它采用新型框架结合 REPA 策略,有三大核心优势,能适配多种场景,抑制底噪,保证音频保真度。
谷歌Veo 3.1更新:更一致性、更具创造力和控制力
谷歌Veo 3.1发布更新,实现角色、背景与物体在动态场景中的高度一致性,支持基于参考图片创建视频、原生竖屏模式及1080p和4K分辨率升频,精准控制素材,提升创作体验。
Claude Code 5亿美元背后的AI工程革命
文章介绍了Claude Code的诞生故事、技术选型、开发流程等。它从听歌小工具变为年入5亿美元产品,90%代码自写,开发流程快,还重新设计终端交互。Anthropic团队各环节AI化,也有特殊条件,有些经验可借鉴。
最强Claude模型提前曝光!附带Anthropic三千份保密档案在线裸奔
向来标榜安全的Claude因权限配置失误,新模型Mythos提前曝光,还泄露3000份保密档案。Mythos比Opus 4.6更强,公司虽在测试但因安全风险限制发布,也有人质疑信息真实性。
用 Docker 跑大模型训练,Unsloth 解决了环境配置难题
Unsloth AI 发布 Docker 镜像版本,解决本地训练大模型环境配置难题。拉镜像就能训练,依赖和示例 notebook 都打包好。使用简单,不过有暂不支持 Mac 系统等限制,单卡 NVIDIA GPU 场景较适用。
放弃开源、重组权力!扎克伯格掏出Muse Spark,杀回大模型主桌
Meta在AI发展遇阻后推出Muse Spark,它是MSL首个模型,定位为通向个人超级智能的第一步,性能表现出色,当前闭源,未来Muse系列或有开源变体,标志Meta AI权力结构重塑。
警告:你的Agent可能无法"解决"真实世界的视觉问题
文章提出 AgentVista 评测基准,含 209 道任务,横跨 7 大领域 25 个子方向。评测 14 个主流模型,最强的 Gemini - 3 - Pro 准确率仅 27.27%,揭示多模态 Agent 在视觉理解、工具调用等方面挑战大。
OpenAI 推出 GPT-5 驱动的安全卫士Aardvark:Codex 绝佳搭档
OpenAI推出由GPT - 5驱动的自主安全研究智能体Aardvark,用于软件安全保障。它能持续分析代码仓库,识别并修复漏洞,目前在内部及合作伙伴代码库效果良好,正处私有测试阶段。
巧妙!一个传统技术让国产视觉基础模型直接上大分
格灵深瞳的Glint - MVT视觉基础模型表现出色,线性探测准确率高于CLIP等,下游任务效果佳。其引入间隔Softmax损失函数,结合虚拟类别构造等优化方案提升性能,团队专注视觉研发,务实开放。