「3D世界生成」共找到 4444 篇相关文章
Qwen3-LiveTranslate:视、听、说全模态同传大模型!
Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。
2026世界机器人大会落幕,谁在物理AI赛道抢跑?
2026世界机器人大会落幕,具身智能从‘表演特技’转向‘实景作业’。物理AI世界正快速到来,但机器人量产尚需时日,AI汽车或率先实现人机深度协作,AIVA汽车以‘AI定义汽车’理念打造鲜活生命体,与火山引擎深度合作。
GAN之父Ian Goodfellow病后归来,剑指高效世界模型
GAN之父Ian Goodfellow等提出,利用符号化表示和游戏虚拟世界数据,或为构建动作条件多模态世界模型最佳路径,该模型可支持长时序任务预测与规划,还探讨构建原因、数据来源等。
「AI生成的内容全部加水印」OpenAI、Anthropic、Google都签了
OpenAI、Anthropic、Google等公司签署欧盟《AI生成内容透明度行为准则》,承诺推进AI生成内容标记与检测。Claude已公布落实方案,文本水印早有先例,但「水印」可信度遭质疑。
实测腾讯Hunyuan-Image2.0,首个毫秒级实时图像生成模型
今天上午腾讯发布混元图像2.0,以“更智能、更开放、更中国”为理念。其参数规模提升,推理时间大幅压缩,实现毫秒级实时生成,还在画面质量等方面升级,新增实时绘画板功能。
3.2K star!!高中生开发,媲美IDM,这款开源下载神器厉害了!
最近发现一款开源项目Ghost - Downloader - 3,由高中生独立开发,支持三平台,用Python编写且运行快,还融入AI技术自动调教下载策略。已有3.2K star,功能强大,安装和使用都简单。
推理速度飙升5倍,苹果提出全新Multi-Token生成框架!
自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。
华为刚投的物理AI:首家国产世界模型公司
华为哈勃联合华控基金对极佳视界进行亿元级A1轮投资。该公司是国内首家“纯血”物理AI公司,产品覆盖全栈软硬件,应用于自动驾驶和具身智能。华为偏好世界模型技术,此次投资信号明显。
DeepSeek-V3.2-Exp:用稀疏注意力打破长文本效率瓶颈
在NLP领域,处理长文本时传统注意力机制效率低。DeepSeek团队推出DeepSeek-V3.2-Exp模型,引入稀疏注意力机制,在保持性能同时提高长文本处理效率,降低计算复杂度,在多基准测试中表现良好。
首个多人对话视频生成框架MultiTalk,角色有表情还能互动
现有音频驱动人体动画方法多聚焦单人,处理多音频流能力弱、指令跟随有局限。中山大学提出多人对话视频生成新框架MultiTalk,介绍了技术原理,演示效果显示其指令跟随能力强、伪影少。