「三维场景生成」共找到 3827 篇相关文章
超低延迟的端到端语音模型!首次生成音频仅需53ms,比同级别模型快3-5倍!
随着语音应用场景普及,语音大模型响应慢成瓶颈。VITA团队开源端到端语音模型VITA - Audio,7B参数模型首次生成音频仅53毫秒,比同级别快3 - 5倍,完全开源,有超低延迟等优势。
实测updream预演台:一张图,换来一整个3D片场!
作者实测updream预演台,它可传图自动重建3D白模场景,可摆人物、调机位等,再配合Seedance 2.5渲染成片。作者还做了对照实验,证明白模能锁定拍摄意图,并给出使用建议。
1.5B参数!支持本地实时语音转录
Liquid AI发布首个端到端音频基础模型LFM2 - Audio - 1.5B,参数1.5B,能在本地设备处理高质量端到端音频任务。它是统一多模态模型,支持两种生成策略,多种应用场景,虽仅支持英文但性能出色。
Sora 2数手指翻车,奥特曼成第一批「受害者」,被AI玩成最惨打工人
Sora 2虽强大,但数手指测试翻车,模拟场景也有瑕疵。奥特曼成其首批“受害者”,AI生成视频将他玩坏。同时,OpenAI研究员对Sora应用发布存担忧,而奥特曼解释资金投入原因。
医疗AI平台Abridge获3亿美元,估值53 亿美元
医疗AI平台Abridge获3亿美元E轮融资,估值达53亿美元。其利用AI为医疗场景服务,核心功能“环境监听”可生成临床笔记。目前超150家医疗系统使用,正拓展收入周期管理等业务。
顶级邪修倾囊相授!藏师傅教你速通Nano Banana
作者歸藏教大家发掘图片编辑模型Nano Banana潜力。它上线后可白嫖,让Adobe等修图软件失色。介绍使用方法、多种修图玩法及在电商、动漫修复等场景应用,称相关生意都值得用它重做。
Sensor Tower 25上半年AI应用报告:年轻男性用户仍占主导,垂类应用面临被「颠覆」压力
移动应用数据分析商 Sensor Tower 发布报告《State of AI Apps Report 2025》,分析移动端 AI 市场。指出 2025 上半年全球生成式 AI 应用下载和收入增长,亚洲成下载主力,AI 成应用标配,垂类应用面临挑战。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。
NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理
面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在不改动原有MLLM架构前提下激活图像生成能力,实验表现出色。
李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?
中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。