「3D模型生成」共找到 9196 篇相关文章
EMNLP25 | 北大x腾讯光子发布 C3 Benchmark:中英双语语音对话模型“地狱级”测试基准,直击语音对话模型软肋!
近年来语音对话模型受关注,但处理人类对话复杂现象的效能缺乏研究。北大联合腾讯光子构建中英双语C3 Benchmark数据集,评估模型应对复杂对话的能力,结果揭示性能瓶颈,为模型优化提供参考,代码和数据已开源。
升级版Qwen3开源模型深夜来袭,超越Kimi-K2、DeepSeek-V3
深夜阿里千问推出 Qwen3-235B-A22B-Instruct-2507-FP8 版本。新模型通用能力显著提升,在多测评中表现出色,超 Kimi-K2 等模型。还增强多语言知识覆盖等性能,已在魔搭和 HuggingFace 开源。
北大团队让AI学会考古!全球首个古希腊陶罐3D视觉问答数据集发布,还配了专用模型
北大团队推出全球首个面向古希腊陶罐的3D视觉问答数据集VaseVQA - 3D,配套专用视觉语言模型VaseVLM。传统模型面对文化遗产复杂对象有不足,新数据集和模型让AI迈向‘文化考古Agent’,未来将拓展到更多领域。
阿里刚投的AI明星,3D大模型那种
通用人工智能公司VAST宣布完成5000万美元A轮融资,由阿里、恒旭资本联合领投。其自研3D基础大模型领先,发布全新AI 3D大模型家族。2025年重点研发世界模型,2026年将加速建设UGC互动内容平台。
Qwen3-LiveTranslate:视、听、说全模态同传大模型!
Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。
高效大规模创新3D重建模型iLRM
多数基于Transformer架构的模型处理多视图输入有可扩展性问题,成均馆大学、延世大学研究人员提出创新3D重建模型iLRM。它通过迭代细化机制生成3D高斯表示,有独特架构设计和高效注意力机制。
Nano Banana Pro上线!集成Gemini 3与Veo 3,谷歌不给竞争对手喘息机会
谷歌推出最强文生图模型Nano Banana Pro,又名Gemini 3 Pro Image,整合Gemini 3 Pro多模态理解能力与谷歌搜索知识库。它提升文字渲染等能力,支持多种分辨率和格式,还集成视频生成模型,覆盖多类用户。
快9倍还更清晰?Direct3D-S2一键解锁高效3D生成
在高分辨率三维形状生成中,传统方式有计算与内存瓶颈。南京大学提出Direct3D - S2框架,基于稀疏体积构建,有空间稀疏注意力机制,加速计算,还引入统一格式VAE,生成质量领先,训练成本更低。
3 天上了两个 SOTA 模型,视频 Agent 们接得过来吗?
7月31日MiniMax H3和字节跳动Seedance 2.5同日发布,3天后H3开源,8月7日Seedance 2.5开放api。模型变强使产品层要做的事更多,视频Agent需解决生产问题,竞争走向模型层之上。
刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apache 2.0
Mistral AI发布Mistral 3系列开放模型,含Ministral 3和Mistral Large 3,均采用Apache 2.0许可证。该系列模型性价比高,性能出色,还与多方合作。其发布或标志欧洲重返AI竞赛,也是对DeepSeek的追赶。