「3D视频世界模型」共找到 8348 篇相关文章
让大模型“边看边改”,视觉分割准确率直接上涨9% | ICML 2026
复旦、创智联合推出RSAgent,让多模态大模型通过多轮工具调用生成准确掩码,解决视觉分割难题。该工作入选ICML 2026,实验显示其在多个测试集上表现领先,还展示了从‘看图问答’到‘视觉行动’的路径。
刚刚,「欧洲的DeepSeek」发布Mistral 3系列模型,全线回归Apache 2.0
Mistral AI发布Mistral 3系列开放模型,含Ministral 3和Mistral Large 3,均采用Apache 2.0许可证。该系列模型性价比高,性能出色,还与多方合作。其发布或标志欧洲重返AI竞赛,也是对DeepSeek的追赶。
沉寂一个月,openPangu性能飙升8%!华为1B开源模型来了
华为发布专为昇腾端侧硬件打造的openPangu Embedded - 1B模型,仅10亿参数却性能卓越。它运用多阶段训练和优化,在权威基准表现亮眼,V1.1平均分较上月跃升超8%,还介绍了背后技术。
击败Meta登榜首:推理增强的文档排序模型ReasonRank来了
本文第一作者刘文涵聚焦AI搜索研究。提出推理增强的文档排序模型ReasonRank,在多个榜单击败多校和机构登榜首,其7B版本超越32B模型,论文获Huggingface paper日榜第一。还介绍研究动机、方法及实验结果等。
怎么回事?刚被OpenAI收购,Windsurf就发了个自己的模型
5月初,刚被OpenAI收购的Windsurf发布AI编程模型SWE - 1,该模型针对软件工程全流程,核心是流动感知,实现人机自然交接。它有三个系列,已上线可免费使用,开发灵感源于编辑器,在评估和实测中表现良好。
英伟达、港大等发布创新KV缓存,实现扩散模型无训练加速
多数开源扩散语言模型推理效率不如自回归模型,英伟达、港大、麻省理工研究人员联合提出Fast - dLLM。它用近似KV缓存机制减少冗余计算,还提出基于置信度的平行解码策略,测试显示能加速且保持生成质量。
当代码遇上大模型:智能编程助手的架构设计与工程实践
在 InfoQ 举办的 QCon 全球软件开发大会上,字节跳动段潇涵介绍如何基于大语言模型构建智能编程助手。他分享实践经验,剖析研发痛点,介绍技术架构,还探讨未来发展方向,如认知增强、工具整合等。
谷歌版小钢炮开源!0.27B大模型,4个注意力头,专为终端而生
谷歌开源Gemma 3 270M,几分钟就能完成微调,性能超Qwen 2.5同级模型。此模型小巧高效,可本地运行,还能用它构建OCR应用。它有多项亮点,适合多场景,上手简单。
AI视频运镜玄学已破!告别无限抽卡,3D预演台直接封神
用AI做视频常遇运镜、人物走位等问题,因文生视频系统缺空间锚定能力。updream在8月17日上线「预演台」功能,通过传参考图自动生成3D白模场景,实测显示其显著减少「抽卡」次数。
西工大张伟伟团队:大模型时代航空科技的蓝图畅想 | 航空学报CJA
随着国产开源大模型涌现,大语言模型走入生活,挑战传统航空教育,革新科研范式,与航空产业融合推动变革。西工大张伟伟团队探讨其在航空工程教育、科研、行业全链条的影响及挑战。