「多模态理解与生成」共找到 3413 篇相关文章
腾讯开源最强3D生成模型,消费级显卡就能跑 | CVPR
在CVPR上,腾讯混元3D 2.1模型宣布开源。相比前一代,它实现几何与纹理双重优化,纹理贴面提升大,达当前开源3D模型SOTA水平。全链路开源,适配消费级显卡,Hugging Face下载量超180万。
Deepseek V4 Pro发布,除了多模态,满足我对模型的所有想象
DeepSeek官方文档更新模型日期,意味着DeepSeek V4 Pro正式版来临,已在官方API提供。它采用MoE设计,接口能力强,Agent能力得到大幅强化,评测成绩亮眼,价格实惠且有API兼容性,不过有并发限制,近期还将上调价格。
Angular 官方的智能体 Skills 助力 AI 编程工具生成现代化的 Angular 代码
谷歌 Angular 团队发布 angular/skills 仓库,含两种智能体 Skills,能让 AI 编程智能体编写现代化 Angular 代码。这些 Skills 针对特定工具设计,开发者可安装使用,社区对此看法不一。
推荐系统进入“大模型时刻”:昇腾NPU如何支撑千亿级生成式推荐落地
文章基于华为郭威在2025 AICon大会演讲,复盘华为推荐技术探索。介绍FuXi-α、β模型设计,解决训练和推理难题;分享“多阶段统一建模”进展,提出Performance Law;还介绍了训推系统优化及未来聚焦“强算力”“强模型”融合。
当Sora 2意外停摆,这个国产视频生成创业团队,直接「开源」三连击
OpenAI叫停Sora 2项目,同期北京AI初创公司Sand.ai在GitHub连续三天开源核心技术栈,包括音视频同出大模型、分布式Attention组件、全局编译框架,还介绍了团队和产品,展现全栈实力。
CVPR 2026 | BiMotion:用 B 样条曲线重新定义 3D 角色运动生成
爱丁堡大学等团队提出 BiMotion 框架,将在 CVPR 2026 发表。它用 B 样条曲线表达运动,解决现有方法问题,有独特架构和损失函数,实验表现优,代码和数据集已开源。
中学生就能看懂:从零开始理解LLM内部原理【十三】|GPT 架构如何工作 ?
本文是对GPT架构工作原理的解读。介绍了GPT与Transformer的关系,阐述其从输入文本到预测下一词概率的流水线,详述训练和推理流程,还提及GPT架构进化的混合专家(MoE)模型。
击败 GPT-5!理想汽车开源 RubricHub:大模型开放生成从此有了专业裁判
理想汽车基座模型团队联合高校发布RubricHub数据集,解决开放式任务评价难题。该数据集可将主观评价转化为量化标准,经其训练的Qwen3 - 14B小模型在医疗基准测试中超越GPT - 5。
CVPR 2026 Workshop征稿|第六届AdvML@CV:多模态大模型智能体安全
IEEE/CVF 计算机视觉与模式识别会议 CVPR 2026 6月3 - 7日在美国丹佛举办,期间6月3或4日将举办第六届对抗机器学习计算机视觉研讨会,聚焦视觉 - 语言智能体安全,现开启论文征稿并公布重要日期,给出投稿入口。
科学界爆发AI认知污染!1年狂投50篇论文,ICLR投稿20%AI生成
如今AI正污染科学界,出现幽灵引用、虚假数据和图片等问题。论文工厂用模板量产造假论文,审稿人用AI应对,作者还用密令操控AI审稿。预印本平台投稿量暴涨,可能沦为垃圾场,引发认知污染。