图像到三维」共找到 2523 篇相关文章

算法论文8

ICML 2026|表格异常检测能否告别「one-for-one」?OFA-TAD迈向one-for-all通用异常检测新范式

表格异常检测在多领域作用关键,但当前 one-for-one 范式成本高、泛化弱。Griffith 和同济团队提出 OFA-TAD,推进 one-for-all 范式,在多源数据集训练一次即可迁移,实验表现优异。

机器之心
开源动态8

国产AI视频炸了!SkyReels-V3三大功能重磅开源,1张图生成逼真视频

昆仑天工SkyworkAI团队开源多模态视频生成模型SkyReels-V3,它能在一个架构内搞定参考图像转视频、视频延长、音频驱动虚拟形象三大核心能力,超越主流商业模型,且真正开源。

新智元
算法论文7

ICLR 2025新成果:文档检索“降本增效”,从此“开挂”

传统文档检索系统处理视觉信息丰富的文档存在瓶颈,ColPali方法直接从文档页面图像生成多向量嵌入,简化流程、提高性能、降低延迟。ColQwen - Omni在其架构上扩展图文+音频多模态匹配。

CourseAI
开源动态8

太强了!这个 NotebookLM Skill,真的把 NotebookLM 搬进了命令行!

Google的NotebookLM凭借强大模型能力成AI圈“现象级”产品,如今开发者将其搬命令行,开源神器notebooklm - py诞生,具备AI Agent工具、研究自动化等功能,有多种使用方式。

开源星探
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
新闻资讯8

谷歌打响教育第一枪!发布50+项免费AI教育功能,彻底改变课堂!

Google for Education官宣更新,将以Gemini为首的AI工具免费提供给全球教育工作者,集成Google Classroom和ChromeOS。有Gemini in Classroom等功能,还通过教师主导解决安全担忧,上线数据分析工具。

探索AGI
开源动态8

开源RAG又添新军!港大开源多模态RAG神器,多文档格式统一解析、知识图谱索引与混合检索!

在AI信息检索领域,传统RAG系统难处理复杂文档。港大数据智能实验室开源RAG - Anything,可提供端端解决方案,能多格式解析、构建知识图谱和混合检索,优势显著。

开源星探
新闻资讯7

确认!DeepSeek多模态AI已经开测

DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。

量子位
开源动态8

Google开源黑科技!不用训练的时间序列预测模型,17.9K Star 疯狂追捧!

Google Research团队开源的TimesFM时间序列预测模型获17.9K Star。它零训练、开箱即用,基于1000亿时间点预训练,涵盖多场景数据,还能给出置信区间,已集成Google多个产品。

开源星探
算法论文8

Lumina-mGPT 2.0:自回归模型华丽复兴,媲美顶尖扩散模型

上海人工智能实验室等团队提出Lumina - mGPT 2.0自回归模型,统一多种图像任务。它采用独立训练架构、统一多任务处理框架和高效推理策略,实验表现优异,后续将优化采样时间并扩展至多模态理解。

机器之心