图像到三维」共找到 2539 篇相关文章

开源动态8

视觉Token注入CLIP语义,走向多模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。

量子位
新闻资讯8

Demis Hassabis揭秘世界模型Genie 3的真正意义:为AGI打造无限“虚拟子宫”

Google DeepMind CEO Demis Hassabis与产品负责人深度对谈,爆料将游戏智能体SIMA放入Genie 3生成世界训练,探讨AI从游戏思考系统的演进、Genie 3意义及AGI评估挑战,还提及与Kaggle合作推游戏竞技场。

AI寒武纪
新闻资讯8

震撼,世界模型第一次超真实地模拟了真实世界:谷歌Genie 3昨晚抢了OpenAI风头

昨晚谷歌DeepMind宣布Genie世界模型第3代,能通过单个文本提示词创建交互式、可玩环境。它在多方面优于前代及其他模型,具备构建完整世界能力,但也存在动作空间有限等局限,未来应用值得期待。

机器之心
推荐文章7

拥抱 AGI 时代的中间层⼒量:AI 中间件的机遇与挑战

文章指出大模型发展呈能力跃迁、生态开放趋势,推动AI应用从聊天机器人向组织级智能体演进。AI中间件可解决应用工程化挑战,但面临上下文管理、记忆更新等难题,短期助力应用规模化,长期或成组织智能“神经中枢”。

InfoQ
算法论文8

GPT-5刷屏吊胃口之际,英伟达发出暴论:小型语言模型才是未来

英伟达新论文指出,未来属于小型语言模型(SLM),挑战了智能体需用大型语言模型(LLM)的假设。SLM参数量低于100亿,有低延迟、低成本等优势,还给出从LLMSLM迁移路线图。

AGI Hunt
新闻资讯7

Grok火爆全球,靠的居然是一个二次元金发美少女。

马斯克推出Grok的companion功能,3D虚拟人Ani是二次元金发美少女。功能上线后Grok热度大增,下载量在日本和中国香港冲第一。Ani有好感度系统,能换衣服,还可聊NSFW内容,引发用户兴趣。

数字生命卡兹克
算法论文7

DreamArt!只需一张图,生成可动的可交互物体

生成可动物体是具身智能等领域关键挑战,现有方法有局限。北大团队提出DreamArt框架,从单张图像生成可交互可动物体,经三阶段流程,表现优于基线方法,不过也存在生成不符物理规律等问题。

带你学AI
推荐文章8

AI Coding 赛道,Solo 创业、6 个月 8000 万卖掉,独立开发的新传奇

Maor Shlomo开发全栈无代码平台Base44,6个月获25万用户后8000万美元卖掉。他复盘了从搭建推广的全流程,分享产品切入点、与AI协作、渠道增长等经验,强调做喜欢之事,把握用户‘顿悟时刻’。

Founder Park
新闻资讯8

画质重生,第一!腾讯TEG香农实验室斩获CVPR 2025 UGC Video Enhancement 冠军

CVPR NTIRE是计算机图像恢复与增强领域有影响力的赛事。在NTIRE 2025 UGC Video Enhancement中,腾讯TEG香农实验室团队自研算法夺冠,成果落地提升视频清晰度。团队还参加实时赛道获佳绩,且做了硬件推理优化。

腾讯技术工程
算法论文8

《TAML》好文推荐 | 来自清华大学张宇飞团队最新研究成果 基于文本生成翼型:FoilCLIP,一种语言驱动的气动设计新框架

传统翼型设计依赖CFD和风洞试验,成本高。清华大学张宇飞团队提出端端双向映射框架FoilCLIP,通过对比学习建立文本与翼型几何双向映射,还提出数据增强策略,验证了其在语言驱动设计中的应用潜力。

力学与人工智能