「图像理解与生成」共找到 2990 篇相关文章
机器人从炫技 Demo 走向上岗,两篇 ICML 顶会论文拆解背后的智能底座
在WRC世界机器人大会上,云蝶科技发布RoboForge系统级具身大脑和WING任务型本体。其科研团队两项成果POLIA与Strat-Reasoner发表于ICML 2026,从视觉证据和他者意图两方面,为理解具身大脑技术提供切口。
1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了
Fable 5重新上线,Arena.ai的Gostev用其生成63个3D世界,多数一次成型,连Karpathy都直呼没想到。1600行代码就能撑起水下曼哈顿,还能将世界名画变成可穿行的3D世界,但游戏是其弱项。
国产「3D版Anthropic」再获数亿融资!60人初创,卡住全球3D脖子
影眸科技完成数亿元新一轮融资,发布全球首个具千万面级生成能力、引入‘先思考、再生成’逻辑的3D大模型Hyper3D Rodin Gen - 2.5。其有诸多优势,获多巨头认可,目标是定义空间智能底层规则。
一个文件让 AI Coding 效率翻倍:AGENTS.md 实践指南
文章围绕如何写好 AGENTS.md 展开,介绍其是给 AI 看的项目指令,能解决项目对 AI 不友好的痛点。还阐述了编写原则、实践方法、选择原因、模板和实施建议等,可让 AI 高效理解项目,提升开发效率。
GPT-Image-2全量上线,强出天际线
OpenAI的GPT - Image - 2虽未正式发布但已全量上线,实测在文字渲染、知识理解等方面超强大,有信息图、专辑封面、UI设计等多种玩法,Sam Altman官宣明天发布内容或含它,还可能宣布实现AGI时间。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
对话 Roto:让视频实时可交互、足够个性化,我们要做 AI 时代的 Netflix
Roto定位是全球首个互动开放世界视频平台。创始人David Xu曾就职独角兽企业,涉足多模态生成。团队经多次方向调整,决定大胆探索极致创新。目前产品技术不成熟,但已探索新内容形式,还将在广告实现商业闭环。
具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023
本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。
劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束
谷歌发布世界模型原型产品 Project Genie,只需一句话或图就能一键生成可玩、可交互实时虚拟世界。它借助 Genie 3 等构建,解决了早期世界模型多短板,虽现处实验阶段,但已引发热议,应用潜力大。