像素级生成」共找到 2999 篇相关文章

算法论文7

机器人从炫技 Demo 走向上岗,两篇 ICML 顶会论文拆解背后的智能底座

在WRC世界机器人大会上,云蝶科技发布RoboForge系统具身大脑和WING任务型本体。其科研团队两项成果POLIA与Strat-Reasoner发表于ICML 2026,从视觉证据和他者意图两方面,为理解具身大脑技术提供切口。

AI科技评论
推荐文章7

大模型之外,向量存储如何支撑 Agent 的检索链路

文章指出大模型负责理解、推理和生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。

阿里云开发者
推荐文章8

11篇顶会论文之外,美图影像研究院做了一件事:让大众爱用AI

过去两年,AI 生成图片、视频变得容易,但让 AI 理解并按创作者意图创作很难。美图影像研究院过去几年围绕高频创作场景痛点展开研究,11 篇论文被国际顶会接收,成果通过产品落地转化为 AI 影像能力。

机器之心
新闻资讯7

1600代码造出水下曼哈顿, Fable 5让Karpathy看呆了

Fable 5重新上线,Arena.ai的Gostev用其生成63个3D世界,多数一次成型,连Karpathy都直呼没想到。1600行代码就能撑起水下曼哈顿,还能将世界名画变成可穿行的3D世界,但游戏是其弱项。

新智元
新闻资讯7

Anthropic最新博客:MCP没有死,我们又救活了。

2个月前Eric Holmes认为MCP已死,因其有Token成本等问题且LLM本就会用命令行。但本周Anthropic发博客称想清MCP定位,它不是替代CLI,而是覆盖其到不了的地方,还给出改进方案,MCP月下载超3亿次。

探索AGI
算法论文8

超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26

大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。

新智元
算法论文8

最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代

人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。

机器之心
推荐文章7

对话 Roto:让视频实时可交互、足够个性化,我们要做 AI 时代的 Netflix

Roto定位是全球首个互动开放世界视频平台。创始人David Xu曾就职独角兽企业,涉足多模态生成。团队经多次方向调整,决定大胆探索极致创新。目前产品技术不成熟,但已探索新内容形式,还将在广告实现商业闭环。

Founder Park
新闻资讯7

在参与OpenAI、Google、Amazon的50个AI项目后,他们总结出了大多数AI产品失败的原因

Aishwarya Naresh Reganti 和 Kiriti Badam 参与超50个企业AI产品构建。他们指出,如今AI产品构建成本降低,但多数仍失败。还分享开发陷阱与路径,如从低自治高控制起步、建立CC/CD框架等,也对AI未来发表看法。

InfoQ
产品应用8

劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束

谷歌发布世界模型原型产品 Project Genie,只需一句话或图就能一键生成可玩、可交互实时虚拟世界。它借助 Genie 3 等构建,解决了早期世界模型多短板,虽现处实验阶段,但已引发热议,应用潜力大。

AI前线