生成式UI」共找到 2642 篇相关文章

算法论文8

上下文记忆力媲美Genie3,且问世更早:港大和可灵提出场景一致的交互视频世界模型

交互长视频生成缺乏稳定场景记忆,制约下游应用落地。Google DeepMind的Genie 3有强场景一致性但未公开技术细节。港大和可灵提出的Context as Memory模型,上下文记忆力媲美Genie 3且投稿更早,还提升了计算效率。

机器之心
算法论文8

众所周知视频不能P?北大施柏鑫团队、贝计算CVPR研究:视频里轻松换衣服、加柯基

视频编辑难度高,传统流程繁琐,现有AI方法有局限。北大施柏鑫团队联合贝计算等提出VIRES方法,能实现视频主体多种编辑操作,还标注VireSet数据集。其在多指标超现有SOTA模型,团队还探索全景级可控视频生成

机器之心
产品应用7

阿里首个世界模型:快乐…生蚝

刚成立一个月的阿里ATH事业群发布全球首个主动实时交互世界模型HappyOyster(快乐生蚝),它搭载原生多模态架构,有漫游、导演、创造、分享等玩法,目前需邀请码体验。其技术突破让它区别于传统文生视频模型。

量子位
7

马斯克从英伟达挖人做AI游戏!第一步:研发世界模型

据《金融时报》报道,今年夏天xAI从英伟达挖来多名资深研究员入局世界模型。马斯克重申2026年底前发布AI生成游戏的目标,xAI首批落点或为电子游戏,还组建全模态团队,若各板块通过世界模型互通,其AI帝国将形成闭环。

量子位
推荐文章7

为什么我用了那么多提示词模板甚至用了 AI 帮忙还是写不好提示词?

现在很多人觉得模型强大,提示词工程没必要,但复杂需求仍需它。作者以写雷军演讲提示词和YouTube字幕生成提示词为例,介绍迭代创作过程,指出写不好提示词根源是难评估差距和调整。

宝玉AI
算法论文8

比RAG高出8.9%,百度TURA:让搜索引擎“动”起来的下一代AI Agent架构

现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户需实时数据的问题。百度TURA用工具调用把RAG升级为动态交互,其核心分检索、规划、执行三步,已在百度亿级流量场景跑通。

PaperAgent
算法论文8

像开发软件一样造世界,Agent2World来了,把世界模型做成可运行的符号环境

为让模型真正“能行动”,需可执行、可验证的符号世界模型,但现有自动生成路线有困局。研究团队提出 Agent2World,经实验验证有显著效果,能稳定产出高质量符号世界模型,开辟 AI 理解现实环境新可能。

机器之心
新闻资讯8

AI「生肉证明」堆爆GitHub!陶哲轩重磅发声:只会解题没用了

陶哲轩判断数学从证明稀缺进入过剩时代,AI 使证明生成加速,出现验证和消化跟不上的‘阻抗失配’现象。如 Erdős 问题有众多待评估方案堆积,而仅1196号案例跑通‘三件套’。他还指出学术评价体系将重写。

新智元
新闻资讯8

陶哲轩:AI 已经把想法成本降到几乎为0了...

著名数学家陶哲轩在与播客主持人Dwarkesh Patel的对谈中分享使用AI一年后的观点,认为AI已将想法生成成本降至几乎为零,但验证和评估成新瓶颈,还探讨其对数学研究的影响及未来发展。

AI寒武纪
产品应用8

劈柴哥和哈萨比斯亲自站台!谷歌世界模型Project Genie刷屏,幕后团队揭秘60秒不是极限,内存是巨大约束

谷歌发布世界模型原型 Project Genie,用一句话或图就能生成可玩交互的实时虚拟世界,由劈柴哥和哈萨比斯站台。它基于 Genie 3、Nano Banana Pro 和 Gemini 构建,解决了世界模型长期以来的短板,目前处于实验阶段。

InfoQ