视觉语义场景补全」共找到 2595 篇相关文章

算法论文8

RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑

北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。

机器之心
算法论文8

斯坦福新论文:微调已死,自主上下文当立

斯坦福大学等机构研究人员新论文指出,依靠上下文工程,无需调整权重,模型也能变聪明。他们提出智能体上下文工程ACE,不依赖模型重训,让上下文自主进化,在多场景测试中表现优于多种方法。

量子位
新闻资讯7

AI产品能不能火,全看创始人会不会当“网红”?这届AI大佬不拼代码了,个个都是隐藏的社交媒体达人

本文指出当下AI创业者纷纷成社交媒体达人,利用小红书等平台为产品冷启动。还强调社交传播对AI产品至关重要,但不能替代技术壁垒。同时分析初创公司应深耕场景,抓住时间差打造竞争力。

AI前线
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景

新智元
新闻资讯7

在WAIC,比起看机器人打拳,人们更想知道怎么用AI赚钱

7月27日普通观众参观日,WAIC现场火爆。本届大会规模为历届之最,机器人与模型厂商纷纷展示落地应用。机器人从“能动”走向“会干”,模型厂商聚焦场景,投融资锚点转向商业指标。

芯师爷
开源动态8

开源黑科技!向量数据库,居然要被 MP4 给干掉了!

GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。

AGI Hunt
产品应用7

用AI写PPT,没想到效果这么好啊

文章聚焦用 CodeBuddy 写 PPT,先指出写 PPT 的痛点,介绍 CodeBuddy Skills 解决方案,接着阐述安装、实战场景、使用技巧,深度剖析 PPT Skill 原理、架构等,最后说明优势与局限,助力摆脱 PPT 难题。

腾讯技术工程
产品应用8

太强了 Yan!腾讯打造的全能交互视频生成引擎

腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。

带你学AI
开源动态8

DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了

过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。

AI科技评论
推荐文章7

“被投资人怒怼30分钟后,我更确定中国To B的答案” | 甲子光年

文章讲述百融云创在AI To B领域的探索。它突破传统“卖工具”模式,采用“结果计价”,共担结果、承包KPI。技术上提前押注语音对话技术栈,“硅基员工”概念落地多场景,有望推动中国To B行业进入新秩序。

甲子光年