视觉知识」共找到 1118 篇相关文章

新闻资讯7

AI搜索引擎,苹果决定自研!代号WKA

据彭博社记者爆料,苹果预计明年春季推代号“世界知识问答”的AI搜索引擎,与ChatGPT等竞争;当下倾向用谷歌模型支持Siri部分功能。此前曾考虑收购Perplexity,现风向转变。

量子位
新闻资讯8

GPT-5.4 vs Opus 4.6 vs Gemini 3.1:五条结论

2026年3月前沿AI竞争激烈,GPT - 5.4、Opus 4.6、Gemini 3.1 Pro各有千秋。GPT - 5.4领先知识和计算机使用,Gemini 3.1 Pro以低价主导推理,Opus 4.6编程能力强,无单一模型通吃各领域。

PaperAgent
算法论文8

去掉像素中介!上海交大让AI边看边想边画,用同一个“大脑”跨模态推理

上海交大等团队提出LatentUM架构,摒弃像素解码中介,在共享语义潜空间跨模态思考。它用MBAQ技术转化视觉特征,设计MoME架构,还能自我反思、规划路线、模拟世界演变,表现出色。

AIGC开放社区
算法论文8

只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026

多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。

量子位
算法论文8

Sora没做到的,LongVie框架给解决了,超长视频生成SOTA

视频生成近年进步大,但生成超1分钟高质量长视频仍难。上海人工智能实验室等机构提出LongVie框架,解决时序不一致和视觉退化问题,还推出评测基准LongVGenBench,该框架在多项指标达SOTA。

机器之心
产品应用8

Qwen3-LiveTranslate:视、听、说全模态同传大模型!

Qwen3-LiveTranslate-Flash 是基于大语言模型的多语言实时音视频同传模型,依托 Qwen3-Omni 能力与海量数据,有多语言和方言支持、视觉增强等亮点,性能超主流大模型。

通义千问Qwen
新闻资讯7

对话阶跃星辰段楠:“我们可能正触及 Diffusion 能力上限”

阶跃星辰段楠指出当前视频生成技术或触天花板,真正有深度理解能力的模型尚待突破。他预测未来1 - 2年视觉领域基础模型有望出现,还分享视频生成及多模态AI未来核心洞察。

AI科技大本营
算法论文8

LLM的快速、慢速与工具增强思维模式综述

大型语言模型在不同任务中对推理策略需求差异大,策略选择不当会影响效率与可靠性。本文提出双重知识边界框架,梳理LLMs推理模式,将策略选择形式化,还分析了决策因素及策略选择机制。

深度学习自然语言处理
算法论文8

Relink:为GraphRAG动态构建证据图

大语言模型在开放域问答中有‘幻觉’问题,GraphRAG结合LLM与知识图谱缓解此问题,但现有方法有缺陷。作者提出‘推理并构建’新范式和Relink框架,实验显示其性能领先,对RAG系统设计有启示。

PaperAgent
开源动态8

19K star 霸榜,下一代的浏览器自动化神器!

做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。

开源先锋