视觉语义词元」共找到 1149 篇相关文章

算法论文8

ICLR 2026 | 当视频难以被表征:UCSD、HKUST等机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式

计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab等机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。

机器之心
算法论文8

只用图像也能思考,强化学习造就推理模型新范式!复杂场景规划能力Max

现有 MLLM 依赖文本处理视觉信息,会造成信息丢失。剑桥、伦敦大学学院、谷歌团队提出视觉规划范式,以强化学习框架 VPRL 提升模型规划能力,实验显示其性能优于文本规划。

机器之心
算法论文8

浙大推出首个「多图应用题」基准GSM8K-V,全面评估 VLM数学推理能力

浙江大学团队推出视觉数学推理基准GSM8K-V,将GSM8K映射为视觉对应版本。它数据可靠、覆盖全面,经三阶段构建。实验显示,现有视觉语言模型在视觉推理上短板明显,为模型发展指明方向。

新智元
推荐文章7

一行代码不写,龙虾军团日夜为我打工赚钱

油管科技博主Matthew Berman分享0代码OpenClaw使用心得,其龙虾数字员工能处理商务邮件等工作。他靠提示+Vibe Coding实现‘躺赚’,还分享多场景龙虾玩法,且公开提示

量子位
推荐文章7

17000字Claude 系统提示启示:Karpathy 揭秘LLM 学习缺失“第三范式”

Andrej Karpathy提出LLM学习范式缺失‘系统提示学习’环节。他观察Claude约17000的系统提示,认为目前问题解决策略多靠人工写入,理想情况应通过该学习产生,这也引出诸多待明确细节和新问题。

AI寒武纪
算法论文8

腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”

视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。

深度学习自然语言处理
算法论文7

一句话,性能暴涨49%!马里兰MIT等力作:Prompt才是大模型终极武器

马里兰大学、MIT、斯坦福等机构研究发现,AI性能提升一半靠模型,一半靠提示。他们让DALL - E 2和DALL - E 3 PK,发现DALL - E 3性能提升中,模型升级贡献51%,提示优化贡献49%。

新智元
开源动态8

刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!

小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。

新智元
算法论文8

DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角

DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。

AI寒武纪
算法论文7

DeepMind 提出 CaMeL,抵御 LLM 提示注入

谷歌DeepMind研究人员提出CaMeL,作为围绕LLM的防御层,通过提取查询中的控制流和数据流阻止恶意输入,能在AgentDojo基准测试中抵御67%攻击,采用传统软件安全原则。

InfoQ