多模型兼容」共找到 9757 篇相关文章

算法论文8

VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应

模态大模型处理参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。

机器之心
产品应用8

X爆火Overleaf科研辅助神奇PaperDebugger

当下学术写作借助大语言模型辅助时,流程繁琐且上下文易丢失。新加坡国立大学团队推出的 PaperDebugger 是基于插件的智能体系统,寄生在 Overleaf 编辑器内,可完成任务,解决现有工具不足。

深度学习自然语言处理
新闻资讯7

在WAIC,比起看机器人打拳,人们更想知道怎么用AI赚钱

7月27日普通观众参观日,WAIC现场火爆。本届大会规模为历届之最,机器人与模型厂商纷纷展示落地应用。机器人从“能动”走向“会干”,模型厂商聚焦场景,投融资锚点转向商业指标。

芯师爷
算法论文8

推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品

在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。

量子位
算法论文8

UIUC提出隐式监督新范式:无需标注/RM即可全面提升模态Reasoning的感知能力

大型模态模型在复杂模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在模态基准上表现优异,还解决了KL黑客问题。

深度学习自然语言处理
产品应用8

首创双NPU架构一鸣惊人!联发科天玑9500重磅加码主动式AI体验

联发科天玑9500首创超性能+超能效双NPU架构,让AI始终在线,融入用户操作。其输出性能、上下文窗口等有显著提升,还解决了模型加载慢等问题,与厂商合作推动端侧AI落地。

量子位
开源动态8

紫东太初开源视觉神经增强方法,即插即用终结模态幻觉 | ACL 2025

中科院自动化所等团队提出VHR方案,通过“视觉神经增强”机制放大模型视觉关键注意力头输出,降低幻觉现象。此前主流方法作用于最终输出阶段,VHR深入干预内部机制,还介绍了SSL语义引导方法。

量子位
算法论文7

VaseVQA:考古领域实现专家级,诊断+补弱RL框架

在文化遗产与人工智能交叉领域,研究人员提出把大型模态模型放于‘诊断—补弱—精细化评估’闭环训练,配套结构化评测基准,让模型在文化遗产领域接近专家级能力。介绍了技术步骤、数据基准及关键发现等。

新智元
算法论文7

一段 signature,不仅撬开了 Opus 的隐藏推理,还让 Kimi、GLM 露出了"熟悉感"

研究者发现,将 Opus 等强模型返回的加密推理块交给同家族弱模型,弱模型可能转写出隐藏内容。如用 Haiku 读取 Opus 的加密信息。此外,公开的 Agent 轨迹存在隐私泄露风险,部分开源模型易受 Opus 风格影响。

深度学习自然语言处理
新闻资讯7

智能流体力学青年学者论坛第30讲~33讲

智能流体力学青年学者论坛第30 - 33讲将于2026年3月6日举办,由中国空气动力学会智能流体力学专委会主办。报告涵盖迈向大语言模型时代的自动化智能CFD工作流等主题,位学者将分享最新研究成果。

力学与人工智能