视觉-语言双视角」共找到 1746 篇相关文章

算法论文8

Apple发布新SOTA Manzano:混合Tokenizer破解多模态统一难题,理解与生成双翼齐飞

多模态AI前景广,但现有模型在理解和生成任务上存在性能冲突。苹果提出Manzano模型,用混合视觉标记器降低任务冲突,结构简单可扩展,在多基准测试达SoTA水平,还展示图像编辑潜力。

深度学习自然语言处理
算法论文8

UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力

大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。

深度学习自然语言处理
算法论文8

视听分离SOTA提速6倍!清华发布首个6M高性能模型|ICLR'26

清华大学团队推出Dolphin模型,仅用6M参数,通过离散化视觉编码和热扩散注意力机制,实现单次推理精准分离语音,速度提升6倍以上,在多项基准测试中刷新纪录,为端侧设备部署开辟新路。

新智元
产品应用8

我宣布,这就是现在人声最真实的AI音乐模型。

作者体验Minimax新推出的音乐模型Music 2.5,称其真实感强,中文无敌,咬字清晰,能唱维语等多语言。搭配粉丝开发的小工具,可尝试多种曲风,价格实惠,但功能有待完善。

数字生命卡兹克
新闻资讯3

马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?

Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。

AI寒武纪
产品应用7

为什么又是杭州?杭州初创团队打造全球第一个AI旅行伙伴

杭州初创团队打造的iMeanAI Coyage是全球首个AI旅行伙伴,能解决旅行规划中选择困难和信息过载问题,如订机票、酒店、行程,经测试表现出色,还将开放多语言语音导览功能。

AI工程化
推荐文章7

对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型

InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。

InfoQ
新闻资讯7

独家|美图入局 Visual Agent,Chance AI 完成数百万美元天使轮融资

美图布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。

Founder Park
开源动态8

动态RAG新工作:效果爆了,代码已开源

语言模型幻觉问题突出,现有动态RAG方法信号不可靠。QuCo-RAG从预训练语料库挖掘统计证据,用客观频率替代主观置信度,实现毫秒级幻觉检测与动态检索触发,代码已开源。

PaperAgent
新闻资讯7

哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈

哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。

量子位