视觉语言对齐模型」共找到 1764 篇相关文章

推荐文章7

快速理解热门LLM大语言模型

本文用通俗易懂方式帮读者理解LLM、Transformer、Prompt等基本概念,介绍大模型API使用,如温度参数、角色设定等,还提及Function Calling、Agent、MCP等内容,并对AI未来发展作出假想。

腾讯技术工程
产品应用8

华为Doc-Researcher 布局感知+视觉语义双杀

现有深度研究系统依赖文本网页数据,忽视多模态文档知识。华为Doc - Researcher系统解决多模态文档解析不足、检索策略有限、缺乏深度研究能力等问题,含多模块,能处理复杂多模态任务。

CourseAI
算法论文8

苹果新作:内化视觉思考,推理提速 5 倍

Apple研究团队提出Internalized Visual Thinking(IVT),一种将预测性世界建模能力内化到模型表征中的后训练框架。它在训练时预测未来,推理时直接回答,相比Visual CoT推理提速超5倍。

机器之心
算法论文8

Feed-Forward 3D综述:三维视觉如何「一步到位」

这篇由12所机构联合撰写的综述论文,总结2021 - 2025年间数百项创新工作,建立Feed - Forward 3D方法谱系与时间线,介绍五大技术分支、应用场景、评测指标与结果,还指出未来挑战与方向。

机器之心
算法论文8

LangFlow: 挑战离散扩散,探索下一代语言模型新范式

UIUC Ge Liu团队发布《LangFlow: Continuous Flow Matching for Large Language Models》,回归连续扩散架构。研究指出连续扩散受挫非先天缺陷,经优化,LangFlow让连续扩散在标准基准追平离散扩散,为多模态统一架构打通底层路线。

机器之心
推荐文章8

大型语言模型正在掏空和填满你的钱包

人工智能改变赚钱和花钱方式,生成式AI每年或为全球经济增2.6 - 4.4万亿美元。文章介绍LLM在多领域应用,如客服降成本、内容创作提效率等,企业应积极拥抱技术革命。

AIGC开放社区
开源动态8

ROLL:面向大规模语言模型的高效强化学习框架

本文介绍阿里推出的ROLL强化学习框架,专为LLM训练优化。它设计灵活,不同用户可用其满足业务、探索或线上指标需求。在多任务训练中性能出色,还采用创新机制提升效率,支持自定义操作,适合学术和业务场景。

阿里云开发者
算法论文8

刚刚,何恺明团队新作,「嵌入式语言流」ELF来了

何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。

机器之心
算法论文8

准确率腰斩!大模型视觉能力一出日常生活就「失灵」

EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。

量子位
算法论文8

NeurIPS 2025 Spotlight | 条件表征学习:一步对齐表征与准则

文章指出传统表征学习处理图片和商品信息时存在局限,针对性有监督训练成本高,多模态大模型使用成本也需考虑。为此提出即插即用的条件表征学习方法 CRL,实验显示其在下游任务表现优异。

机器之心