多模态评估」共找到 1559 篇相关文章

算法论文8

生成式视角重塑监督学习!标签不只是答案,更是学习指南 | ICML 2025

上海交大等机构团队在ICML 2025提出预测一致性学习(PCL),通过扩散过程消减标签信息,引入噪声标签,将标签学习分解为渐进式任务,实现标签信息复用。在多模态任务实验中,PCL表现优于传统监督学习。

量子位
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
产品应用8

让问题不过夜:交易领域“问诊”Agent实践

文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。

阿里云开发者
新闻资讯8

深度讨论 Gemini 3 :Google 王者回归,LLM 新一轮排位赛猜想|Best Ideas

近期,OpenAI、Google、Anthropic 先后发布新模型,引发大模型竞赛。本文聚焦 Google 发布的 Gemini 3,从算力、数据、架构等维度剖析其强大原因,探讨大模型竞争新格局,还涉及多模态、硬件、商业化及产品形态等方面。

海外独角兽
算法论文8

机器人的「GPT时刻」来了?丰田研究院悄悄做了一场最严谨的VLA验证实验

丰田研究院(TRI)团队研究大型行为模型(LBM),在近1700小时机器人数据上训练并大量部署评估。发现LBM性能提升显著,预训练小数据量也能带来增益,预示机器人通用大模型或到来。

机器之心
算法论文8

一个模型统一4D世界生成与重建,港科大One4D框架来了

港科大研究团队提出 One4D 框架,可统一 4D 生成与重建,构造同步输出多模态的视频扩散模型,支持多种任务形态。其有 DLC、UMC 等亮点,用合成与真实数据混合策略训练,实验表现佳。

机器之心
算法论文8

TACL 综述 | 别只卷架构了——长文本模型的能力天花板,其实是数据决定的

该 TACL 综述首次从数据视角审视长上下文语言模型,指出长上下文能力本质是数据驱动。它建立分类体系,明确高质量长文数据条件,给出核心能力的数据配方与评估法,还整理数据集和基准,提出待解问题。

深度学习自然语言处理
开源动态8

256块NPU训成8B视频模型、超越Sora等一众闭源!抖音内容技术团队开源ContentV

近日,抖音内容技术团队开源ContentV,这是面向视频生成任务的高效训练方案。用256块NPU约4周训成8B参数模型,在多评估维度效果与主流方案相近,还探索了有限算力下训练路径,现推理代码与权重已开放。

机器之心
算法论文8

JCP | 南科大邹欣桐、王建春等:神经算子在三维湍流预测中的不确定度和稳定性分析

本文以三维各向同性湍流为例,提出面向神经算子的可信度评估框架,考察预测误差不确定度、长时迭代稳定性及流场时间相关性对模型可靠性的影响。结果显示,物理约束和合理时间步长可提升模型稳定性与可靠性。

力学与人工智能
开源动态8

社区供稿 | 阿里国际Ovis2.5重磅发布:以小博大,刷新开源模型性能新高度

阿里国际发布多模态大模型Ovis2.5,在OpenCompass综合得分提升,保持SOTA水平。它在原生分辨率视觉感知等三方面突破,有9B和2B两版本,代码、模型等资源已开源,技术原理涉及架构、训练与数据。

Hugging Face