「开源视觉模型」共找到 8948 篇相关文章
DeepMind华人研究员Lun Wang离职,「评估」成制约模型能力飞跃的瓶颈
谷歌DeepMind研究员Lun Wang离职后发文指出,当下评估体系难以应对新模型,制约模型能力飞跃。现有评估多针对当前模型,新能力出现时往往无法预测,需构建能自我进化的评估系统。
告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜
DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。
马斯克都惊呼太强!阿里Qwen3.5又一波端侧小模型发布
上周阿里发布Qwen3.5中等规模超强模型,现又推出端侧小模型,获马斯克称赞。其智能密度翻倍且原生多模态,各型号有Base版。不同参数模型性能出色,阿里布局完整生态链,开启智能化未来。
一个全新的世界模型,终于让AI视频进入了“无限流”时代。
AI视频公司PixVerse推出实时世界生成模型PixVerse R1,用户可输入Prompt修改视频进程,无干涉时视频会自行延续。该模型为世界模型补上实时视频生成方向,实测体验乐趣十足。
Google开源DESIGN.md。玩AI,今年最该知道的Markdown!
Google开源DESIGN.md格式规范,对用AI coding的人很实用,可约束产品UI设计。开源社区已有70+大厂的DESIGN.md及自动提取的开源项目。还有汇聚大厂设计规范的仓库及可自动生成的工具,或成行业标准。
好看不等于会交互!阿里发布基于交互的世界模型基准
阿里等联合推出 Omni - WorldBench 评估框架,指出多数高颜值 AI 视频在物理规律和交互逻辑上有缺陷。该框架含提示词套件和量化评估框架,对 18 款模型测评,为 4D 世界模型研发指明方向。
少说‘Wait’,多做题:NoWait重塑大模型推理路径
现代大模型在复杂推理时爱用自我反思词,触发冗余验证循环,拖慢速度、增加算力消耗。NoWait方法零训练成本,通过抓关键词、扩展变体、实时屏蔽,让模型跳过废话,在多任务中表现出色,且颠覆对推理的认知。
Meta首席科学家LeCun:当前 AI 模型缺乏四项关键人类智能特质
在巴黎AI行动峰会上,Meta首席AI科学家Yann LeCun提出智能四项标准,指当前主流AI系统尤其语言模型在这些方面不足。他认为业界‘组合式’增强是‘功能修补’,介绍Meta‘世界模型’及V-JEPA模型。
WAIC抢先爆料:金融“黑马”大模型超DeepSeek刷新SOTA,论文已上线
WAIC期间,蚂蚁数科金融推理大模型发布会未开,论文已上线。其新模型Agentar - Fin - R1有8B和32B版,在金融测评集超DeepSeek等,还兼顾专业与通用,蚂蚁数科还提出评测基准Finova。
微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好
随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。