「混合视觉标记器」共找到 894 篇相关文章
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。
用更一致的轨迹、更少的解码步数「驯服」掩码扩散语言模型,扩散语言模型的推理性能和效率大幅提升
扩散大语言模型发展迅猛,或成下一代大语言模型基础范式有力竞争者。复旦大学等团队发布论文,提出高效解码策略与强化学习训练组合,解决MDLM解码和训练问题,提升推理性能与效率。
阿里新研究:统一了VLA和世界模型
阿里达摩院等提出WorldVLA框架,融合视觉语言动作模型与世界模型。它用三套分词器编码,解决传统自回归模型问题,经联合训练,实验显示其性能优,两模型还能相互助力。
双管齐下:联邦学习防投毒攻击与梯度泄露,华南理工深北莫研究成果登上TMC与IoT
随着联邦学习在物联网系统广泛应用,数据隐私保护成难题。华南理工大学与深圳北理莫斯科大学合作,提出FedMSBA和FedMAR两种防御方法,分别解决参与方梯度泄露和服务器受攻击问题,在多方面实现突破。
一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率
DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。
AI 找到了六个 Erdos 数学问题,陶哲轩:AI + 人类专家才是真正改变科学研究的方式
菲尔兹奖得主陶哲轩分享,AI 在 Erdos 问题网站实验中,帮数学家发现六个原本标记为「未解决」的问题其实已被解决。他认为 AI 有价值的应用是处理枯燥日常工作,如文献搜索。
具身智能迎来ImageNet时刻:RoboChallenge开放首个大规模真机基准测试集
近日,RoboChallenge推出全球首个大规模、多任务真机基准测试。它构建开放、公正、可复现的‘真实考场’,为视觉 - 语言 - 动作模型提供评估标准,推动具身智能发展,还提供远程测试服务等。
首个Data Agent基准测试来了!2007个测试任务将数据库、PDF、视频、音频异构数据源一网打尽
南洋理工大学、新加坡国立大学与华为开源首个针对数据智能体异构混合数据分析的基准测试FDABench。它有2007个任务,覆盖多领域多数据源,独创协作框架,能测多种工作流模式的数据智能体。
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。