「多模态视觉语言模型」共找到 2249 篇相关文章
商汤SenseNova U1深度拆解,原生统一架构终结缝合时代
文章深度拆解商汤科技开源的新一代模型「日日新 SenseNova U1」,介绍其基于 NEO - Unify 原生统一架构,在数据、训练与推理深度协同,多维度测试成绩亮眼,代表多模态从拼接走向原生建模新方向。
恐怖的 361k+ star!这应该是我见过最给力的宝藏项目,全网最全!
介绍GitHub上的开源项目`free-programming-books`,它汇集海量免费编程学习资源,涵盖编程语言、框架、工具等多方面,有361k+ star。资源广、更新快、结构清、支持多语言,使用简单。
AI翻译的「最后一公里」
文章指出文化差异成AI翻译难题,通用大模型数据不平衡,存在“算法霸权”。如处理低资源语言,AI易产生幻觉,还因无肉身难理解基于生理体验的隐喻,人机协作才是翻译未来。
商汤林达华万字长文回答AGI:4层破壁,3大挑战
在WAIC 2025上,商汤发布国内首个实现“图文交错思维”的商业级大模型日日新6.5。商汤科技联合创始人林达华发文,剖析多模态通用智能实践,解答AI领域关键问题,提供通往AGI的参考。
Loop-ViT:让AI学会「反复思考」,3.8M参数小模型追平人类平均水平
香港科技大学等团队提出 Loop - ViT,将循环 Transformer 引入视觉推理领域。该模型参数少但性能强,3.8M 小版本追平人类平均水平,揭示视觉推理任务中‘思考时间’比‘模型大小’更重要。
阿里 Qwen3-TTS 全新上线!支持9种方言+49种音色,连天津味儿都拿捏了!
阿里通义团队上新 Qwen3-TTS 文本转语音模型,主打拟人语音表达、丰富音色体系与多语言多方言能力。有 49 种高保真音色,支持 10 种语言、9 种方言,还能智能调节语速和韵律。
设计行业天塌了!Anthropic再推王炸产品Claude Design:设计稿、原型、PPT一句话搞定
Anthropic推出平台级产品Claude Design,用Claude Opus 4.7模型助力设计。它能让各类用户完成视觉内容创作,有多种使用场景和便捷工作流程,还给出内部设计师使用建议。
统一框架下的具身多模态推理:自变量机器人让AI放下海德格尔的锤子
当前先进机器人无法像人类自如用工具,现有多模态系统有局限。自变量机器人提出端到端统一架构,以统一表示学习和多任务多模态生成解锁具身多模态推理能力,实现范式转换。
独家|前DeepSeek核心研究员魏浩然出任百度文心多模态算法负责人
9月3日消息,原DeepSeek核心研究员魏浩然带队转入百度,任文心大模型多模态算法负责人。此前他在多模态与端到端OCR底层重构有突出成绩,这是百度布局青年顶尖研发人才的又一动作。
让代码接管世界演化,西湖大学发布Code视频世界模型
西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。