「多模态视觉理解模型」共找到 1935 篇相关文章
黄仁勋CES最新演讲:Rubin 今年上市,计算能力是 Blackwell 5 倍、Cursor 彻底改变英伟达软件开发方式、开源模型落后于先进模型约6个月
英伟达CEO黄仁勋在CES 2026演讲宣告AI从理解语言走向改造物理世界。他提及开源模型发展,还发布多款新品,如AlpaSim仿真框架、GROOT 1.6机器人模型、AI超算Vera Rubin等,凸显英伟达在AI领域的布局与野心。
估值 7 亿美元的 AI 语音输入产品:语音输入的关键问题是听写,不是转录
AI语音输入产品Wispr Flow发展迅猛,ARR 5个月翻10倍,公司估值超7亿美元。其创始人Tanay Kothari认为,该产品与其他同类最大区别是理解用户意图,解决听写而非转录问题,还分享了产品特点等内容。
Neuralink芯片入脑让瘫痪男子重新开口,家属泪崩!
伦敦一名患运动神经元疾病、几乎全身瘫痪的男子Paul,植入Neuralink脑机接口装置后,能用「意念」操控电脑打字。Neuralink核心装置N1芯片可捕捉脑信号,让机器理解大脑想法,但临床研究尚处早期,也面临数据归属等问题。
AI 画图不是玩具,而是可以变成效率工具 | 豆包 P 图Seedream 4.0 效率场景挖掘
作者测试豆包P图Seedream 4.0,发现它有对指令深度意图理解等能力且中文支持好。还分享用其提升效率的场景,如制作封面图、翻译图片文字等,也给出发掘AI应用场景思路和写画图提示词方法。
8个月营收提高4倍,n8n如何成为AI Agent最受欢迎的搭建平台?
n8n由前《加勒比海盗》视觉设计师创立,从工作流自动化工具升级为AI应用编排层。8个月营收提4倍,正进行超1亿美元融资。它能与AI无缝集成,有活跃社区,在多场景应用广泛,不过用户多为技术人员。
AI上清北,普通人该怎么办?|甲子光年
2025年AI模拟高考成绩达清北线,引发对人类努力意义的思考。三位嘉宾围绕AI能力进步、与人类能力差异、对教育和创作的影响等展开对谈,探讨人类在AI时代的定位、专业选择、教育变革等问题。
把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?
国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。
阿里首个世界模型:快乐…生蚝
刚成立一个月的阿里ATH事业群发布全球首个主动式实时交互世界模型HappyOyster(快乐生蚝),它搭载原生多模态架构,有漫游、导演、创造、分享等玩法,目前需邀请码体验。其技术突破让它区别于传统文生视频模型。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG已成大模型落地标配技术,但存在搜到对的文档、模型答案却离谱的痛点。德国萨尔大学等组成的团队诊断出问题在阅读理解,提出Disco - RAG框架,在“搜”和“答”间加“读懂”环节,已被ACL 2026主会录用。
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。