「多模态技术」共找到 3548 篇相关文章
高考数学全卷重赛!一道题难倒所有大模型,新选手Gemini夺冠,豆包DeepSeek并列第二
因网友质疑上次测评不严谨,此次用六款大模型挑战含解答题的全套高考数学题。结果Gemini 2.5 Pro夺冠,Doubao和DeepSeek R1并列第二。解答题是失分重灾区,图像题难倒多模态大模型。
AI越来越强大,如果客户都去自研了,那企业软件市场会怎么样?
AI能力变强、门槛降低,引发企业软件开发是否会被颠覆的讨论。企业不会自建核心系统,因要专注核心业务且不想承担维护等成本。真正威胁是用AI重新设计产品的同行,技术更替规律下传统SaaS公司需警惕。
Builder.ai 破产背后:700 名工程师伪造 AI 是假,重复造轮子及财务造假是真
印度AI独角兽Builder.ai破产引发关注,此前有说法称其用700名工程师伪造AI。经与前员工沟通,这一说法不实。该公司搭建了AI工具Natasha,技术栈含Python、GPT等,但存在重复造轮子、财务欺诈等问题致破产。
DeepSeek V4没做的,MiniCPM-o 4.5给做「全」了~
上周 DeepSeek V4 发布,遗憾不是多模态。今天 MiniCPM-o 4.5 补上短板,凭 9B 参数实现端到端全双工全模态大模型,自 2026 年 2 月发布后 Hugging Face 下载量超 25 万。还推出多项成果,性能表现出色。
豆包的新身份曝光:在国际艺术展当起了“AI讲解员”
文章讲述作者在浦东美术馆「AI与艺术」豆包讲解体验日活动的经历,实测豆包作为AI讲解员的业务水平,如筛重点、实时讲解、补知识,还揭秘其靠豆包大模型1.8的多模态处理等能力任职。
LLM算力告急?把文本变图片,推理成本直接减半!
大型语言模型处理长文本时计算成本高,本论文探索‘文本即图像’输入压缩策略,将长文本渲染为图像输入多模态模型,可减少近一半令牌,且任务性能不受显著影响,在多任务中验证了其有效性。
LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!
Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。
诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计
过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。
弯道超车?国产具身,千小时人类数据激发智能涌现
近日,深度机智用人类学习范式在国际 Benchmark 上击败巨头,成果两会首日被央视报道。其全新架构源于一年多积累。英伟达也有人类学习尝试。深度机智构建全栈技术矩阵,成果显著,3 月底成果将开源。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。