全模态推理」共找到 3737 篇相关文章

新闻资讯7

OpenAI的新浏览器实测被吐槽疯了?走“乔布斯风”、挖谷歌骨干,奥特曼就“复制”出个ChatGPT版Chrome?

OpenAI发布新网页浏览器ChatGPT Atlas,其将ChatGPT置于网页体验核心,有常驻侧边栏助手等功能。虽冲击谷歌,但用户实测反馈不一,且此类智能代理浏览器存在新安风险。

InfoQ
新闻资讯7

meta收购manus的几点看法

探讨Meta收购Manus双方视角。Meta认为Manus有销售前景,想吃利润;Manus因无流量属性、壁垒低、天花板低等因素,被收购或是好选择,还提及编程工具效用问题。

Agent的潜意识
算法论文8

迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合的巨大待探索空间

大模型常采用RAG技术,多模态崛起使RAG向MM - RAG发展。目前MM - RAG研究初级,华中科技大学等研究者发布综述,覆盖所有模态组合,剖析工作流,提供构建系统的一站式指南。

机器之心
算法论文8

AI失忆术!只需3个注意力头,就能让大模型忘记「狗会叫」

Meta和纽约大学团队发布论文《From Concepts to Components》,提出SAMD和SAMI方法。前者定位模型概念注意力模块,后者微调强度。能让模型‘失忆’,还可增强推理、控制安,为AI研究开新方向。

新智元
算法论文8

OmniInsert:新无掩码视频插入技术

基于扩散模型的视频插入技术发展快,但以往方法有局限。字节提出InsertPipe和OmniInsert,解决数据不足等难题。OmniInsert设计巧妙,还建立评测平台InsertBench,虽有小问题,但推理快,可加速优化。

带你学AI
产品应用7

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%

小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。

CourseAI
新闻资讯8

黄仁勋三次断言翻车!CUDA护城河,被谷歌一行代码凿穿

本文是新智元报道,基于SemiAnalysis的第三方测试,谷歌第七代TPU Ironwood推理性价比大幅领先英伟达最新B200、B300,谷歌通过软件重构打破CUDA护城河。

新智元
开源动态8

工程师狂喜!Qwen3-VL 检索双雄效率翻倍

通义大模型开源Qwen3-VL-Embedding和Qwen3-VL-Reranker,解决多模态检索难题。两模型多模态兼容,双塔+单塔协同提速,实用主义拉满,集成成本低,实战表现超预期。

CourseAI
开源动态8

字节开源了一款多模态神器!BAGEL上线,超越Qwen2.5-VL,媲美SD3!

模态AI发展进入新阶段,字节跳动开源通用多模态大模型BAGEL。它支持多模态输入输出与思维链推理,性能超Qwen2.5 - VL等,安装使用友好,有多种应用场景。

开源星探
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位