「多模态搜索」共找到 1304 篇相关文章
治好多模态近视和走神!上海大学去偏干预显著提升模型性能
多模态大模型存在“近视”和“走神”问题,总是过度关注图像底部而忽略核心内容。上海大学与南开大学研究团队用两条数学公式去偏干预,无需增加计算成本,却能显著提升主流模型视觉理解能力。
How To Play AI Beta:拾象 2026 AGI 投资思考开源
这是拾象团队的 AI 投资思考报告,复盘当下竞争时局,拆解 2026 年核心技术与产品趋势。分析了头部模型格局、技术路线、算力阵营等,探讨投资策略,还提及多模态、机器人、Agent 等领域发展。
阿里新王牌千问 APP 曝光:全面硬刚 ChatGPT
11月14日阿里开启「千问 APP」公测,其集成通义千问 Qwen 系列顶尖模型,有多模态能力。它对标 ChatGPT,在中文语境和结构化输出上有优势,实测处理财报、麻将推理等表现佳。
RAE的终极形态?北大&阿里提出UniLIP: 将CLIP拓展到重建、生成和编辑
北大和阿里团队提出 UniLIP,解决了统一多模态模型中语义理解与像素重建的矛盾。它创新微调 CLIP,实现图像重建,还提出双条件架构用于生成和编辑,在多基准取得 SOTA 性能。
腾讯发布超低成本AI训练法!120元效果秒杀70000元微调方案
腾讯提出无训练组相对策略优化Training-Free GRPO,无需调整参数,在提示词中学习经验就能提升模型性能。实验显示,该方法在数学推理和网页搜索任务上效果显著,成本远低于传统方法。
CEO 刚离职,GitHub 就瘫了?!程序员“乐土”没了,4年CEO自曝在微软受限干不下去,被开发者骂蠢喊冤
当地时间8月11日,GitHub首席执行官Thomas Dohmke宣布辞职,次日GitHub搜索出现故障。微软收购GitHub后,其将更全面融入微软架构,不再设单一领导者。Dohmke自曝受限多,他认为未来Agent代码质量或超人类。
开源黑科技!向量数据库,居然要被 MP4 给干掉了!
GitHub开源项目Memvid,能用MP4视频文件替代昂贵的向量数据库,检索达亚秒级。它把文本编码成视频,用配套JSON索引记录位置,结合sentence-transformers和FAISS实现语义搜索,存储和检索性能出色。
谷歌AI核爆:升级全系模型,Gemini 2.5双榜登顶!所有产品用AI重做,OpenAI如何接招?
北京时间5月21日凌晨,谷歌在2025 I/O大会发布众多更新。模型层面,为Gemini 2.5 Pro引入新推理模型和2.5 Flash;谷歌搜索推出AI模式;还亮相视频模型Veo 3,编码助手Jules公测等。
太强了 Yan!腾讯打造的全能交互视频生成引擎
腾讯提出的面向交互式视频生成的基础性框架 Yan,集 AAA 级模拟、多模态生成和多粒度编辑于一体,为下一代 AI 内容引擎提供可行路径,但也面临长时视频视觉一致性不足等问题。
Agent性能暴涨90%,刷榜GAIA可太容易了~
今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。