「多模态大模型智能体」共找到 9766 篇相关文章

算法论文8

首个测试时共进化合成框架TTCS:在「左右互搏」中突破推理瓶颈

厦门大学DeepLIT课题组提出全新测试时课程合成框架TTCS,不依赖外部标注,通过生成器与求解器共进化博弈合成课程数据,解决测试样本过难导致的训练坍塌问题,实验显示其推理能力提升显著。

机器之心
算法论文8

综述解读:Memory in the Age of AI Agents

文章围绕《Memory in the Age of AI Agents》展开,指出传统方案难解决Agent长期智能问题,Agent Memory是关键。介绍其形式、功能、动态机制,分析挑战并预测未来方向,为设计记忆系统提供指南。

CourseAI
新闻资讯7

Gemini 3 上线两周,ChatGPT 日活下降 6%,Altman 内部信拉响红色警报

2025年12月初,AI领域权力转换,Google新一代多模态模型Gemini 3挑战ChatGPT。自其发布两周,OpenAI日活降6%。Sam Altman发内部信拉响警报,要求聚焦提升ChatGPT核心体验。

MacTalk
产品应用7

Gemini 3来了,Software 3.0也快了

作者认为Gemini 3是目前最好的模型,编程时前端用Gemini 3,后端用Codex。无编程需求时,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。

newtype AI
算法论文8

NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临

传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。

机器之心
算法论文8

轻量高效,即插即用:Video-RAG为长视频理解带来新范式

现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。

机器之心
产品应用8

国产手机正从底层重构安卓!vivo版AI OS亮相了

在vivo开发者大会上,OriginOS 6正式亮相,AI功能全面更新,还首次上线Live Photo的AI消除。它用自研技术重构安卓底层核心,首发蓝河流畅引擎,从计算、显示、存储三大模块优化。

量子位
算法论文8

从「会说」迈向「会做」,LLM下半场:Agentic强化学习范式综述

过去LLM训练多依赖PBRFT范式,但局限明显。2025年初起,Agentic RL新范式受关注。此综述论文梳理该方向,覆盖500+研究,构建理论框架,讨论未来挑战,助LLM从「会说」迈向「会做」。

机器之心
开源动态8

狂揽6.9K star!!微软又来一款王炸项目,实时跟踪、透明可控,牛皮!

微软开源项目Magentic-UI狂揽6.9K star。它是“以人为本”网页智能助手,基于AutoGen框架,可让用户全程掌控,能实时跟踪、透明可控,有协同规划等功能,适合测试、分析等人员。

开源先锋
算法论文8

快慢Reasoning综述!

大型语言模型在复杂推理任务中有‘无差别计算’缺陷,阻碍其在多场景应用。本文提出双层效率优化框架,梳理两类前沿技术,通过实验揭示瓶颈,为轻量化推理指明路径。

深度学习自然语言处理