视频数据集」共找到 3402 篇相关文章

算法论文7

近期,不错的LLM Agent统一记忆框架综述~

随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据复现比较10个方法,还设计出新的低token开销框架。

PaperAgent
算法论文8

SmartSearch:奖励驱动query精炼,让Agent中的RAG会“改错”

现有LLM搜索Agent忽视‘如何提问’致答案易出错。SmartSearch提出‘过程奖励+查询精炼’双机制,让Agent学会‘写不好就改’,代码已开源。经实验,它在六数据全面领先,各机制缺一不可。

PaperAgent
算法论文8

从捍卫者到引路人,上交&上海AI Lab提出LEGION:不仅是AI图像伪造克星,还能反哺生成模型进化?

AIGC技术发展使AI图像滥用问题严重,公众面临信任危机。上交与上海AI Lab等团队在论文中从构建数据、设计模型、实现检测与生成统一三方面破局,LEGION能检测伪造,还可反哺生成模型进化。

机器之心
算法论文7

清华-腾讯联手:音频 - 视觉多模态任务统一框架

Crab是人大、清华和腾讯合作论文提出的模型,目标是高效一统多模态场景理解任务。它解决了音频 - 视觉理解模型任务干扰、合作显式化不足等难点,通过构建数据、设计结构和统一架构实现多任务合作。

CourseAI
开源动态8

蚂蚁具身研究首次亮相!就解决了机器人「看」透明玻璃这些难题,还开源了

蚂蚁灵波科技开源高精度空间感知模型 LingBot-Depth,针对性解决机器人识别真实世界的「玻璃问题」。其构建双线并行数据,提出掩码深度建模思路,在深度补全等任务中表现出色,且已具备落地能力。

机器之心
算法论文8

让GUI Agent不再「边做边忘」:快手、浙大提出MemGUI-Agent,攻克长程GUI任务

手机GUI Agent在长程任务中易遗忘关键信息,浙江大学APRIL实验室和快手主站技术部提出MemGUI - Agent,核心是ConAct,将上下文管理变为Agent动作,还开源MemGUI - 3K数据,模型在评测基准取得佳绩。

量子位
开源动态8

Agent记忆赛道大洗牌!LoCoMo-Refined重磅发布,主流记忆框架迎来核心检验

南京大学与上海人工智能实验室联合推出 LoCoMo-Refined,这是严苛的 Agent 记忆评测基准。它指出当前记忆评测基准有两大漏洞,在其标准下主流记忆框架得分普降,且相关数据和评测脚本已开源。

AI科技评论
算法论文7

直播预约 | 强化学习训练能否不依赖外部知识优化模型的弱点?

论文提出 SwS 框架,针对强化学习场景,利用模型自我感知弱点驱动自动化问题生成,合成针对性训练数据。还对其进行多项扩展,在多个基准测试和模型上验证有效,性能提升显著。

深度学习自然语言处理
算法论文7

ICML 2025 Spotlight | 谁导致了多智能体系统的失败?首个「自动化失败归因」研究出炉

ICML 2025 Spotlight 论文提出「自动化失败归因」新方向,应对多智能体系统失败难诊断问题。构建「Who&When」基准数据,设计三种初步方法并评估,虽现有方法表现有限,但此研究意义重大,有望助力打造更可靠系统。

机器之心
算法论文8

邱锡鹏团队新作:让机器人学会「察言观色」

复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。

AI科技评论