模长感知」共找到 953 篇相关文章

算法论文8

BookRAG:专治各种「层次化复杂」文档

BookRAG专为处理层次化复杂文档而生。传统RAG有两大盲区,而BookRAG在多文档基准上刷新SOTA。它采用BookIndex×Agent - based Retrieval技术方案,效率高、可扩展性强,兼顾高精度、高召回、低成本。

PaperAgent
开源动态8

刚刚,首个空间原生的具身视觉基开源!机器人更会看我们的世界了

蚂蚁灵波发布并开源了面向机器人真实任务的空间原生视觉基 LingBot-Vision 及空间感知型 LingBot-Depth 2.0,能让机器人更精准地感知世界,解决透明反光材质、小目标和远距离目标等视觉难题。

量子位
算法论文7

OpenClaw爆火背后,仅8.6%用户能察觉异常!多校联合实证

OpenClaw等AI智能体爆火,其安全隐患凸显。多校联合研究发现,仅8.6%的用户能感知智能体媒介欺骗,总结了6类认知失效式,认为体验式学习或比静态提醒更能提升用户警觉性。

新智元
开源动态8

美团重磅开源!13.6B通用视频生成大型,能文生视频、图生视频、还能续写!

AI视频生成竞争激烈,美团团队在GitHub开源通用视频生成型LongCat-Video,参数量13.6B,能文生视频、图生视频、视频续写,几分钟生成720p、30fps视频,有核心优势,还介绍了安装部署等内容。

开源星探
新闻资讯7

北京艺术与科技周|当AI开始写诗、跳舞、作曲,我们如何保住“人味”?

2025年11月28日,北京艺术与科技周“思想殿堂”核心活动展开深度对谈,探讨AI时代如何保留人类感知与表达方式。嘉宾从不同角度出发,认为人类情感、经验与美感难以被AI替代,艺术与科技要找到新平衡。

798艺术区
开源动态8

美团视频生成型来了!一出手就是开源SOTA

美团开源视频生成型LongCat - Video,参数13.6B,支持文生/图生视频,时可达数分钟,生成视频真实自然,文生视频能力顶尖,整体质量优,采用MIT协议。还介绍了其功能、技术原理及美团此前的AI成果。

量子位
新闻资讯7

Anthropic 技术栈里的「五宗罪」由何而来?

Anthropic的Claude型升级后,用户却觉得不好用。X上帖子指出其存在文本和代码标记、型能力、定价、上下文等问题,这些问题卡在生成、计算、上下文和Agent运行时的5个具体位置,导致各方面互相拖后腿。

AI科技评论
算法论文8

ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点

Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让型有策略地读文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大型或上下文窗口。

机器之心
算法论文8

传统训练效率很低?我们靠 “给型降噪” 重新审视上下文建难题

文章指出上下文型处理文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源型在上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
算法论文8

Qwen团队发布上下文Reasoning型QwenLong-L1,超越o3-mini

Qwen团队发布上下文Reasoning型QwenLong - L1。当前大型处理文本有训练效率低、过程不稳定难题。QwenLong - L1用分阶段强化学习等方法,实验中超越o3 - mini、比肩Claude,还在案例表现出色。

深度学习自然语言处理