「记忆策略」共找到 1407 篇相关文章
“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%
多模态长文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言模型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多模态连接和跨页证据链接问题。
蚂蚁开源MedResearcher-R1医学知识图谱+多跳推理
医学领域需处理复杂关系,现有医学AI系统缺乏对罕见实体和复杂关系的推理能力。MedResearcher - R1通过专门图谱和检索工具,结合两阶段训练范式解决问题,在医学基准测试取得新成果。
科研智能体「漫游指南」—助你构建领域专属科研智能体
该综述提供科研智能体构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。
直播预约 | Transformer 模型能否通过连接训练数据中的离散知识进行推理?
为研究Transformer是否具备组合式推理能力,提出FTCT合成任务。实验发现Few - shot CoT提示可激发推理能力,训练与测试相似度、模型复杂度影响推理能力。还分析了其内在机制,展示其泛化推理潜力。
智谱发布GLM 4.5,不仅开源模型还把训练框架也开源了
智谱AI发布GLM 4.5,不仅开源模型,还开源整套后训练基础设施。模型规格亮眼,性能也超越qwen 235b。其开源的训练框架slime专为强化学习扩展设计,完整工具链支持多种模型。
DeepSeek 复盘:128 天后,为什么用户流量一直在下跌?
文章深入分析DeepSeek和Anthropic策略,揭示行业计算资源稀缺难题。指出AI服务定价是延迟、吞吐量、上下文窗口三个指标的权衡,DeepSeek牺牲体验换研发,Anthropic提升‘智能密度’优化资源。
RL缩放王炸!DeepSWE开源AI Agent登顶榜首,训练方法、权重大公开
今天凌晨,Together.ai联合Agentica开源AI Agent框架DeepSWE,基于Qwen3 - 32B模型用强化学习训练。所有内容开源,测试中性能超所有开源Agent框架,证明强化学习训练潜力。
亚马逊云科技大中华区总裁储瑞松:企业实现 Agentic AI 价值的关键在于三大技术准备
亚马逊云科技大中华区总裁储瑞松在峰会表示,正处 Agentic AI 爆发前夜。其爆发源于大模型能力发展、协议出现、推理成本降低等因素。企业实现其价值需做好三大技术准备,还推荐了 6 月 27 - 28 日的 AICon 北京站活动。
如何选择最佳多模态大模型压缩方案?哈工大、度小满开源EFFIVLM-BENCH基准测试框架
金融科技智能化转型中,LVLM部署受算力瓶颈制约。哈工大与度小满联合开源EFFIVLM - BENCH基准测试框架,能为多模态大模型压缩方案出具‘体检报告’,还揭示LVLM加速复杂性,推动技术发展。
AI编程到底有没有护城河?RL+Agent重塑代码世界!
作者作为cursor重度用户和算法出身玩家,分享AI编程赛道技术内幕。探讨AI编程视角下RL的难题,介绍AI编程体验进化要素,还聊了cursor 1.0更新,最后指出AI编程工具发展趋势。