「受控实验」共找到 1306 篇相关文章
解决Agent幻觉:HaluMem精准定位记忆系统的“说谎”环节!
近年来,LLM和Agent在记忆管理上存在挑战,现有评估方法无法定位幻觉来源。论文提出HaluMem评估基准,通过三大任务和两个数据集揭示记忆系统幻觉行为,为开发可靠记忆机制提供指导。
翁荔陈丹琦加盟的840亿AI公司,公开第二篇论文
明星创业公司Thinking Machines公开第二篇研究论文,主题为“Modular Manifolds”,通过统一框架约束和优化网络不同层/模块,提升训练稳定性与效率。论文提出模块化流形思路,若应用于大模型,训练效率和稳定性将大幅提升。
MetaGPT 用户智能体发布,开启端到端自主软件测试新范式!
当前AI软件领域代码生成智能化发展快,但测试验收仍靠手动,效率低。MetaGPT推出用户智能体,研究团队发布RealDevWorld框架和AppEvalPilot实现端到端自动化评测,解决复杂软件质量评估难题。
无Tokenizer时代真要来了?Mamba作者再发颠覆性论文,挑战Transformer
Mamba作者之一Albert Gu参与的论文提出分层网络H - Net,用动态分块取代tokenization。Tokenization虽能压缩序列但有缺点,H - Net在多方面表现出色,或预示无需Tokenizer训练时代到来。
ICCV 2025|降低扩散模型中的时空冗余,上交大EEdit实现免训练图像编辑加速
上海交通大学EPIC Lab团队提出EEdit框架,入选ICCV 2025。它是首个加速匹配流模型图像编辑框架,能兼容多种引导方案,免训练,速度较原始工作流快2.4倍,支持多类型编辑任务。
CVPR 2025 | 多模态统一学习新范式来了,数据、模型、代码全部开源
中国人民大学、清华和腾讯合作的CVPR 2025论文指出,当前多模态学习范式有缺陷。为此提出新范式,构建AV - UIE数据集、Crab框架,实现任务互助,在多任务上超垂类专家模型,数据、模型、代码开源。
Claude团队打开大模型「脑回路」,开源LLM思维可视化工具来了
Claude团队推出“电路追踪”工具,可生成归因图呈现LLM处理信息路径,支持在主流开源权重模型上快速生成。研究人员能借此解码LLM“决策逻辑”,官方还给出多语言电路等示例。
奖励是假的,能让Qwen提升25%性能却是真的!
华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。
纯靠“脑补”图像,大模型推理准确率狂飙80%丨剑桥谷歌新研究
剑桥、伦敦大学学院和谷歌团队推出基于强化学习的视觉规划(VPRL)新范式,纯靠图像推理。新框架利用GRPO后训练,准确率达80%,超文本推理至少40%,代码已开源。
ICRA 2025|通用多机器人长时任务规划框架破解任务分配难题,成功率+105%、效率+36%
2025年5月,美两校联合团队在ICRA 2025发布LaMMA - P。它融合大模型与PDDL规划器,解决异构多机器人长时任务分配难题,在新基准数据集上,相比SMART - LLM,任务成功率提高105%,执行效率提升36%。