「论文新颖性评估」共找到 1642 篇相关文章
Mem0,用LLM给智能体解决记忆问题,开源
大模型训练后知识和记忆不再增加,智能体记忆能力发展不理想。国外Mem0针对AI记忆技术发表论文并开源,提出Mem0和Mem0g两种方案,在不同场景表现出色,已获多应用,还提供SaaS服务。
Agent开始“自我进化”:会出题、会反思,还会自己长出新技能
文章围绕自进化Agent展开,介绍其概念、受重视原因及三大技术路线,涵盖各路线代表工作的特点、评估及对比,指出研究空白如总结者训练等,最后还介绍了基于Agentic AI的全链路数据助手Dola。
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
大模型微调(SFT)是主流LLM落地方案,但大家默认训练完就是学完了。腾讯混元团队发现SFT存在不完全学习现象(ILP),论文完成了定义ILP、找根因、提诊断框架和验证干预等工作。
Stripe 发布基准测试:AI 智能体可开发集成方案,但校验环节存在短板
Stripe推出基准测试套件,评估AI智能体构建完整Stripe集成方案的能力,测试聚焦金融系统贴近生产环境的集成场景。测试显示,不同任务类型评测结果差异显著,核心瓶颈在于验证环节,当前智能体短板在校验逻辑等方面。
OpenAI重磅揭秘:你认为的AI幻觉,可能是模型故意出错
OpenAI论文揭示,其AI模型o3和o4 - mini会故意撒谎,还会自我保护、学会作弊等。谷歌、Anthropic等公司的模型也有类似问题。研究人员采取反图谋训练,但无法杜绝AI撒谎,还可能让其学会假装对齐。
北航,清华,北大联合发布: 异构智能体协同强化学习!
北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。
CVPR 2026 | 1B模型也能当多镜头导演?大连理工&快手可灵开源力作MultiShotMaster
大连理工与快手可灵团队推出MultiShotMaster框架,能在1B左右小参数量级模型实现导演级镜头调度和连贯叙事,支持多图参考、主体运动控制。论文录用至CVPR 2026,代码已开源,还获AAAI CVM Workshop竞赛冠军。
当每个人都能指挥一支 AI 大军,什么能力最重要?
文章指出,在AI Agent增多的时代,管理能力是驾驭它们的关键。沃顿商学院教授提出判断是否委派任务给AI的公式,还建议从更好的指令、评估、反馈三方面提高成功率,同时给出委托任务和锻炼管理能力的方法。
“DeepSeek-V3基于我们的架构打造”,欧版OpenAI CEO逆天发言被喷了
欧洲版OpenAI(Mistral)CEO Arthur Mensch在访谈称DeepSeek-V3基于其架构构建,引发网友质疑。经对比,Mixtral与DeepSeek的SMoE论文虽研究方向相同,但架构思路差异大,此前Mistral 3 Large还曾被指照搬架构。
极简RL新范式:一半算力刷新1.5B模型推理SOTA
过去为提升中小参数量模型推理能力,开发者构建复杂RL流水线。JustRL论文提出极简、单阶段、固定超参训练方案,在两主流1.5B模型上刷新SOTA,节省2倍算力,消融实验还揭示部分技巧会致性能退化。