「认知污染」共找到 347 篇相关文章
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。
我是如何破解 NotebookLM 系统提示词的?
作者分享通过“逆向推理”破解NotebookLM系统提示词的故事,介绍系统提示词概念、破解原因、策略及从播客音频逆推提示词的方法,还提到该方法的效果及局限性 。
IJCAI 研究卓越奖得主 Nick Jennings:一个智能体的聪明,不如一群智能体的相遇|IJCAI 2026
8月18日,IJCAI 2026大会上,研究卓越奖得主Nick Jennings回顾智能体发展历程,指出当下智能体AI火热,它并非新概念,而是经数十年积累。还分享经验,展望从智能体到智能社会的未来。
OpenClaw爆火背后,仅8.6%用户能察觉异常!多校联合实证
OpenClaw等AI智能体爆火,其安全隐患凸显。多校联合研究发现,仅8.6%的用户能感知智能体媒介欺骗,总结了6类认知失效模式,认为体验式学习或比静态提醒更能提升用户警觉性。
人类记忆 vs 大模型记忆,到底差在哪?
这篇发表于 2025 年 10 月《Trends in Cognitive Sciences》的文章,探讨用人类“情景记忆”研究成果改进记忆增强型大语言模型。指出现有 AI 记忆系统存用数据低效,呼吁构建“类人情景记忆”AI,还剖析差异并给出评估方法和展望。
中国科大Science-Star(科星) : 一体化、可扩展的科学智能体搭建平台
中科大认知智能全国重点实验室开发了 Science - Star 科研智能体平台。它基于 ReAct 引擎,有一体化可视化支持、插拔式模块化架构和跨学科工具集成等特色,为科研智能体研发与实验提供高效基础设施。
AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品
ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。
这可能是Claude Code最重要的功能
Claude Code新功能Sub - agents很实用,能创建多个专精任务的Agent,有独立上下文窗口防‘记忆污染’,配置灵活,还能组成工作流。创建简单,比社区项目有优势,是Claude Code截至目前最重要功能。
刚刚!UCLA杨林团队证明:仅凭提示词,Gemini 2.5 Pro就可以拿到IMO2025金牌
加州大学洛杉矶分校杨林和黄溢辰撰写论文,阐述利用Gemini 2.5 Pro解决2025年IMO竞赛5道题达金牌水平。设计解题者和验证者构成的自我验证流水线,用双提示词系统迭代,还规避数据污染问题。
大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮
北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。