「认知对齐」共找到 525 篇相关文章
AI修Bug新SOTA:SWE-Bench Lite60.33%修复率,像人一样能积累经验,中科院软件所出品
ExpeRepair是中科院软件所团队推出的仓库级缺陷修复系统,模拟人类认知的情景和语义两种记忆模式,能积累经验。在SWE - Bench Lite评测中,其Claude - 4+o4 - mini组合修复率达60.3%居首。
大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮
北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。
2025AI产品用户需求调研报告:AI产品的用户类型细分与画像分析 | 甲子光年智库
甲子光年智库基于调研数据开展AI产品用户研究,分析目标用户界定、类型细分与画像。指出新一代AI会重塑用户习惯,需探寻产品最终形态,还给出用户需求、类型分布等多方面结论。
从扭秧歌到跑半马:机器人离「iPhone时刻」还有多远?
过去半年,机器人表演把人们认知拉进现实。当下具身智能赛道玩家关注缩短探索周期、降低成本。地瓜机器人发布 RDK S100 套件,其有独特设计和适配场景,还围绕开发者诉求提供支持,跑通多种场景。
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%
小米发布Qwen2.5VL升级版MiMo-VL,能力提升30%。它能完成输入视觉回答问题、做几何体等任务,重点解决多模态推理、视觉理解及与人类偏好对齐问题,介绍了模型结构、训练阶段等内容。
刚刚,OpenAI GPT-6 Astra震撼发布!AGI时代来了
OpenAI正式发布GPT - 6 Astra,总裁称已到AGI时代。该模型定位为“世界上最智能、最对齐的模型”,在多领域表现出色,能力强、速度快、成本低,还具备“关键级”网络安全能力,将逐步开放给用户。
“你以为买的是 DeepSeek Flash,到手可能是 1.5 bit 缩水版”:Pi 核心贡献者谈 AI Token 黑箱
Pi 核心贡献者 Armin Ronacher 与 Modem 联合创始人 Ben Vinegar 播客对谈指出,当前 AI token 市场不透明,模型公司或失控。如买 token 像买成分不明商品,模型训练目标不明,且 Agent 行为边界在扩展,问责制缺失。
AI 3 秒给你一本书的摘要,我为什么还要花 10 小时读完
本文探讨AI时代读书投入产出比变化。指出很多书不必读完,印刷术与AI影响不同,AI降低加工成本,但认知成本省不掉。读书收益分信息和结构两部分,结构无法外包,选书能力也更重要。
Fable 5榜单第一靠作弊?代码泄露,模型真实身份曝光
黑客泄露Claude Fable 5长达12万字符的系统提示词,揭示它并非大模型,而是伪装成LLM的完整Agent系统。这颠覆了对AI模型的认知,也让Anthropic陷入舆论漩涡,还暴露了其计费黑幕。
Anthropic智能体大会:Agent也会精神分裂,我们发现了多Agent协作的本质解法。
Anthropic开发者大会聚焦Agent,分享多智能体实战经验。Omni的Blobby出现‘精神分裂’问题,根源是内外层Agent能力认知断裂,修复方案是将工具上提。Anthropic团队则通过协商签订协议解决角色定义不一致问题。