「概念注入实验」共找到 1702 篇相关文章
拟合接近满分,外推却会跑偏:Meta 给缩放律加了一个指数
大模型训练前,团队常用 Chinchilla 缩放律估算模型规模和数据量,但它在模型和数据极不平衡的边界预测易跑偏。Meta FAIR 提出的 Skaling 只增加一个耦合指数,降低外推误差,还采用 L 形采样降低试算成本。
聊聊Anthropic这篇最新研究,我觉得可能是AI意识诞生的前夜。
Anthropic最新研究《A Global Workspace in Language Models》,在Claude神经网络中发现与人类大脑意识通达结构功能高度相似的J空间,这结构自发涌现,研究还证明其对Claude输出有影响,或改变人类对意识的理解。
快手AgentX:推荐系统开始自我迭代
过去十年推荐系统核心在‘建模’与‘工程’,但日常迭代瓶颈在研发生产方式。快手 AgentX 团队提出 Agent 驱动研发闭环,在快手 App 业务部署中跑通完整闭环,提升效率与业务收益。
大模型"温故而知新"实现了!无需历史数据,Octopus 效果超越全数据训练|CVPR‘26 Octopus
上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。
用DAA衡量智能体 百度智能云用“新全栈”重新定义AI云|甲子光年
2026年产业焦点转向智能体落地,李彦宏提出DAA概念。百度智能云升级为新全栈AI云,解决智能体落地难题,从架构决策、行业应用等多方面发力,其价值值得市场重估。
ICLR 2026|CMU等团队让AI生成的3D场景真正「站得住」:PAT3D把文生3D从能看推进到能模拟、能交互
现在3D AIGC虽能快速生成场景,但落地有问题,很多场景物理模拟时会暴露物体悬空等问题。CMU等团队提出PAT3D,目标是让生成的3D场景物理上站得住,可用于编辑、交互和仿真,且代码已开源。
PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器
本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。
近期,不错的LLM Agent统一记忆框架综述~
随着GPT、Qwen、Claude等大模型能力提升,LLM-based Agent走向长期任务。论文提出统一框架拆解Agent Memory为四组件,围绕两个数据集复现比较10个方法,还设计出新的低token开销框架。
阿里SkillClaw:让 Agent 技能在真实使用中集体进化
当前LLM Agent依赖可复用技能完成任务,但技能部署后静态不变,改进仅停留在当前会话。阿里SkillClaw提出中心化进化架构,将多用户交互作为技能改进信号,通过Agentic Evolver更新技能,经夜间验证后部署。
Anthropic开始抢科学家了?周薪2.7万驻场,专治Claude专家级错误
Anthropic新推出STEM Fellow岗位,招募STEM领域专家驻场三个月,周薪3800美元,用其判断力校准Claude输出质量。其三年来科研路线不断加码,正构建科研生态。AI科研瓶颈是判断力而非算力。