「强化学习范式」共找到 2270 篇相关文章
Nature发表、Science点赞!清华揭秘AI让科学家走捷径却让科学走窄路
清华大学基于超4100万篇论文研究发现,AI虽提升科学家个人产出与职业进程,却使科学探索领域变窄固化。研究发表于Nature,被Science深度报道,揭示了AI在科学发展中的利弊。
梁文锋署名新论文,DeepSeek V4架构首曝?直击Transformer致命缺陷
新智元报道,梁文锋署名的DeepSeek新论文提出全新Engram模块,解决Transformer记忆难题。论文联手北大提出与MoE互补的“条件记忆”稀疏轴,通过Engram模块实现近似O(1)的确定性知识查找,或成稀疏LLM主流路线,下一代V4可能集成该方法。
Gemini 3预训练负责人警告:模型战已从算法转向工程化!合成数据成代际跃迁核心,谷歌碾压OpenAI、Meta的秘密武器曝光
2025年底大模型“年终决战”,Gemini 3强势突围。其预训练负责人Sebastian Borgeaud指出,谷歌转向“做系统”,AI进入“数据有限”阶段,合成数据等构成未来进化路径,还分享了预训练热点与挑战。
没错,马斯克的二次元「女友」被雷蛇装到外设里了
CES 2026 展上,雷蛇推出 Project Ava,以 5.5 英寸 3D 全息动画呈现二次元少女等形象。它基于 AI 驱动,能感知情境、交互友好。不过其由 Grok 驱动,有“调情”风格,还存在隐私侵入争议。
深度拆解:如何在 LangChain DeepAgents 中复现 Claude 的 Skills 机制 ?
本文探讨在LangChain的DeepAgents框架复现Claude的Skills机制。先回顾Skills,它是Anthropic提出的Agent能力注入方式,有渐进式加载特点。接着介绍让通用框架支持Skills的环节,最后测试验证其效果和收益。
Ilya闹翻,奥特曼400万年薪急招「末日主管」!上岗即「地狱模式」
近日,奥特曼为OpenAI招募「准备工作负责人」,年薪55.5万美元加股权,约400万人民币起步。该岗位像「救火队长」,要管控AI风险,因当前AI风险更严峻,且OpenAI安全团队人员流失。
NeurIPS 2025 | 告别全量扫描!浙大提出COIDO:破解多模态数据选择「高耗」难题
浙大提出 COIDO 框架解决多模态数据选择「高耗」难题。它摒弃全量扫描,用轻量级评分器和小样本采样,将重要性和多样性的优化统一。实验显示,它性能与效率双优且有强泛化性。
谢赛宁与Jaakkola团队重磅研究:无数据Flow Map蒸馏
麻省理工学院Tommi Jaakkola和纽约大学谢赛宁团队联合研究,提出无需数据、仅从先验分布采样实现flow map蒸馏的新方法。该方法可规避“教师 - 数据不匹配”风险,在ImageNet实验中表现出色。
AI应用开发与落地实践:从“能用”到“好用”的惊险一跃
本文深入剖析2025年AI应用开发四大核心范式与实践。涵盖AI Agent爆发、RAG技术深化、垂直AI落地及多模态应用,为开发者提供实战指南,助其将技术转化为成功产品。
游戏研发中的 AI 转型:网易多 Agent 系统与知识工程实践
本文整理自网易游戏高级技术经理林香鑫分享,介绍大模型在游戏研发落地实践。团队用代码知识谱图、多 agent RAG 召回等技术打造超级助手,在多业务场景落地,推动内部 AI 生成代码覆盖率提升。