「知识迁移能力」共找到 3724 篇相关文章
We-Math 2.0:全新多模态数学推理数据集 × 首个综合数学知识体系
北京邮电大学、腾讯微信、清华大学团队提出We - Math 2.0,含知识体系、数据集及训练策略,可提升模型数学推理泛化能力。该成果在X上获关注,登Huggingface Paper日榜第一。
大模型越反思越错,原来是长链推理通过自我说服加重幻觉 | 北邮
北邮研究团队通过思维链审计实验,揭示大模型长链推理‘越想越错’现象背后的元认知偏差。研究基于RFC协议文档构建受控知识域,分析推理过程,发现反思会加重幻觉,且现有检测方法难以应对。
SGLang|SGLang Diffusion
来自SGLang开源社区的Yichi介绍SGLang Diffusion,它是面向图像与视频生成的全开源扩散模型推理引擎。基于SGLang机制将能力迁移到扩散模型推理,能显著提速工作流,视频展示了多种功能。
太多人误解了「苦涩的教训」
《“苦涩的教训”》一文常被误解,其核心观点是能充分利用计算资源扩展的方法会超越不能扩展的方法。人类知识短期易获好结果,但长远看,唯有随算力增长的方法最终胜出,如深蓝、AlphaGo Zero的案例。
他们,诠释了 QCon 的技术厚度 | 2025 QCon 上海站优秀出品人与明星讲师揭晓
2025 QCon全球软件开发大会(上海站)圆满落幕,超1300人参与。大会聚焦可持续工程能力建设,强调‘落地实践’。收官之际揭晓优秀出品人与明星讲师,他们推动知识流动,诠释QCon技术厚度。
上海人工智能实验室让AI像科学家一样在探索中发明工具
上海人工智能实验室等团队提出推理时工具演化(TTE)框架,推动AI在科学领域从被动选工具到主动发明工具。它解决传统工具库问题,提升多学科推理准确率,赋予AI跨学科迁移能力。
DeepSeek开源大模型记忆模块!梁文锋署名新论文,下一代稀疏模型提前剧透
DeepSeek最新论文给Transformer加上“条件记忆”,补上原生知识查找机制。梁文锋署名,与北大团队合作。提出全新范式及Engram模块,解决传统N - gram问题,研究稀疏性分配,验证推理能力提升,兼顾工程优化。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
阿里达摩院开源多模态医学大模型—灵枢
大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。
AI正在掏空大脑,思想沦为残废!未来只分AI的「主人」和「奴隶」
全世界为AI疯狂,它虽提供“认知捷径”,但长此以往并非好事。Section公司CEO Greg Shove分享使用AI经历,指出未来知识工作者将分化为“AI驾驶员”与“AI乘客”,并给出成为AI主人的方法。