「持续学习范式」共找到 2481 篇相关文章
谷歌助力神经科学飞跃,破解斑马鱼全脑活动密码
谷歌等机构科学家联合发布开创性研究成果ZAPBench,这是预测斑马鱼全脑活动的基准测试平台。它含超70000个神经元4D光片显微镜记录,设计多种刺激条件采集数据,有特定基准测试任务和评估指标。
AI教父Hinton:曾为了儿子卖身谷歌,如今担心AI 会毁灭人类
AI教父Hinton曾为给有学习障碍的儿子攒钱,将神经网络公司卖给谷歌。在谷歌他意识到AI可怕,离开后成AI风险大声疾呼者。他既担忧AI危害,也描绘了人类与AI共生的美好愿景。
何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升
何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。
复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?
今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力。
Reasoning模型可以Self-Train!
当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。
与Gemini Diffusion共振!首个扩散式「发散思维链」来了
西湖大学齐国君教授团队提出扩散式「发散思维链」,这是面向扩散语言模型的新型推理范式。它与传统思维链不同,能非线性生成,已应用于两种模型,增强后的模型在相关任务上超越现有模型。
Multi-Agent 的灵活编排之路
文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。
一场文心大模型的「AI马拉松」
2025 年模型能力至关重要,百度在基础模型研发持续投入。百度 AI Day 上,吴甜解读文心新模型技术,文心 X1 Turbo 推理强、成本低。百度技术体系完备,未来看好多模态与智能体,降成本促应用生态发展。
RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力
多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。
DeepSeek Harness背后的“心脏”:Cordis 到底是什么
文章介绍Cordis框架,它原服务第三方QQ机器人,现是DeepSeek Harness心脏。阐述其设计初衷、核心机制,如插件、上下文等概念,还提及在DSH中的应用,展示了插件槽位和生态,最后介绍相关论文和该框架的生态情况。