机器学习会议」共找到 1657 篇相关文章

产品应用8

kimi 的RL end2end ON LLM

文章分享Kimi Researcher背后技术思考,采用端到端强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。

Agent的潜意识
新闻资讯7

AI教父Hinton:曾为了儿子卖身谷歌,如今担心AI 会毁灭人类

AI教父Hinton曾为给有学习障碍的儿子攒钱,将神经网络公司卖给谷歌。在谷歌他意识到AI可怕,离开后成AI风险大声疾呼者。他既担忧AI危害,也描绘了人类与AI共生的美好愿景。

AGI Hunt
算法论文8

何恺明新作:给扩散模型加正则化,无需预训练无需数据增强,超简单实现性能提升

何恺明最新论文研究扩散模型与表征学习的联系,提出Dispersive Loss正则化方法。它无需正样本对,有高通用性、低计算开销等优势,在多模型测试中提升了生成质量,在其他任务也有潜力。

量子位
新闻资讯7

复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?

今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力。

宝玉AI
算法论文7

Reasoning模型可以Self-Train!

当前大模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。

深度学习自然语言处理
算法论文8

揭开大模型“伪遗忘”,港理工等团队:结构不变就是没忘

近年来大语言模型隐私风险受关注,机器遗忘技术应运而生。港理工等团队构建表示空间诊断工具,区分‘可逆性遗忘’与‘不可逆遗忘’,揭示遗忘现象背后表示结构变化规律,还做了相关实验并得出核心结论。

量子位
产品应用7

Multi-Agent 的灵活编排之路

文章从Copilot 3.0架构规划模块出发,结合DeepSeek R1强化学习训练实践,探讨多智能体架构下大模型编排智能体解决问题。分析Copilot 2.0局限并介绍3.0升级,指出难点,展示效果对比及解决方案。

阿里云开发者
算法论文8

RL训练总崩溃?R1-Reward稳定解锁奖励模型Long-Cot推理能力

多模态奖励模型对提升多模态大语言模型表现至关重要,但强化学习在奖励建模应用有挑战。快手等团队提出R1 - Reward,解决训练不稳定等问题,在基准上超SOTA模型,还在快手业务场景成功应用。

机器之心
新闻资讯8

红杉AI峰会闭门6小时,150位创始人共识浮现:AI不再卖工具,而是卖收益

第三届红杉资本AI峰会落幕,150位全球顶尖AI创始人齐聚。会议指出AI正从卖工具转向卖收益,还探讨了操作系统之战、智能体经济等话题,给出面向未来三年的定位图等,提醒从业者转变观念。

Founder Park
产品应用9

破除人形崇拜!京东用“狼族”军团重做物理AI

当行业狂热追捧人形机器人时,京东物流针对物流仓储非标环节自动化渗透率低的痛点,推出「狼族」异构机器人集群搭配超脑3.0智能中枢的全链路物理AI方案,已实现规模化落地,兼顾效率与经济性。

InfoQ