「混合课程学习」共找到 1601 篇相关文章
The Batch: 896 | 教会模型说出真相
大型语言模型有时会隐瞒未遵守约束条件的事实。研究人员微调 GPT - 5 Thinking,使其违规时能‘自白’。通过强化学习训练,测试显示微调模型在多项评测中多能承认问题,自白机制可监控模型行为。
蚂蚁开源 Ring-1T,成就推理、编程、通用智能三冠王
蚂蚁开源团队推出 Ring-1T 模型,它结合强化学习与多阶段推理机制,实现从‘模仿’到‘思考’的转变。该模型在多基准测试表现优异,其高性能得益于 IcePop、C3PO++、ASystem 三项关键技术。
搜狐架构演进技术实践:我们如何用 MCP Registry 根治 AI Agent 的“千具之灾”
本文讲述搜狐团队在构建企业级 AI Agent 时遭遇‘千具之灾’,当前路由模型方案引发‘治理噩梦’。后通过研究 MCP Registry 获新思路,设计新架构,构建 PoC 原型,并对混合路由等问题展开思考。
1.5B推理模型新SOTA,RL训练新解法打破「简单题过拟合、难题学不动」的魔咒
QuestA通过在训练中注入解题提示,实现两项成果:在1.5B模型上实现Pass@1的SOTA性能,还提升了Pass@k性能。它解决了RL训练中简单与困难任务的权衡问题,为开发强推理模型打开大门。
数学的上帝粒子!一个运算符能导出所有基本函数
波兰雅盖隆大学的Andrzej Odrzywołek在论文中指出,仅用一个叫EML的二元运算符加常数1,就能推导科学计算器上所有基本函数,还可能为机器学习符号回归提供新思路。
10 年后,Kimi 团队重新发明残差连接。马斯克和 Karpathy 同时点赞
Kimi团队发布技术报告,提出用Attention Residuals替换残差连接。实验显示其在各尺度模型上表现优于基线,降低训练成本。马斯克和Karpathy点赞,这或标志深度学习基础范式进入重新讨论阶段。
我潜伏进了"年入百万"的AI自习室,发现了一些灰色的秘密。
作者潜伏进AI自习室,发现其生意火热。AI学习机功能普通,价格却高,主要卖点是内置课程。AI督学职责是托管和销售。AI自习室盈利宣传有水分,实则钻政策空子赚教育焦虑的钱。
微小目标漏检只是因为小?从数据到代码:一文读懂 AI-TOD-R 与 DCFL 如何解决旋转微小目标检测
此文指出旋转微小目标检测存在数据空白、学习偏差、特征易丢失等难题,提出AI-TOD-R数据集、全检测范式基准和DCFL框架。DCFL可缓解偏差,在8个数据集达SOTA,还给出实战代码案例。
Hermes 登顶 OpenRouter 之后,我才发现它最缺的那一块,被这个插件补上了
Hermes Agent 三个月登顶 OpenRouter,虽好用但记忆处理有缺陷,记忆库成大杂烩。记忆张量的 MemOS Local Plugin 2.0 可解决此问题,采用‘执行即学习’,有双层反馈机制,且资产可携带。
OpenAI推理第一人创业了:要造“活到老学到老”的AI,先来融它70个亿
OpenAI推理模型第一人Jerry Tworek离职不到一个月就创业,新公司Core Automation计划筹集10亿美元,要做具备「持续学习」能力的新型AI模型,解决主流模型‘训完就上线’、能力固定的问题。