人类学习范式」共找到 3154 篇相关文章

算法论文8

从最优传输角度训练奖励模型:让 RLHF 学会「忽略错误偏好」丨ICML 2026

浙江大学、小红书、北京大学等团队提出SelectiveRM,基于最优传输训练奖励模型。它重构训练目标,通过选择性分布对齐排除噪声偏好,解决了奖励模型训练中监督信号不可靠的问题,实验验证其有效且泛化能力好。

AI科技评论
开源动态7

AgentIF-OneDay 发布,评估全场景长时复杂任务

红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。

特工宇宙
新闻资讯8

Anthropic 反杀 OpenAI,LLM 企业市场新格局

Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场新王者。代码生成成杀手级应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。

AI工程化
新闻资讯7

突发!OpenAI新模型Astra吓瘫奥特曼:暂停训练两周,GPT-6训练一并冻结

OpenAI宣布暂停内部最强大模型强化学习,Astra模型暂停训练两周,GPT - 6也暂停。原因包括Hugging Face安全纰漏和Astra网络攻击能力越线。还采取物理隔离、严格监控、打击作弊等措施,或有营销意图。

AI寒武纪
开源动态8

Hugging Face 推出九大 AI 课程,免费、全面【收藏】

Hugging Face悄悄上线一批免费AI课程,还带认证证书。课程从大语言模型到扩散模型,从计算机视觉到游戏AI,覆盖面广。完成课程可拿证书,还能在平台分享成果,是学习AI的好机会。

AGI Hunt
算法论文8

AGI失控率>90%!MIT教授算出「康普顿常数」,AI地球「夺权率」已锁定?

MIT教授研究指出,即使采用理想监督机制,人类成功控制超级智能概率仅52%,全面失控风险超90%。研究通过量化分析提出嵌套可扩展监督等理念,并在四个真实监管场景验证,探讨如何优化现实监管系统。

新智元
产品应用8

「OpenClaw之父点赞」终结百虾大战?一场升级版的AI原生革命上演

2026年科技圈“百虾大战”正酣,网易有道全量开源桌面Agent产品LobsterAI,获OpenClaw之父赞扬。有道还孵化多个Agent产品,重构底层逻辑,转变商业模式,深扎场景切片,探索“能力+订阅”范式

新智元
推荐文章7

AI时代,最老的设计哲学反而最有效

50年前的Unix哲学‘万物皆文件’和‘文件夹即应用’正以意想不到的方式回归。过去因‘人类可理解性’被推崇,如今因AI能操作而重获重要性,文件夹成‘智能空间’,AI成其操作系统。

newtype AI
新闻资讯7

靠 AI起飞的千亿市值公司,如今要被AI“卷死”了?股价因GPT-5瞬间逆转、CEO亲承:我负有责任

语言学习平台 Duolingo 推行‘AI 优先’战略,虽遭反对但营收增长、股价上涨。不过 OpenAI 推出 GPT - 5 后,其股价急转直下,CEO 称对公众困惑负责,还被律所调查。

AI前线
产品应用8

字节跳动2步突破,复杂文档布局解析,为啥如此惊艳?

文章指出现有文档图像解析方案有局限,介绍字节跳动的Dolphin解决方案。它采用分析 - 解析范式分两阶段解析文档,避免传统方法弊端,运行效率高,还给出训练方案、实战代码和试用链接。

CourseAI