弱到强监督」共找到 2269 篇相关文章

算法论文7

首次!Meta证实LLM评审不可信!

Meta和耶鲁论文揭示,用AI当裁判训练模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。

深度学习自然语言处理
推荐文章7

2026 将近,世界模型底更「世界」了吗?

近期 Runway 发布相关产品,让「世界模型」讨论再聚焦。其定义从强化学习语境延伸,业内理解不断变化,概念边界变模糊。如今被推和 LLM 同级,出现概念同名但内核分裂现象。

机器之心
新闻资讯7

GAIR Live 预告|智能始于记忆,AgentMemory 的技术演化过程

在人工智能走向智能体阶段,‘记忆’成焦点。如今大模型‘记不住’上下文,‘从Human MemoryAgent Memory’跃迁是迈向具身智慧关键。GAIR Live将邀专家探讨记忆技术逻辑与路径。

AI科技评论
算法论文8

人脸机器人登上Science Robotics封面:用AI教会仿生人脸机器人「开口说话」

2026年1月15日,美国哥伦比亚大学工程学院研究登上《Science Robotics》封面,展示用AI让仿生人脸机器人“开口说话”技术。机器人经自监督学习,能将声音转自然唇动,有跨语言泛化能力,助其跨越“恐怖谷”。

机器之心
算法论文8

清华、快手提出AttnRL:让大模型用「注意力」探索

清华和快手团队提出新框架AttnRL,引入注意力机制提升过程监督强化学习效率与性能。它解决传统方法在分支位置选择和采样策略上的效率问题,实验显示在多基准测试中表现优异。

机器之心
推荐文章7

「Tokens是胡扯」,Mamba作者抛出颠覆性观点,揭露Transformer深层缺陷

Mamba作者Albert Gu在博客中探讨状态空间模型(SSM)和Transformer权衡,抛出‘Tokens是胡扯’观点,揭露Transformer深层缺陷,如分词问题、处理噪声能力等,还分析两类模型特点及结合优势。

机器之心
产品应用8

黑客已死!Claude 两周挖出 Firefox 22 个漏洞

Anthropic与Mozilla合作,让Claude Opus 4.6对Firefox代码库做漏洞挖掘,两周发现22个漏洞,14个高危。Claude发现漏洞能力强,但利用漏洞能力。还研究用LLM做「补丁Agent」,为AI辅助安全研究建规范。

AGI Hunt
算法论文8

图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力

上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现,扩散式模型更适合视觉规划,CoT效果不稳定等。

AI科技评论
新闻资讯7

直播预约 | 世界模型,点燃下一个AI爆点

2026开年,世界模型成科技圈热门议题,被视为通向AGI重要基建。4月15日19:00 - 21:00,机器之心联手黄大年茶思屋,邀5位专家从技术产业解析世界模型前沿,双平台直播。

机器之心
产品应用7

黄仁勋刚讲完AI「五层蛋糕」,他们就跑通了!算力、模型、Agent一次打穿

英伟达CEO黄仁勋提出「AI的五层蛋糕」架构,易鑫结合汽车金融场景构建全栈式AI体系,从基础设施业务应用层层推进,解决行业痛点,还开源模型推动共赢。

新智元