过程监督强化学习」共找到 1072 篇相关文章

推荐文章7

估值 16 亿美元的 AI 护士:Hippocratic AI 是全球护士短缺的解药吗?

Hippocratic AI 打造 AI Native 医疗劳动力平台,利用市场空白,自研技术架构,交付优质对话体验。其商业模式依赖 AI Agent 自主化,面临经济效益和竞争挑战,也有全球化护理需求等机遇。

海外独角兽
开源动态8

碾压DeepSeek V3!开源AI Agent专属模型,1万亿参数、工具使用能力超强

国内大模型平台月之暗面开源了模型Kimi - K2,这是混合专家模型,总参数1万亿。它针对AI Agent优化,工具使用能力强。测试显示其性能碾压DeepSeek V3等模型,训练流程还有独特技术创新。

AIGC开放社区
算法论文7

1899个MCP服务安全研究:7.2%存在漏洞,5.5%暗藏「工具投毒」

研究人员对1899个开源MCP服务器扫描,发现7.2%项目有漏洞、5.5%遭工具投毒。MCP虽成事实标准且发展好,但代码质量堪忧,传统安全工具难检测其风险,为生态敲响警钟。

AGI Hunt
推荐文章7

具身智能需要从ImageNet做起吗?

文章探讨具身智能发展,分析其爆发原因,如人类无法完全数字化等。指出几种失败模式,还讨论输入信号、触觉、学习方法等决策点,认为具身智能的‘ImageNet’时刻是伪命题,不同智能领域可能殊途同归。

海边的拾遗者
新闻资讯8

GPT-6发布,OpenAI说AGI时代来了

北京时间9月4日凌晨,OpenAI发布GPT - 6 Astra,虽发布过程狼狈,但该模型在多项评测中表现出色,如数学评测、电脑操控等,但编程类任务未全面领先,且网络安全方面部分功能被限制。

花叔
算法论文8

千万级标注成本归零!CVPR 2025清华团队成果:相机的“自运动”就是最好的老师

以往空间音频模型受限于采集条件和标注成本,清华和密西根大学团队在CVPR 2025给出新路径,利用相机自运动作监督信号,让模型从互联网视频学三维空间音频感知,成果入选会议Highlight。

量子位
新闻资讯7

GPT-5系列咋都爱说「哥布林」?原因找到了

OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格时,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。

机器之心
产品应用8

懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5

阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。

千问大模型
产品应用8

比「小龙虾」更能打,中国AI视频大模型悄悄登顶全球第一

昆仑万维旗下 SkyReels-V4 Preview 版在权威评测平台超越 OpenAI、Google 等模型,登顶全球第一。它提升语义理解和逻辑能力,新增参考任务,还支持多语言短剧生成、视频编辑等,将在中关村论坛亮相。

机器之心
算法论文8

AAAI 2026杰出论文奖 | ReconVLA:具身智能研究首次获得AI顶级会议最佳论文奖

具身智能常被视为‘系统工程驱动’研究方向,ReconVLA获AAAI杰出论文奖,是具身智能方向首次获AI顶级会议最佳论文。它解决VLA模型关键瓶颈,通过重建式隐式视觉定位机制,实验效果显著。

机器之心