机器人具身推理」共找到 3391 篇相关文章

新闻资讯7

首次曝光!OpenAI新一代旗舰Astra换上“循环深度”推理架构:用计算深度换参数规模

9月2日消息,OpenAI将推出的旗舰模型Astra采用“循环深度”新技术,用较小模型实现庞大模型性能,降低成本。但该技术会让AI推理过程不可读,加重安全担忧,此前奥特曼已因Astra“能力过强”踩刹车。

AI前线
算法论文8

超越人类标注,Meta提出CoT-Self-Instruct:如何用"推理式自进化"重塑LLM训练

大语言模型发展需海量高质量训练数据,传统人工标注困境重重,现有合成数据方法也有缺陷。Meta提出CoT - Self - Instruct,通过推理式自进化生成数据,实验证明其在多个任务上超越人类标注数据。

深度学习自然语言处理
新闻资讯8

硅谷直击:黄仁勋入局龙虾大战,宣告 SaaS 已死,推理算力需求暴涨万倍!

本文为 CSDN 对英伟达 GTC 2026 大会的现场报道。黄仁勋宣告 SaaS 已死,揭幕 Agent 时代,指出 AI 重心正从训练转向推理,还推出 Vera Rubin、LPX 等新品,强调能效即钱,企业软件将向 Agent-as-a-Service 转变。

AI科技大本营
算法论文8

两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法

康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。

机器之心
新闻资讯7

机器人交税养打工人!奥特曼AI新政曝光,上4休3要成真?

OpenAI奥特曼预警超级智能将至,带来巨大冲击。OpenAI抛出13页政策文件,核心提案有建立AI公共财富基金、试点4天工作制、对机器人征税、给“人类专属”工作涨薪,虽多为探索性提案,但信号值得关注。

新智元
算法论文8

14B打败671B!微软rStar2-Agent在数学推理上超过DeepSeek-R1

如今的大语言模型推理能力关键在于测试时扩展,但长思维链有局限。微软研究团队用主动式强化学习探索,成果 rStar2 - Agent 方法训练出 14B 的 rStar2 - Agent - 14B 模型,性能超 671B 的 DeepSeek - R1。

机器之心
算法论文8

美团提出多模态推理新范式:RL+SFT非传统顺序组合突破传统训练瓶颈

美团研究者提出Metis - RISE框架,将RL激励和SFT增强以非传统顺序结合提升多模态大语言模型推理能力。先RL激发潜能,再SFT补齐短板,训练的两模型在OpenCompass榜单成绩优异。

量子位
新闻资讯8

全球首个真实世界身多模态数据集,它石智航交卷,比特斯拉还早6个月

它石智航发布全球首个大规模真实世界身VLTA多模态数据集WIYH,将于2025年12月开放。该数据集突破大,特点鲜明,优势明显,其发布填补数据空白,奠定以人为本范式。

量子位
推荐文章7

新手必看!强化学习入门指南 | 从RLHF、PPO、GRPO到RLVR,最后到训练推理模型

Unsloth团队发布强化学习教程,从吃豆人谈起,介绍RLHF、PPO、GRPO等概念,分享用GRPO训练推理模型技巧。涵盖强化学习基础知识,还给出Unsloth使用GRPO训练模型方法及奖励函数示例。

AINLPer
产品应用8

搜狐架构演进技术实践:我们如何用 MCP Registry 根治 AI Agent 的“千之灾”

本文讲述搜狐团队在构建企业级 AI Agent 时遭遇‘千之灾’,当前路由模型方案引发‘治理噩梦’。后通过研究 MCP Registry 获新思路,设计新架构,构建 PoC 原型,并对混合路由等问题展开思考。

InfoQ