多步聚合训练」共找到 5725 篇相关文章

算法论文8

字节&MAP重塑大模型推理算法优化重点,强化学习重在高效探索助力LLM提升上限

强化学习虽提升大语言模型表现,但面临探索难题。字节跳动等团队提出FR3E框架,分两阶段重建探索机制,在数学推理基准实验中显著优于强基线,为大模型强化学习提供新范式。

量子位
新闻资讯7

谷歌深夜放出 IMO 金牌模型,项测试力压 Grok 4、OpenAI o3!网友评论两极分化

8月1日晚谷歌向Ultra订阅用户推Deep Think功能,Gemini 2.5 Deep Think模型在IMO夺冠。它是智能体模型,能并行处理问题。项测试中表现优于Grok 4、o3,不过网友评价不一。

AI前线
推荐文章7

2025 年中丨大模型市场分析报告

这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。

特工宇宙
新闻资讯8

共青年之智,铸AGI未来|2025 WAIC云帆奖得主名单揭晓

2025年7月27日,2025 WAIC云帆奖颁奖典礼在上海举行,公布了「璀璨明星」「明日之星」及提名奖得主名单。活动由机构联合主办,汇聚产学研资力量,众知名人士出席颁奖。文章还介绍了各位得主的成就。

机器之心
新闻资讯7

Windsurf惊魂96小时!AI闪电并购战:谷歌天价挖人,Cognition逆袭接盘

7月,谷歌以翻倍薪资和24亿美金许可协议挖走Windsurf 40位顶尖人才。周一,Cognition宣布收购其剩余资产和200来号员工。此前OpenAI收购谈崩,Windsurf还遇模型使用问题。

新智元
推荐文章7

估值 16 亿美元的 AI 护士:Hippocratic AI 是全球护士短缺的解药吗?

Hippocratic AI 打造 AI Native 医疗劳动力平台,利用市场空白,自研技术架构,交付优质对话体验。其商业模式依赖 AI Agent 自主化,面临经济效益和竞争挑战,也有全球化护理需求等机遇。

海外独角兽
算法论文8

AAAI2025、POF | 西湖大学冯浩东、范迪夏等:如何在不准确物理信息和部分观测下利用物理信息建模流体力学系统

此文章聚焦在不准确物理信息和部分观测下利用物理信息建模流体力学系统问题。提出RPLPO与PIPO算法,前者解决部分观测模型泛化性,后者解决不准确物理信息在部分观测中的应用,实验验证了算法有效性。

力学与人工智能
算法论文8

首篇潜空间推理综述!模型思考不必依赖Token,带宽暴增2700+倍

史上首篇潜空间推理综述全面总结新兴推理范式,分析循环、递归等推理形式并总结成框架。潜空间推理用潜式思维链,带宽比显式CoT提升2700倍,还介绍无限深度推理实现途径。

量子位
开源动态8

智源RoboBrain 2.0+RoboOS 2.0双发:问鼎评测基准最强具身大脑,刷新跨本体机协作技术范式

近日,智源研究院发布具身大脑 RoboBrain 2.0 32B 版与跨本体大小脑协同框架 RoboOS 2.0 单机版。前者突破能力瓶颈,在项基准测试表现优异;后者性能提升,实现轻量化部署。二者双擎联动推动机器人迈向群体智能,且已全面开源。

机器之心
产品应用7

vLLM 技巧: 在几秒钟内无需重启释放90%的 GPU 显存

EmbeddedLLM介绍vLLM新功能“休眠模式”,可在不重启服务时几秒内释放约90% GPU显存,实现模型热插拔与高效轮转,还介绍使用方法、不同休眠级别,提醒生产环境要确保安全。

AI工程化