端到端学习」共找到 3509 篇相关文章

算法论文8

沉迷贪吃蛇,7B小模型竟变身「数学天才」!几何推理碾压GPT-4o

NVIDIA等团队提出视觉游戏学习ViGaL范式,让7B多模态模型玩贪吃蛇等游戏,使其在数学、几何等任务击败GPT - 4o。游戏培养通用认知与推理能力,不同游戏提升不同推理能力,多游戏训练效果更佳。

新智元
产品应用8

RL后训练步入超节点时代!华为黑科技榨干算力,一张卡干俩活

在大模型竞赛白热化当下,强化学习后训练成突破LLM性能天花板核心路径,但算力浪费和集群效率低是难题。华为团队祭出两大黑科技破局,在超节点实现训推共卡,资源利用率翻倍,还提升训练速度。

新智元
算法论文8

UC伯克利新作颠覆认知:LLM靠「自信爆表」学会推理?无需外部奖励超进化

UC伯克利华人团队发现,LLM不靠外部奖励,仅靠「自信爆棚」就能学会复杂推理。他们提出基于内部反馈的强化学习(RLIF)新范式,用INTUITOR方法让模型用自身置信度作内在奖励,在多任务中表现良好。

新智元
开源动态8

MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench

MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。

量子位
产品应用8

V0做不、Bolt搞不定,Youware用MCP一键解决网页生成最大难题

Youware可快速将AI生成网页部署线上。其更新后支持调用MCP生成网页,深度适配主流MCP服务,使用门槛低且免费。还上线积分系统,首页分类筛选更详细,作品页增随机按钮。用案例展示了其强大的网页生成能力。

歸藏的AI工具箱
推荐文章8

拒绝视频生成,深度跃迁提出具身基座模型全新路线

深度跃迁发布世界动作模型 DELE - w0.5,放弃基于视频生成模型的路线,训练时联合学习动作与未来世界表征,推理时移除该表征分支。在真机实验中表现超基线,具跨背景泛化能力,为世界模型提供新思路。

机器之心
新闻资讯8

英伟达官方推理指南来了!6倍无损加速,最优解全是华人写的

9月2日,英伟达技术博客上线《用投机解码做AI模型协同设计》,给出推理加速选型表。列入指南的核心方案多由华人团队主导,介绍了从外置草稿模型n - gram查表法等方案,还提硬件常数对模型架构的约束。

新智元
新闻资讯7

小扎不死心Manus“自研”了一个,但模型用的Claude……

Meta推出智能体平台Hatch,功能类似Manus,开发阶段用Claude,计划正式上线时切换自研模型Muse Spark,10月推出新模型Watermelon。Hatch注重消费数字生活,与Meta社交生态深度绑定,高订阅有默认分发优势,但面临真实环境考验。

量子位
算法论文8

ACL 2026 | Spatial-Agent:地图Agent全新概念转换范式

论文 'Spatial-Agent' 提出地理空间问答应建模为 'concept transformation',引入 GeoFlow Graph 中间表示。它从自然语言问题构建图结构,再映射工具调用。实验显示其对地图任务有帮助,还指出构建地图类 agent 需稳定数据源等。

PaperAgent
开源动态7

“同事.skill”不用写了,爱马仕 Hermes 主动“蒸馏”你,还让开发者集体抛弃 “龙虾”?!

近日,Hermes Agent 在国内爆火,获超 3.9 万 stars。它是单 Agent 架构,核心是学习循环,记忆分层管理。其网关功能强大,状态可跨会话留存。背后的 Nous Research 目标是打造抗衡 OpenAI 的开源模型,还引入区块链解决算力问题。

InfoQ