可核验奖励」共找到 4197 篇相关文章

新闻资讯7

CVPR 2026新规:强制披露算力成本,高效率、高透明度论文获三项认

CVPR2026出台‘计算资源报告表(CRF)’试点计划,要求论文作者报告研究中使用的计算资源,提交报告不影响论文接收决策,展示出色计算效率和透明度的论文获认奖项。

机器之心
算法论文8

定位大模型「作弊」神经回路!新研究首次揭示:虚假奖励如何精准激活第18-20层记忆

此前学术界发现大模型用虚假奖励训练也能提升准确率,背后微观机制是黑盒。南科大等团队深度拆解,定位到关键记忆节点,发现‘困惑度悖论’,还能操控记忆,成果对评估、检测和去污染有意义。

量子位
推荐文章7

实战·Agentic 上下文工程(下):实现一个自我学习与进化的智能体原型

文章参考ACE论文架构与提示词设计,实现自我学习与进化的ACE智能体原型。介绍整体架构、各模块实现逻辑、工作流组装测试,也指出当前问题如LLM表现波动大等,并给出改进方向。

AI大模型应用实践
产品应用7

Qwen深度研究一夜升级!生成网页和音频播客,新模型能认医生手写体

Qwen版深度研究加速进化,增加听觉和视觉输出,生成网页和音频。改进功能同时更新模型,Qwen3 VL能识别医生手写体。实测新功能表现出色,Qwen3-VL系列更新后性能优异。

量子位
新闻资讯8

谷歌量子计算重磅突破登上Nature:首次实现验证量子优势,比最快超算快13000倍

谷歌量子AI团队宣布里程碑式算法突破,其Willow芯片运行“量子回声”算法,首次在硬件上实现验证量子优势,执行特定任务比最快超算快13000倍,为多领域应用铺平道路。

AI寒武纪
开源动态7

从表复杂文档中提取结构化数据的Python库agentic-doc,支持100+页PDF长文档

LandingAI的Agentic文档提取API从复杂文档提取结构化数据,Python库agentic-doc封装该API,支持100+页PDF长文档,有自动重试、并行处理等功能,还能视化调试。

GitHubStore
新闻资讯8

汪军对话 Rich Sutton:大模型在一定程度上分散了我们对智能理解的注意力

在RL China 2025开幕式上,汪军与图灵奖得主Richard Sutton对话。Richard认为大模型缺乏目标和奖励,分散对智能理解的注意力。他强调RL核心是从经验学习,智能原则含梯度下降等,建议将目标解读为“奖励”。

AI科技评论
算法论文8

vivo AI Lab提出自我进化的移动GUI智能体,UI-Genie无需人工标注实现性能持续提升

香港中文大学MMLab和vivo AI Lab团队提出自我进化框架UI - Genie,构建奖励模型UI - Genie - RM解决轨迹验证难题,通过数据生成和模型迭代闭环实现智能体与奖励模型双向增强,在多基准测试中表现出色,打破人工标注瓶颈。

机器之心
产品应用7

小哥硬核手搓AI桌宠!接入GPT-4o,听得懂人话还能互动,方案复现

国外小哥Matthieu Le Cauchois受皮克斯台灯机器人启发,手搓AI桌宠Shoggoth,接入GPT - 4o,能与人互动。它结构简单复现,采用低级和高级控制层,策略经仿真和真实环境验证有效。

量子位
推荐文章8

内核级的真相:为什么 eBPF 正在取代基于用户空间的 Agent 成为安全观测性的首选

文章指出基于用户空间的安全 Agent 存在与威胁同权限层级、CPU 成本高、易被攻击等问题。eBPF 能在 Linux 内核运行受沙箱保护程序,降成本、增见性。上线应分阶段,还介绍工具及部署安全措施。

InfoQ