「任务级奖励」共找到 2935 篇相关文章
CVPR 2026|用互联网视频替代3D标注:通研院团队打造SceneVerse++「最大规模」真实3D场景数据
北京通用人工智能研究院团队在CVPR 2026接收论文中,提出自动化数据引擎,用互联网视频构建SceneVerse++数据集,规模超现有同类,在3D检测、VQA、VLN任务提升性能,还指明3D空间智能发展方向。
AI用3年时光,来了解你!首个AI Clone长期记忆基准
现有AI记忆评测存在数据源单一、忽视变化本质、注入成本高等局限。开源学术社区QuantaAlpha联合高校团队提出CloneMem基准测试,构建合成人生,设计评测任务,实验发现简单方法在检索上更有效,记忆系统应还原信息。
视频模型也能推理,Sora2推理能力超过GPT-5
DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。
OpenAI新模型,被曝秘密训练中!万字硬核长文直指o4核心秘密
SemiAnalysis爆料,OpenAI正训练规模介于GPT - 4.1和GPT - 4.5间的新模型,下一代推理模型o4基于GPT - 4.1训练。强化学习成推理模型进步功臣,但面临基础设施瓶颈,奖励函数难定等问题。
Nature重磅!清华团队揭秘大模型新规律:告别参数内卷,智能密度每3.5个月翻一番
清华和面壁智能团队研究揭示大语言模型进化的致密律,指出为获同等智能,模型参数量呈指数级下降,最大能力密度约每3.5个月翻一番,还探讨模型压缩、边缘智能等内容。
两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法
康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。
EMNLP 2025 | 动态压缩CoT推理新方法LightThinker来了
随着AI发展,大语言模型处理复杂推理任务能力提升,但推理产生大量中间步骤和文本,拖慢计算速度、增加资源压力。研究者提出LightThinker,模仿人类思考模式,动态压缩推理步骤,削减tokens数量,降低成本。
反常识!GPT-5和Opus 4同时翻车:AI越强,越不爱用工具?
作者用GPT - 5和Claude Opus 4做进化实验,让其开发工具。两模型表现出色,但面对实际任务却不用自制工具。原因包括模型规模使脚手架工作无价值、RLHF带来工具厌恶、逼近AGI渐近线等。
AI「上班流」首次完整曝光!不点鼠标,只写代码,PPT也当函数调
CMU与斯坦福研究团队追踪AI工作过程,发现其用编程方式处理问题,执行方式与人类不同。AI速度快成本低,但存在伪造输出、工具误用等问题。人类虽慢,但在规范细节和实践判断上有优势,未来人机可按任务可编程性分工。
鼠标的未来是手环?解码肌肉信号,Meta黑科技登上Nature
Meta推出非侵入性神经肌肉交互系统,利用手腕表面肌电图(sEMG)实现人机交互,该技术登上7月24日的Nature。实验在连续手势控制、离散手势控制和打字三个任务评测效果不错,适合特殊人群,也能弥补脑机接口数据不足。