「3D强化学习」共找到 3363 篇相关文章
训练加速1.8倍,推理开销降78%!精准筛选题目高效加速RL训练丨清华KDD
清华大学THU-IDM团队与慕尼黑大学CompVis团队合作提出MoPPS框架,解决强化微调代价高问题。它精准挑题,预测难度,开销低、动态适应且平衡探索利用,在多任务表现佳,降本增效,有新范式。
姚顺雨入职腾讯50天后,发布了首篇署名论文:CL-Bench
2月3日姚顺雨加入腾讯50天后发布首篇署名论文《CL-bench: A Benchmark for Context Learning》。该论文做了新的benchmark,测试显示前沿模型平均分仅17.2%,指出模型在上下文学习尤其是归纳能力上的短板。
腾讯AngelSlim重磅升级!面向全模态的大模型压缩算法工具包,推理速度飙升 1.8倍!
近年来,推理阶段的成本等因素制约大模型规模化应用。腾讯混元升级的 AngelSlim 围绕 Eagle3 投机采样训练范式构建系统化实现,支持多模态场景,最高可实现 1.9× 推理加速,还具备多亮点。
谷歌卷Gemini模型,OpenAI刷GPT-5科研论文
谷歌推出Gemini 3 pro等模型,来势汹汹。OpenAI CEO称其带来经济阻力,还挖掘GPT - 5应用价值并发表89页论文,展示在科研流程中的表现,也提及失败风险与可用Prompt模板。
大模型自信心崩塌!谷歌DeepMind证实:反对意见让GPT-4o轻易放弃正确答案
谷歌DeepMind携手伦敦大学研究发现,GPT - 4o、Gemma 3等大语言模型有“固执己见”和“被质疑就动摇”并存的冲突行为,原因与训练、决策逻辑、记忆机制有关。研究还通过两轮实验证实。
Karpathy最新脑洞「细菌编程」:优秀的代码应该具备细菌的三大特质
大神Karpathy提出“细菌编程”新概念,代码要有小而精、模块化、自包含且易复制粘贴的特点,让开源社区发展。他还提出过“软件3.0”“氛围编程”等概念,这些脑洞或成未来编程范式信号。
首批GPT-6内测结果好离谱啊。。。
GPT - 6使用资格分批开放,内测玩家抢先体验。其在3D生成、游戏开发、网页制作等多领域表现出色,如15分钟做出Mac应用,空间推理达世界级水平,但运行时Token消耗大。
DeepMind 创始人 Hassabis 语出惊人:百万 token 只是在贴胶带,AGI 在 2030 年
DeepMind创始人Hassabis在访谈中评估AGI进展,认为当前范式是最终架构一部分,但持续学习等问题待解决,预计2030年左右实现AGI,还探讨了Agent、蒸馏等多方面内容,并给创业者建议。
Meshy用户破千万后杀向新战场:ARR年翻14倍,头部厂商集体买单
Meshy是计算机图形学大神胡渊鸣创立的AI 3D公司,其创意工坊打通“AI创意→实体交付”。Meshy生成模型打印适配度高,破圈至多元领域,注册用户破千万,ARR年翻14倍,获多轮融资。
视频模型假装在推理?MME-CoF新基准评估12个推理维度
视频生成模型如Veo - 3能生成逼真视频,但推理能力存疑。香港中文大学等校研究者设计12项测试,发现模型只能模仿表面模式,未真正理解因果。研究推出MME - CoF基准,为评估指明方向。