「游戏即训练」共找到 2608 篇相关文章
想进OpenAI?先解出这道题,百万美元算力已就位
OpenAI发起Model Craft Challenge「Parameter Golf」项目,要求在固定数据集上降验证损失,模型产物控制在16MB内,8张H100 GPU 10分钟完成训练。提供百万美元算力,6月招早期人才,挑战3月18日至4月30日。
国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测
文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。
3A大作!阿里ROLL团队从基建->算法->机理,推动RL4LLM全栈协同优化
阿里巴巴ROLL团队联合高校推出「3A」协同优化框架,推动「强化学习用于大语言模型(RL4LLM)」迈向新范式。Async架构提升GPU利用率,AsyPPO降低计算资源消耗,Attention机制提升训练效率与可解释性。
因果发现大模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116
浙大、清华与稳准智能联合发布因果发现大模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。
赌自己会失业!田渊栋八人天团狂揽44亿元,杀入「递归进化」赛道
Recursive Superintelligence由八位顶尖AI研究员创立,获GV、英伟达等投资6.5亿美元。他们要让AI自我训练,实现递归自我进化,若成功或使AI研究员岗位消失。此前已有相关成果,产品端Anthropic也在推进AI主动性。
来了,DeepSeek又悄悄开源LPLB项目
DeepSeek 悄悄开源 LPLB 项目,该项目解决 MoE 小批量训练专家每批 token 数抖动问题。LPLB 在 EPLB 基础上,将‘冗余专家’看成带容量边的图,每批解一次线性规划,实现 token 重新路由,单节点 100µs 级求解。
谷歌Gemini 3.0「全家桶」年度压轴,前端不再需要人类!下周王者降临
网友爆料谷歌下一代旗舰模型Gemini 3.0将于10月22日发布。不少开发者拿到内测资格并放出demo,显示其在前端开发表现惊人,能一键直出网页、游戏等,还能原创音乐,或对前端和设计产生较大影响。
引入小目标注意力模块改进YOLO12用于无人机视角下的岸边人员玩水检测
文章介绍用小目标注意力模块改进YOLO12,用于无人机视角下岸边人员玩水检测。先介绍YOLO12特点与结构,再说明小目标注意力模块CBAM优势、流程及代码,接着阐述改进方法、数据集情况,最后给出训练和测试模型的代码与结果。
断崖第一!深度机智Z-WM再夺WorldArena冠军
2026年5月深度机智成立一周年,其Z - WM在WorldArena Track 2夺冠,领先30.5分。该公司围绕人类第一视角数据构建完整技术体系,其成果表明生成数据可用于具身智能模型训练,具身智能竞争重心正迁移。
做了十年设计,这次真觉得自己多余了|GPT-Image-2 上手实测
作者对刚发布的GPT - Image - 2进行上手实测,发现它无需复杂提示词,随手几个字就能出好效果。在互联网运营图片、知识类卡片、游戏设计、论文解释、网页设计等多领域表现出色,或冲击设计行业。