「预训练范式」共找到 2905 篇相关文章
HF日趋榜一!真端到端模型AutoDeco终结手动调参解码
大语言模型手动调参解码繁琐,腾讯AI Lab王琰团队联合港中大(深圳)唐晓莹教授团队推出AutoDeco架构,通过创新训练策略让模型动态预测解码参数,在多模型实验中表现出色且已开源。
奥特曼:点名表扬两个波兰人,OpenAI还没遇到过他们解决不了的问题
奥特曼点名表扬OpenAI两位波兰科学家Jakub Pachocki和Szymon Sidor,他们贡献从Dota项目扩展强化学习到领导GPT - 4预训练。2023内乱中他们追随奥特曼,后帕哥成首席科学家,西哥为独立贡献者。
Think in Games:做一个在王者荣耀中会玩和思考的Agent
文章介绍论文《Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models》,指出当前AI在游戏领域面临的困境,提出TiG框架结合大语言模型与强化学习,打造既会做又会说的AI,实验验证其高效性。
Claude 4 核心成员访谈:提升 Agent 独立工作能力,强化模型长程任务能力是关键
Anthropic 两位研究员在采访中表示 2025 年强化学习在大语言模型训练奏效,如 Opus 4 能处理长周期任务。还探讨模型发展方向,如用户与多模型交互、模型可解释性等,认为未来会有白领 AI 员工。
太抓马了!马斯克OpenAI开庭,硅谷巨富互揭老底像极了村口吵架
马斯克与OpenAI的世纪庭审爆点不断。马斯克承认xAI用OpenAI模型训练Grok,且庭审中六次失态;OpenAI也有黑料,如Brockman日记暴露其私下盘算。目前风向对马斯克不利,后续还有奥特曼等证人登场。
别被室内基准高分骗了:大模型是在推理空间,还是在「背答案」?
2025年,空间智能成大模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院大学等机构发布OSI - Bench重新审视大模型空间能力,评测显示当前提升可能是虚假繁荣。
UC伯克利新作颠覆认知:LLM靠「自信爆表」学会推理?无需外部奖励超进化
UC伯克利华人团队发现,LLM不靠外部奖励,仅靠「自信爆棚」就能学会复杂推理。他们提出基于内部反馈的强化学习(RLIF)新范式,用INTUITOR方法让模型用自身置信度作内在奖励,在多任务中表现良好。
AI Agent 距离真正替人「全自动办公」,还有多远?
Meta、微软和 xAI 被曝监视员工操作来训练 AI,原因是真实办公中 AI Agent 表现不佳。SaaS - Bench 评测显示顶级大模型表现糟糕,智能体存在长周期任务脆弱、跨应用错误放大等问题,未来 SaaS 软件或需为 Agent 重新设计。
故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究
OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。
JCP | 哈工大(深圳)胡钢团队:三维钝体流动中主动流动控制的深度强化跨域迁移学习
本文将基于相互信息的知识迁移学习与柔性动作 - 评论(MIKT - SAC)算法结合,解决主动流动控制中状态和动作维度的跨领域问题。应用于两个测试案例,结果显示该方法优于SAC算法,能显著减少训练时间、降低阻力系数。