「混合训练框架」共找到 3555 篇相关文章
首次!Meta证实LLM评审不可信!
Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。
JustGRPO:扩散语言模型的极简主义回归
本文提出回归极简的方法 JustGRPO,在 RL 阶段让模型自回归生成,用标准 GRPO 训练,能超越各类针对 dLLM 设计的 RL 算法表现,提升推理表现同时保留并行解码能力。
AI Code赛道跑出一匹黑马:字节Doubao-Seed-Code
字节发布面向Agentic Coding任务优化的编程模型Doubao - Seed - Code。它在代码能力、生态兼容性、价格上优势明显,在实际案例中表现出色,其训练体系独特,为开发者提供高性价比选择。
OpenAI官宣GPT-6 Astra,AGI时代要来了吗
OpenAI官宣GPT - 6 Astra,自称‘世界上最聪明、对齐最好的模型’,总裁称迎来AGI时代。它成绩亮眼,能直接完成工作,达网络安全阈值,训练让AI深度参与,但价格较贵。
Mythos限测首日破防,论坛玩家猜网址就摸进门了
4月7日,Anthropic新模型Claude Mythos Preview限量发布,当天就有未授权用户猜出在线地址获得访问权限。Anthropic称未发现自身系统受影响,该模型对齐表现较好,但训练有技术错误。
谷歌DeepMind:AGI不必是巨型模型,拼凑型AI群或率先涌现,管理大规模Agent迫在眉睫
DeepMind最新研究提出,AGI未必以单一巨型模型形式出现,可能由多个次级AGI智能体协作拼凑涌现。为此,团队提出分布式AGI安全框架,包含四层深度防御模型应对新安全挑战。
抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10
传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
谷歌推出 LLM-Evalkit,为提示词工程带来秩序与可衡量性
谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。
论文秒变PPT!西湖大学AGI Lab推出Auto-Slides,科研汇报难度骤降
西湖大学AGI Lab推出Auto - Slides,输入论文PDF可自动生成演示文稿,支持自然语言交互修改。它采用多智能体协作框架,经实验验证优势明显,有望用于学术会议等场景,助力知识传递。