「从零训练」共找到 4965 篇相关文章
递归神经网络的复兴:Mixture-of-Recursions
Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。
VLA 推理新范式!一致性模型 CEED-VLA 实现四倍加速!
近年来,VLA模型成机器人领域重要研究方向,但推理速度受限。本文提出一致性蒸馏训练、混合标签监督机制及提前退出解码策略,在多基线模型上实现超4倍推理加速,实验验证其高效通用。
吴恩达YC演讲:AI创业如何快人一步?
吴恩达在YC演讲为AI创业者建议,强调执行速度是衡量创业公司成功的重要指标。他探讨AI技术加速工程和产品反馈等,还谈及AI创业机会在应用层,给出提升创业公司速度的方法等。
LLM「拒绝回答」难题有救了!最新研究让AI学会人情世故 | COLM'25
最新研究发现模型规模和通用语言能力与处理敏感内容判断能力无直接关联,开源模型表现不错。通过提出的训练方法,在非推理和推理型模型上缓解过度拒绝问题,提升AI实用性和可靠性。
下一代AI需要「思想微积分」!华人团队重磅揭秘,AI方法论三连发
来自美国两所大学的华人团队发布「AI方法论三部曲」,提出「能力实现率(CRR)」模型、「认知几何学」框架,指出处于AI的「元语言时刻」,未来迈向「思想微积分」时代,从多维度构建理解AI的世界观。
如何实现RAG与MCP集成
文章聚焦RAG与MCP集成,介绍RAG突破传统模型局限及不足,引出Agentic RAG。阐述MCP革新AI工具连接方式,结合二者构建集成架构,还给出实现步骤、优化策略与代码实践,为释放AI系统潜力提供方案。
小扎千亿挖人名单下一位:硅谷华人AI高管第一人
扎克伯格带队重金诚聘AI人才,还想召回旧部。其中Bill Jia是硅谷大厂AI领域职级最高华人,2023年从Meta转投Google。Meta今年Llama 4发布遇挫,正重组团队、成立实验室并大量挖人。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
通往 AGI 之路的苦涩教训
Google DeepMind CEO 预测 5 到 10 年有 50% 概率实现 AGI。本期《万有引力》直播对话将探讨通往 AGI 之路的教训。6 月 27 日,唐小引将对话刘嘉,从其学术轨迹解答 AI 路上的教训,还会剖析技术路径。
AI浪潮下的算力租赁:欺诈套利、资本炒作、主体脱钩
AI浪潮下,算力租赁市场乱象丛生,有上市公司‘炒概念’推高股价,消纳方套壳毁约‘零成本’,租赁方为订单内卷。不过,市场也在自我调整,国家也有调控举措,行业有望回正轨。