「语境学习能力」共找到 4250 篇相关文章
字节Seed新作:模型合并如何改变大模型预训练范式
字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。
抗干扰能力提升近40% !无需对抗训练,北航上海AI Lab新蒸馏方法提升模型鲁棒性 | ICML 2025
在人工智能模型规模持续扩大的今天,数据集蒸馏方法能提升训练效率、降低成本,但蒸馏模型在安全性要求高的任务中抗干扰难。北航上海AI Lab团队提出ROME方法,无需对抗训练,显著提升模型鲁棒性,成果被ICML 2025接收且已开源。
万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026
清华大学等联合提出高通量视觉高保真仿真器GS - Playground,被RSS 2026录用。它解决现有仿真器渲染开销高、资产制作依赖人工、Sim2Real迁移鸿沟大等问题,是全栈重新设计的仿真基础设施。
完全开源的7B模型,性能比肩主流LLM,训练成本仅16万美元,复现DeepSeek的强化学习!
Moxin-7B由多机构团队联合开发,遵循“开源科学”原则,公开全流程细节。它训练成本仅16万美元,评测表现亮眼,在架构、数据策略、训练过程等方面有创新,为中小企业提供可控AI方案。
浙大&港理工等提出InfiGUI-R1:利用强化学习,让GUI智能体学会规划任务、反思错误
多模态大模型驱动的GUI智能体有潜力,但现有智能体面对复杂任务力不从心。浙大等机构提出InfiGUI-R1及Actor2Reasoner框架,通过两阶段训练提升智能体能力,InfiGUI-R1-3B在多基准测试中性能卓越,为GUI自动化工具开辟新道路。
Anthropic宣布练出神话级模型:Claude Mythos,代码和黑客能力吊打opus4.6,不向公众开放!
Anthropic宣布Project Glasswing计划,因训练出超强模型Claude Mythos Preview。该模型代码和推理能力超opus 4.6,扫描主流软件发现数千零日漏洞。此模型不向公众开放,计划先在Claude Opus验证安全机制。
小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%
Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。
我拥有了超能力!Meta最牛文科生让3个AI互掐,竟造出1人技术部
Meta产品经理Zevi Arnovitz零技术基础,借助Cursor和Claude治愈代码恐惧。他分享经历,用管理团队方式管理AI,建立开发流,还让AI互审代码。AI正让普通人构建未来,职场需全能构建者。
谷歌 Cloud AI 总监 14 年血泪复盘:AI 时代工程师不可替代的 5 类能力,代码反而排在最后
谷歌 Cloud AI 总监 Addy Osmani 复盘 14 年谷歌职场,指出在大厂代码非决定工程师发展的关键,分享 21 条心得,如用户至上、携手求真等,助工程师少走弯路。
阿里开源长文本深度思考模型!渐进式强化学习破解长文本训练难题,登HuggingFace热榜
阿里开源长文本深度思考模型QwenLong - L1,登上HuggingFace热门论文第二。它解决了长文本强化学习训练难题,通过渐进式上下文扩展训练,在多基准测试中表现出色,还探讨了SFT和RL作用。