自注意力机制」共找到 1944 篇相关文章

算法论文8

让 AI 己打怪升级,Meta用Self-play RL把Coding推向超级智能

Meta FAIR、Meta TBD Lab等朝着“超级智能软件工程Agent”迈出第一步。SSR让大模型零人类标注,靠生成Bug和修复稳定碾压人类数据基线,新旧范式对比优势明显,还介绍方法、实验结果与理论洞察。

PaperAgent
算法论文7

苹果港大终结回归时代?7B扩散模型发布,AI写代码逻辑彻底颠覆!

苹果联合港大开源扩散大语言模型DiffuCoder,用扩散模型+强化学习策略,性能提升4.4%。研究还提出耦合梯度奖励策略优化方法,建立原生RL训练框架,探究了dLLM的生成机制等问题。

新智元
新闻资讯7

GPT-5编程成绩有猫腻!删23道测试题,关键基准还是己提的

有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI己提出的。

量子位
新闻资讯7

OpenAI 不想再「跪着」买显卡了

《金融时报》消息,OpenAI 正和博通合作研代号“XPU”的 AI 推理芯片,2026 年量产。其不仅在芯片发力,还在硬件、应用和算力基建多线出击,不过研芯片也面临资金、人才和软件生态等问题。

AI科技评论
新闻资讯8

Anthropic冲塔ASI进化,要做全球操作系统!Claude OS一刀砍向6.4万亿帝国

Anthropic野心勃勃,开启ASI进化,目标打造全宇宙最强AI操作系统Claude OS,欲抢夺苹果微软6.4万亿市值。Claude可控制电脑,多项功能上新,还推出动模式,且营收增长快、客户结构优化,离ASI越来越近。

新智元
算法论文8

图像分词器造反了!华为 Selftok:回归内核完美统一扩散模型,触发像素主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
算法论文8

为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练

社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。

机器之心
新闻资讯8

WAIC机器人探展:我被全场最靓的崽「Moz1」种草了

2025 年世界人工智能大会上,千寻智能的人形机器人 Moz1 大放异彩。它搭载研 VLA 模型 Spirit v1,具备强大泛化能力,硬件也有多项突破。千寻智能全栈研技术,资本持续加码,有望推动具身智能商业应用。

机器之心
产品应用8

华为升级行业Agent算法架构!MindScale己写prompt和工作流,KV Cache减少5.7倍token

华为诺亚方舟实验室更新面向行业应用的算法包MindScale,融合算法创新与业务实践经验。它梳理了Agent时代技术挑战,给出技术论文与昇腾代码,应对工作流维护等难题,还提升训推效率、适配国产硬件。

量子位
算法论文8

GRPO训练不再「嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化

GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。

机器之心