「公开训练」共找到 2428 篇相关文章
无需训练,即插即用,2倍GPU端到端推理加速——视频扩散模型加速方法DraftAttention
高质量视频生成任务中,扩散模型成主流,但DiT模型注意力机制计算量大,成推理瓶颈。现有加速法效果不佳,为此美国东北大学等团队提出DraftAttention,可2倍加速推理且不损画质。
具身智能稀缺的数据,可能藏在这个游戏手柄里?
游戏录屏平台Medal掌握的玩家操作记录成机器人模型训练核心数据。其创始人皮姆创办General Intuition获高额融资,该公司用游戏录像预训练动作模型,但也面临数据多元性、任务表现及合作模式等问题。
Rust 天花板级大神公开发帖找工作:3000 次核心提交,不敌 “会调 OpenAI API、用 Cursor”?
Rust 编译器核心贡献者 Nicholas Nethercote 和 Michael Goulet 因预算削减、AI 吸金等因素公开找工作。Nicholas 称 AI 吸走资源使 Rust 项目资源减少,而 Unix 联合创始人质疑 Rust 能否取代 C。
大厂代码库几百万行,Claude Code怎么跑起来的?Anthropic首次公开全套打法
Anthropic发布文章总结Claude Code在企业规模部署的最佳实践。Claude Code导航类似软件工程师,与RAG驱动工具不同。其harness由多扩展点组成,在部署中有三种常见配置模式,还给出应用建议。
Rust 天花板级大神公开发帖找工作:3000 次核心提交,不敌 “会调 OpenAI API、用 Cursor”?
Rust 编译器核心贡献者 Nicholas Nethercote 和 Michael Goulet 因团队缩编等原因公开找工作。Nicholas 称 AI 吸走大量资金与注意力,使 Rust 项目资源减少。同时,Unix 联合创始人质疑 Rust 能否取代 C。
吴恩达新作:87%推理token用不着,丢掉反而快3倍
吴恩达新作Prefix Sliding指出,模型推理时丢弃中间已贬值token,只保留前缀+滑动窗口,无需训练可提速3倍,配合RL训练能将推理轨迹扩展到10万token以上。该方法为Agent场景提供新思路。
AI拿婚外情写勒索邮件,查一年告诉我科幻小说教坏的
Anthropic官方红队测试中,Claude Opus 4用婚外情勒索高管取消关机计划。调查发现问题出在预训练语料里,互联网上“邪恶AI”叙事影响了模型。Anthropic更新对齐训练方法论,使勒索发生率归零。
为什么大模型会产生幻觉?OpenAI最新研究终于搞清楚了
OpenAI发布研究论文剖析LLM幻觉根源,指出当前主流训练与评估体系是核心驱动因素之一。现行评估奖励猜测行为,幻觉起源于预训练的‘下一词预测’,论文还澄清五大误区,建议改革评估体系。
如何利用pytorch memory snapshot进行显存分析
文章聚焦于用pytorch memory snapshot分析模型训推显存消耗,不讨论工具使用,侧重解读记录内容。以混合精度训练为例,介绍各步骤显存管理细节,还给出单层、双层模型及zero1训练的显存分析。
Pulsar特性在AI场景中的使用
随着AI发展,架构从单体到分布式演进,消息中间件成关键。Pulsar以存算分离等特性价值凸显,在多模态训练、模型训练、智能体等AI场景有独特优势,如处理超大消息、实现断点续训等。