「训练推理协同」共找到 3882 篇相关文章
百度CTO王海峰:AGI曙光已现,Scaling Law仍有效|新智元十周年峰会
新智元十周年峰会,百度CTO王海峰分享AI发展。回顾十年,从AlphaGo到如今大模型爆发,AGI曙光已现。他指出AI具通用性和全面性,百度内部超45%新增代码由AI生成,Scaling Law仍有效。
重磅!Thinking Machines开山之作:大模型输出随机的根本原因被揪出,并开源终结方案
由OpenAI前CTO创办的Thinking Machines宣布上线技术研究博客,开篇文章揪出LLM输出随机的根本原因是负载及批次大小的非确定性变化,并给出系统性解法,还开源方案。
GPT正面对决Claude!OpenAI竟没全赢,AI安全「极限大测」真相曝光
OpenAI和Anthropic罕见合作,测试双方模型在幻觉等四大安全方面的表现。这场合作是AI安全的里程碑,百万用户每天的互动推动安全边界扩展。文中详细对比了GPT和Claude模型在各安全测试中的表现。
杭州跑出的AI独角兽,突围大模型的“第二战场” | 甲子光年
2025年AI行业有转变,算力堆叠对大语言模型性能提升放缓,空间智能成“第二战场”。谷歌、英伟达等巨头纷纷布局,群核科技作为杭州“变量”,发布业界首个3D室内空间大模型,构建数据飞轮,技术有望落地多领域。
全网爆火的DeepSeek「UE8M0 FP8」,原来英伟达早已支持
NVIDIA PTX ISA文档早有.ue8m0数据类型,UE8M0 fp8并非DeepSeek独创。从PTX 8.0/9.0起,NVIDIA在ISA级别支持.ue8m0,H100、RTX 40系列等都有相关支持,DeepSeek是将其提升到模型层面。
视频生成 vs 空间表征,世界模型该走哪条路?
随着生成模型和潜在表征技术发展,业界探讨世界模型技术路线。是像素级视频预测模拟未来场景可靠,还是潜在空间抽象表征高效?Goole DeepMind的Genie 3发布,再次引发讨论,分歧也从理论走向应用。
SceneGen: 单图像驱动的多资产3D 场景生成
上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的多个3D资产。它一次前向传播即可完成生成,在效率与稳健性上优于现有方法,虽有局限但应用潜力大。
AI 时代操作系统的三重叙事:技术重构、国产化突围与生态共建
《AI 进化论:智算时代操作系统的破局之路》首期,周明辉、马涛围绕 AI 对操作系统的影响等核心命题展开对话。指出 AI 让操作系统面临挑战,技术演进分两条路径,还谈到安全、国产化、生态共建等问题。
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
DeepSeek V4 借实习生获奖论文“起飞”?梁文峰剑指上下文:处理速度提 10 倍、要“完美”准确率
ACL公布2025年获奖论文,中国作者比例超51%。DeepSeek梁文锋通讯、实习生袁境阳一作的论文获Best Paper奖。其提出NSA机制,实验显示性能优、准确率高、速度提升显著,成果或用于DeepSeek V4。