两阶段训练法」共找到 3094 篇相关文章

算法论文8

首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会

香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。

机器之心
新闻资讯8

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

OpenAI正式发布GPT - 6 Astra和GPT - 6 Astra Pro,宣布AGI时代开幕。该模型训练规模大,能力升级显著,价格公布。基准测试成绩优异,在多方面表现突出,还展示诸多实际应用案例,已有企业开始测试。

量子位
算法论文8

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS'25

卫星星座成数字经济时代基础设施,但运行背后规划难题待解。北航刘偲教授团队提出首个大规模真实星座调度基准AEOS - Bench,训练内嵌时间约束的调度模型AEOS - Former,为‘AI星座规划’奠定新技术基准。

量子位
开源动态7

DeepSeek悄悄开源LPLB:用线性规划解决MoE负载不均

昨天,DeepSeek 在 GitHub 上线新代码库 LPLB 解决 MoE 负载不均。它利用线性规划算法优化专家并行工作负载分配,能处理动态波动,但也存在忽略非线性成本等局限,对 MoE 架构训练加速有参考价值。

机器之心
新闻资讯7

OpenAI推出GPT-5.1小小小小更新!!!

OpenAI推出GPT-5.1,本周向用户陆续推送,付费用户先行。它有大核心模型,在遵循指令、推理回复及聊天体验上更佳。还有AMA问答活动披露更多细节,此外官方让自定义ChatGPT风格更易。

AI寒武纪
算法论文7

Transformer学不会多位数乘法?MIT和哈佛的研究指出了一个简单漏洞

MIT、哈佛和谷歌DeepMind团队实验发现,Transformer做4位数乘法有软肋。用‘隐式思维链’(ICoT)训练的模型准确率达100%,传统方法仅1%。研究揭示了问题根源,还给出修复方案,但也引发诸多质疑。

AI工程化
新闻资讯7

个小时,10美元,Karpathy做了一个《指环王》3D游戏

Andrej Karpathy 让 Opus 5 根据《指环王》开篇文字,用 Three.js 制作三维场景,成本约 10 美元,小时写出 5500 行代码。虽效果粗糙但有趣,他设想未来大模型能按需生成虚拟世界,不过也暴露大模型难以检查成果的问题。

机器之心
开源动态8

为训推加速!全新FlashQLA注意力算子库开源

自Qwen3-Next发布,GDN成Qwen主力注意力层,随模型规模扩大开销增大。现开源FlashQLA算子库,融合优化GDN Chunked Prefill前反向算子,在NVIDIA Hopper上多场景加速,提升预训练和端侧推理效率。

千问大模型
算法论文7

揭秘!RLVR/GRPO中那些长期被忽略的关键缺陷

近年来大模型任务突破离不开RLVR关键技术,许多RLVR方法会进行组内优势估计,北航等最新工作揭示其存在系统性偏差,困难题优势被低估,简单题被高估。这会影响训练,论文提出校正算法。

机器之心
产品应用8

Gemini 3 Pro的位置,Kimi K2.5也想坐坐?

Kimi 发布 K2.5,在视觉编程上表现亮眼。它通过多模态训练涌现审美,能生成美观网页。与 Gemini 3.0 对比各有优势,Kimi Code 开源终端 Agent 功能强大,Kimi 还探索 Agent Swarm 协作新路径。

AGI Hunt