「后训练算法」共找到 4142 篇相关文章
DeepDiver-V2来了,华为最新开源原生多智能体系统,“团战”深度研究效果惊人
华为发布DeepDiver-V2原生多智能体系统,采用“团队作战”模式,在复杂知识问答和长文报告生成上表现出色。它以Planner为中心协调多个Executor,有智能任务分解等优势,训练也有新机制,昇腾NPU集群加速。
华为盘古大模型:被芯片牵制的“千古”模型
华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。
ICLR 2026 | 这道题是否需要用图思考?模型来告诉你!自适应思考模式切换助力通用视觉推理提升
本文来自复旦大学和阿里巴巴未来生活实验室,已中稿 ICLR 2026。目前视觉推理方法有纯文本和用图思考两种模式,各有优劣。研究者提出 Mixture-of-Visual-Thoughts 范式及 AdaVaR 框架、AdaGRPO 算法,让模型自适应选模式,实验显示其在多任务有提升。
千亿市值巨头,超百亿押注算力产业链
东山精密在今年6月收购光模块企业索尔思光电后股价暴涨、市值破千亿,近日又宣布子公司投资不超10亿美元建高端PCB项目。两项投资额超百亿,但索尔思光电有研发迟缓、毛利率低等问题,东山精密高端PCB技术也不足。
Meta亿元天团首个大模型交卷!余家辉宋飏Jason Wei耗时九个月,一雪Llama前耻
Meta超级智能实验室耗时9个月推出原生多模态模型Muse Spark,发布后股价拉升。它让Meta在第三方测评中赶上第一梯队,虽在编程和长时间自主运行有差距,但在多模态理解等方面表现突出,不过也有编程翻车情况。
硬件创业者必看:深谈影石刘靖康
文章是对影石创始人刘靖康的访谈。他谈到上市后团队未松弛,因影像行业苦且目标远大。还阐述做无人机的原因、产品特点,分析不打价格战的理由,指出无人机关键技术和隐形门槛,最后分享对硬件创业等问题的看法。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
“导演梦”不再遥远:Captain Cinema 让你用短片制作出电影
约翰·霍普金斯大学与字节Seed团队推出自动生成短片的Captain Cinema系统。它以剧情文字为输入,先规划关键帧,再补全画面动态合成短片。采用特殊训练法和模型,虽有局限,但为电影自动生成迈关键一步。
GPT-4o图像生成的「核燃料」找到了!万字长文拆解潜在变量,网友:原来AI在另一个维度作画
上月,GPT - 4o图像生成功能爆火。Sander Dielman在博客中探讨生成模型利用潜在空间提高效率和质量,将潜在变量比作「数据精髓」,深入对比多种模型,还介绍训练方法、损失函数等,兼具理论深度与直观洞察。
这可能是,全球最强开源Agent模型,走了一条反Scaling Law的全新范式!
MiroThinker v1.5开源,其30B小模型在Agent benchmark上击败万亿参数的Kimi K2T。它以交互深度为新Scaling维度,训练有严格时间管控,实测表现超Search Agent,“小模型+强交互”或成新方向。