三段式后训练」共找到 3747 篇相关文章

新闻资讯8

起底张汝京

本文讲述张汝京投身中国芯片事业的故事。他出身科研家庭,心怀家国情怀,辗转多地建厂。回大陆创办中芯国际,解决资金、人才等难题,却遭台积电诉讼。投身LED、硅片、CIDM等领域,为产业补短板。

芯师爷
算法论文7

LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?

论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。

深度学习自然语言处理
开源动态8

万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI

10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用大模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。

新智元
开源动态8

DeepDiver-V2来了,华为最新开源原生多智能体系统,“团战”深度研究效果惊人

华为发布DeepDiver-V2原生多智能体系统,采用“团队作战”模式,在复杂知识问答和长文报告生成上表现出色。它以Planner为中心协调多个Executor,有智能任务分解等优势,训练也有新机制,昇腾NPU集群加速。

量子位
开源动态8

MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4

MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。

深度学习自然语言处理
7

华为盘古大模型:被芯片牵制的“千古”模型

华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
新闻资讯7

千亿市值巨头,超百亿押注算力产业链

东山精密在今年6月收购光模块企业索尔思光电股价暴涨、市值破千亿,近日又宣布子公司投资不超10亿美元建高端PCB项目。两项投资额超百亿,但索尔思光电有研发迟缓、毛利率低等问题,东山精密高端PCB技术也不足。

芯师爷
新闻资讯7

Meta亿元天团首个大模型交卷!余家辉宋飏Jason Wei耗时九个月,一雪Llama前耻

Meta超级智能实验室耗时9个月推出原生多模态模型Muse Spark,发布股价拉升。它让Meta在第三方测评中赶上第一梯队,虽在编程和长时间自主运行有差距,但在多模态理解等方面表现突出,不过也有编程翻车情况。

量子位
推荐文章7

硬件创业者必看:深谈影石刘靖康

文章是对影石创始人刘靖康的访谈。他谈到上市团队未松弛,因影像行业苦且目标远大。还阐述做无人机的原因、产品特点,分析不打价格战的理由,指出无人机关键技术和隐形门槛,最分享对硬件创业等问题的看法。

Founder Park
开源动态8

腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实

腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。

AIGC开放社区