「三阶段训练策略」共找到 3226 篇相关文章
DeepSeek如何实现5000亿估值?外媒曝其API毛利率高达82.9%
据外媒报道,DeepSeek今年前七个月营收约4.75亿,较2025年全年增长近10倍,净亏损收窄,综合毛利率44.6%,API业务毛利率达82.9%。它正磋商500亿二轮融资,筹备明年沪上市,靠优化基建降本,低价策略吸客。
英伟达和AMD,开始争夺AI制药的计算入口
每年的 Advancing AI 大会,AMD 都要回答 Instinct GPU 除训练大模型外的应用问题。今年大会上,AMD 把一个位置留给 AI 制药公司 MindWalk。而其对手英伟达已在生命科学领域布局多年,生命科学成两家竞争新战场。
Token需求狂飙千倍,22亿热钱涌向这家AGI Infra头号玩家
在AI基础设施成风口的背景下,国内AGI Infra头部玩家无问芯穹获超7亿融资,其Token调用量爆发式增长。随着AI产业进入Agent阶段,传统架构难适配新需求,无问芯穹以中立定位成Token经济枢纽。
30万被引的AlphaGo之父,创业4个月融资近百亿元!笃信RL实现ASI
4月27日,AlphaGo之父David Silver创办的Ineffable Intelligence获11亿美元种子轮融资,投后估值51亿美元。该公司押注强化学习和自我经验学习,试图挑战大模型主线。未来或采用大模型预训练和强化学习混合路线。
「10万小时人类数据」不搞对齐只靠规模,灵初智能Psi-R2登顶MolmoSpaces!
4月10日晚,灵初智能发布大模型、数据集与合作计划,包括策略模型Psi - R2、世界模型Psi - W0及近10万小时人类操作数据。其未走花哨对齐路线,靠系统协同,在MolmoSpaces评测中表现优异,体现自主研发路线先进性。
AI创业,已经没有“出海”这个词了丨量子位沙龙
量子位举办「聊聊出海应用、场景与渠道」沙龙,实战派分享AI出海生存逻辑,涉及搞钱、降本、捷径等方面。指出AI出海下半场是“去AI化”,用户更关注能否解决问题。还介绍了各企业负责人观点与经验。
刚刚,一口气连发3个王炸模型、亮出2026年AGI战略,昆仑万维夯爆了
27日下午,昆仑万维在2026中关村论坛发布全新AI游戏世界模型Matrix - Game 3.0、AI视频大模型SkyReels V4和AI音乐大模型Mureka V9,还公布2026 AGI战略,推动AI从全模态能力突破进入平台化构建阶段。
不止Deep,更要Wide:清华、无问芯穹发布多智能体系统WideSeek-R1,4B模型比肩671B模型!
清华与无问芯穹的RLinf团队提出「广度扩展」,发布多智能体系统WideSeek-R1。它采用「Lead-agent-Subagent」框架,经MARL端到端训练,4B模型在广度搜索任务表现比肩671B模型,且在标准QA任务也出色。
谷歌新论文把内存股价干崩了!KV cache压缩6倍,“谷歌的DeepSeek时刻”
谷歌研究院推出TurboQuant压缩算法,可将AI推理中最吃内存的KV cache压缩至少6倍且精度零损失,还能8倍加速计算。虽引发存储芯片巨头股价下跌,但目前只是实验室成果,仅解决推理阶段内存问题。
永别了,Sora!奥特曼All in超级App
OpenAI一早关停爆火仅6个月的AI视频APP Sora,包括其开发者版本及ChatGPT内视频功能。奥特曼此举是为打造「超级应用」、为IPO铺路,同时为新模型Spud腾出算力,其预训练已完成,将在未来几周发布。