双预训练架构」共找到 3636 篇相关文章

开源动态8

王兴一鸣惊人!美团首个开源大模型追平DeepSeek-V3.1

美团首个开源大模型Longcat-Flash-Chat发布即引发热议。它在部分benchmark上超DeepSeek-V3.1等,编程能力也出色。技术报告透露美团对大模型的理解,还有新发现,且性能好、训练效率高。

量子位
产品应用8

堆了一仓库GPU,却生产不出专业智能?九章云极用AI工厂给出解答

企业接入通用大模型到业务系统,却发现它难以执行任务。九章云极在发布会上推出‘AI工厂’战略,通过训练工厂和Token工厂填平执行鸿沟,前者用强化学习造专业模型,后者让专业智能规模化流通。

机器之心
新闻资讯7

大模型一年内就会吞噬 Harness!Google AI Studio负责人:深耕垂直领域才是创业公司唯一生路

Google AI Studio负责人Logan认为,大模型一年内将吞噬Harness,90%的Agent中间件公司最多存活12个月。创业公司应深耕垂直领域,Google用Anti - Gravity平台串联产品,推动智能体发展,且模型后训练潜力巨大。

AI科技大本营
开源动态8

1.2万人收藏单日斩获 3.4K!刚刚冲上 GitHub Trending 榜首的“AI 红队”工具!

AI加速代码编写,但也留下更多安全坑,传统扫描工具和人工渗透测试难以应对。新晋GitHub Trending榜首工具Shannon是全球首个开源全自动AI渗透测试员,多智能体架构,功能强大,适合AI编程团队。

开源星探
开源动态7

马斯克刚刚真把 𝕏 平台推荐算法给开源了,核心也是Transformer

𝕏平台(原Twitter)将全新推荐算法开源,由与xAI的Grok模型相同的Transformer架构驱动。该算法预测用户行为对帖子排序。此前平台因算法问题被调查和罚款,开源或有此原因。

机器之心
算法论文7

苹果光速撤回RLAX论文:用了谷歌TPU和阿里Qwen,作者中还有庞若鸣

苹果一篇新论文在 arXiv 公开后匆匆撤稿。该论文揭示基于 TPU 的可扩展 RL 框架 RLAX,用了谷歌 TPU、亚马逊云及阿里 Qwen 模型,还介绍其架构、策略支持等,实验结果亮眼,也分享 Debug 过程。

机器之心
新闻资讯8

谷歌用Gemini 3同时革了OpenAI和英伟达两家的命

谷歌发布Gemini 3全家桶,打断英伟达和OpenAI双赢美梦。它实现原生多模态,对OpenAI构成代际优势;用TPU训练模型,摆脱CUDA依赖,冲击英伟达算力神坛。谷歌全栈自研,其发展或改变AI格局。

新智元
产品应用8

华为超节点:用「一台机器」的逻辑,驱动AI万卡集群

在华为全联接大会2025上,华为基于自研灵衢互联协议创新超节点架构,重新定义大规模有效算力新范式。它能解决传统集群通信问题,还推出覆盖全场景的产品组合,并强调‘硬件开放、软件开源’生态战略。

机器之心
8

100 页 Agentic RL 综述!牛津、新国立、AI Lab 等联合定义 LLM 下半场

2025 年大语言模型热潮持续,但当前主流训练范式显瓶颈。牛津、新国立等 16 家机构学者发布 100 页 Agentic RL 综述,明确定义从‘会说’到‘会做’进化路径,剖析理论、结构与实践,展望未来挑战。

特工宇宙
新闻资讯7

号称最道德的AI公司,却靠盗版书喂大脑,结局赔了15亿刀:Anthropic CEO小传

文章讲述Anthropic CEO Dario Amodei的故事。他曾因担忧GPT-2风险离开OpenAI创立Anthropic,获有效利他主义者资助。Claude研发慢错过市场,后求立法监管对手,还因用盗版书训练模型被告,赔15亿刀。

AI寒武纪