模型训练与微调」共找到 8249 篇相关文章

新闻资讯7

The Batch: 906 | AI 巨头分担维基百科的成本

维基百科成立25周年,维基媒体基金会与Amazon、Meta等多家AI公司达成合作,推出Wikimedia Enterprise计划,允许合作方高速大规模访问数据。维基百科需资金支持,AI公司也需其数据训练模型

DeeplearningAI
推荐文章7

前谷歌研究员发文:算力崇拜时代该结束了

前谷歌大脑研究员 Sara Hooker 发文指出,过去十年 AI 创新依赖算力,但如今持续扩展训练计算资源效率极低,收益递减。她探讨了影响算力回报率的因素,批判 Scaling Law,并提出未来创新方向。

机器之心
开源动态8

装机量超2000万、全球主流GPU与AI框架“开箱即用”!OpenCloudOS成AI时代优先选项

在大模型训练迭代快、算力需求高但 GPU 利用率低、生态碎片化的背景下,2025 OpenCloudOS 操作系统生态大会举办。OpenCloudOS 围绕 AI 升级技术,构建能力闭环,还发布智能基座,降低产业链技术摩擦。

InfoQ
新闻资讯7

The Batch: 973|Claude 的水印如何运作

Anthropic将在2026年8月2日后发布的Claude模型全球部署肉眼不可见、机器可读的水印,用于表明文本和图像由其生成。该技术基于Google的SynthID - Text,不过此公告引发广泛争议。

DeeplearningAI
新闻资讯7

Agent创业者的天塌了,OpenAI发布ChatGPT Agent

昨晚OpenAI发布ChatGPT Agent,这让Agent创业者紧张。它整合多种能力,功能强大,支持多操作。新模型经强化学习调优,在多基准测试中表现佳,或挤压初创公司通用Agent赛道空间。

花叔
新闻资讯7

The Batch: 972|Grok 的 Cursor 联盟获得回报

SpaceXAI发布与Cursor联合开发的视觉 - 语言模型Grok 4.6,已向开发者开放。介绍其输入/输出、特性等信息,阐述工作原理、性能表现,还提及相关新闻背景、重要原因及期望。

DeeplearningAI
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但小模型,大规模表现未知。

DeeplearningAI
算法论文8

刚刚,清华团队用27M参数击败o3-mini!或将改变AI发展方向

清华大学研究团队发布论文,展示Hierarchical Reasoning Model(HRM)。该模型仅27M参数、1000个训练样本,在推理任务上击败OpenAI的o3 - mini - high,或改变AI发展方向。

AGI Hunt
新闻资讯7

30万AI顾问进公司,OpenAI砸1.5亿改写你的报销周报

6月14日,OpenAI掏出1.5亿美元推出Partner Network计划,要在2026年底前训练并认证30万名顾问,将AI塞进企业工作流程。此前Anthropic也有类似动作,模型竞争正转向落地应用。

新智元
开源动态8

刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」

年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。

PaperAgent