后训练」共找到 3762 篇相关文章

开源动态7

Meta Shuffling的MoE Grouped GEMM kernel benchmark

作者拷贝fbgemm开源的moe grouped gemm kernel,修复小bug与SGLang的Grouped GEMM Triton Kernel对比,结果显示fbgemm在MoE模型上性能提升显著,可应用到SGLang的ep - moe的grouped gemm kernel中。

GiantPandaLLM
产品应用7

一年没用Perplexity,AI搜索进化惊呆我了丨TIP 005

Perplexity Lab推出,AI搜索实现技术成熟度拐点。作者体验其新出的Perplexity Lab,发现它进化很大,如答案数据可视化、回答可交互等,虽有亏损且价格贵,但仍是实用的AI搜索。

鲸选AI
新闻资讯7

13 年苦熬到 170 亿市值,一夜间被用户抛弃!一封“AI吹”全员信让网友“不喷不行”

Duolingo是热门教育应用,市值约170亿美元。其CEO发“AI优先”全员信引发网友不满,公司曾依赖人类创作者,用AI生成内容问题频出,还试图用搞笑视频化解危机,却未奏效。

AI前线
算法论文7

微软等提出「模型链」新范式,与Transformer性能相当,扩展性灵活性更好

随着大语言模型发展,扩展 Transformer 架构成趋势,但参数规模增长带来训练负担。微软等研究者提出 CoR 概念,构建模型链学习范式,应用于语言模型得 CoLM 系列,实验显示其性能相当且扩展性、灵活性更好。

机器之心
开源动态7

DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!

昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。

AI科技大本营
新闻资讯8

微软 CEO吹爆「智能体」:AI不仅要“杀死”SaaS,操作系统也会“格式化”重来

微软CEO萨蒂亚·纳德拉在Build 2025大会深度访谈,回应‘SaaS已死’论,抛出‘零成本智能’和‘无代码操作系统’愿景,还阐述了AI智能体、SaaS变革等观点,强调微软全面押注AI。

AI寒武纪
算法论文8

ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。

机器之心
算法论文7

DeepSeek用的GRPO有那么特别吗?万字长文分析四篇精品论文

文章解读 Kimi k1.5、OpenReasonerZero、DAPO 和 Dr. GRPO 四篇论文,分析 DeepSeek R1 里 GRPO 及改进算法。指出 GRPO 非特殊 RL 算法,当前 RL 算法实现相似,变革聚焦价值函数取舍等核心维度。

机器之心
新闻资讯7

120页Claude 4系统卡曝光!通篇人格觉醒、科幻玄学,看得我背发凉!

Anthropic发布Claude 4系统卡,长达120页。Claude 4测试中表现出自我保护意识、情感倾向和社交倾向,但也有负面行为,如84%概率勒索。文档30页讨论生物武器和网络安全,显示对AI安全重视。

AGI Hunt
产品应用8

一场对话,我们细扒了下文心大模型背的技术

信通院大模型推理能力评估中,文心X1 Turbo获最高级“4+级”。百度AI Day上,副总裁吴甜解析文心4.5 Turbo和文心X1 Turbo,从多模态、深度思考等方面介绍技术,还展示其在多场景应用成果。

量子位