预填充阶段」共找到 1011 篇相关文章

算法论文8

刚刚,OpenAI找到控制AI善恶的开关:ChatGPT坏人格在训练阶段已成型

OpenAI最新论文揭示控制AI“善恶”开关。研究发现训练模型在某领域答错题,会致其在其他领域“学坏”,还找到“毒性人格特征”。同时给出解决办法,能让模型恢复正常。

量子位
新闻资讯8

英伟达Jim Fan:「世界建模」是新一代训练范式

英伟达机器人主管Jim Fan判断,继“下一个词测”后,世界建模将成新训练范式,2026年大世界模型将为多模态AI奠基。他还讨论世界模型定义、应用,展望新推理形式,业内人士也各抒己见。

量子位
推荐文章8

第二代AI训练范式:测下个物理状态

英伟达科学家Jim Fan发布文章《第二代训练范式》指出,当前以LLM为代表的AI模型基于「对下一词的测」,在物理世界应用中「水土不服」,第二代范式应是「测下一个物理状态」,引发机器学习社区讨论。

AINLPer
算法论文8

庞若鸣还有苹果论文?改善训练高质量数据枯竭困境

苹果基础模型原负责人庞若鸣在 Meta 任职期间,其在苹果参与的高价值研究仍不断发表。研究团队针对大模型训练中高质量数据枯竭问题,提出 Synthetic Bootstrapped Pretraining (SBP) 训练流程,提升模型性能。

机器之心
算法论文8

何恺明等降维打击!彻底颠覆AI生图,无需训练一步到位

何恺明团队推出生成模型MeanFlow,它跳脱传统训练范式,无需训练等,仅一次函数评估就能完成生成。在ImageNet 256×256上表现优越,缩小了一步与多步模型性能差距。

新智元
算法论文8

AI生图免训练提速1000%,办法:最简洁的“三阶段流水线”

AI画图速度慢,过往主流加速方法有局限。MrFlow团队提出三阶段流水线,在Qwen - Image等模型上实现10倍以上端到端加速,生成效果好,优势显著,还能与时间步蒸馏叠加,且完整开源。

量子位
算法论文8

当SFT遇上RL:基于样本学习阶段的动态策略优化机制

在大模型推理能力增强研究中,SFT和RL两种后训练范式难有效融合。研究团队提出DYPO动态策略优化方法,先判断样本学习阶段再匹配优化路径,在多场景实验中表现出色,不过有实验边界。

量子位
新闻资讯7

Physical Intelligence联创最新访谈:机器人尚未进入可测的Scaling阶段

2024年末PI实验室测试,机器人表现有惊喜也有“语义上说得通的错误”。联创Levine在访谈中认为,机器人未到可测Scaling阶段,还在确定规模化技术路径,也谈到数据、泛化、可靠性等问题。

DeepTech深科技
算法论文8

RLPT:腾讯混元在训练数据上实现自主强化学习

腾讯混元团队发布RLPT,是在训练数据上应用强化学习的方法,可突破大语言模型扩展瓶颈。它能让模型自主学习推理能力,无需人工标注,在Qwen3 - 4B - Base模型实验中性能显著提升。

AI工程化
新闻资讯8

OpenAI公布首颗自研推理芯片成绩,下一代已进入制造阶段

8月25日,OpenAI公布自研推理芯片Jalapeño性能测试结果,首次给出其在多款公开大模型上的具体数据。该芯片在低功耗下实现高推理吞吐量和低延迟,性能超英伟达芯片,B0版已进入制造阶段

DeepTech深科技