「速度提升」共找到 3336 篇相关文章
新范式来了!新能量模型打破Transformer++扩展上限,训练扩展率快35%
研究训练新能量模型 EBT,为输入和预测分配能量值,模拟思考过程。它有跨模态、跨任务通用性,训练扩展率比 Transformer++ 高 35%,推理性能提升 29%,还在多任务中表现出色,是扩展模型能力新范式。
ICLR 2026 | ProSafePrune:一剪见效,告别大模型过度防御
合肥工业大学与科大讯飞联合团队提出全新低秩参数修剪框架 ProSafePrune,被 ICLR 2026 录用。它能精准定位模型认知偏差并修剪,降低过度拒绝率,不损安全防御能力,还提升通用任务性能,为 LLM 安全部署提供新思路。
对话 OPPO AI 姜昱辰:手机才是 Memory 最好的土壤,AI 一定会彻底改变智能手机
文章是对OPPO AI姜昱辰的访谈。他认为AI会改变智能手机,OPPO将小布记忆做成跨系统收藏夹。产品迭代后记得更广、更深、更有用,团队还探索记忆分层、更新等,也重视用户隐私和主动推荐能力提升。
快慢思考不用二选一!华为开源7B模型实现自由切,精度不变思维链减近50%
华为发布openPangu-Embedded-7B-v1.1,参数7B却有双重“思维引擎”。采用渐进式微调策略和快慢思考自适应模式,可自由切换快慢思考,在多评测中精度提升,思维链减近50%。还推出openPangu-Embedded-1B小模型。
物理学「AlphaGo时刻」?40年未竟之事被AI一举攻破,顶尖物理学家集体傻眼
AI主导设计的物理实验方案让顶尖科学家看不懂却成功了,它设计新颖光学元件布局使LIGO灵敏度提升10% - 15%。此外,AI还在量子纠缠实验设计、解析实验结果等方面展现强大能力,辅助物理学发现的新时代或已到来。
阿里+清华发现80/20法则:LLM只靠20%的token就能学会Reasoning
阿里与清华研究发现,训练大语言模型(LLM)推理时,真正关键的是20%的高熵token,其余80%低熵token几乎无用。仅用20%高熵token做强化学习,效果超全量训练,还提出RLVR训练策略提升效率。
撞名Anthropic的“外挂”刷屏:让“DeepSeek V4‑Pro碾压 Fable 5”但无人能复现,Token开销反而翻倍
J - Space Cognition Suite社区项目在X上传播,称不修改DeepSeek V4 - Pro模型权重,用推理时Harness能提升其在多项Agent Benchmark表现,超Fable 5,但未第三方复现,且Token开销可能翻倍。
时隔九年,中国超级计算机重登世界榜首
当地时间6月23日,第67届TOP500超级计算机排行榜发布,国家超级计算深圳中心的‘灵晟’(LineShine)夺冠,运算速度达2.198 ExaFLOP/S。它仅用CPU,性能超美国El Capitan超20%,引发对未来计算架构思考。
座舱芯片,谁能从高通手中抢市场?
座舱芯片领域,高通凭借技术和生态优势成为霸主,与全球主流车企合作稳定。但本土厂商如MTK、芯擎等通过成本、本土化服务等错位竞争提升份额。同时,舱驾融合虽为趋势,但推进难度大。
世界模型和具身大脑最新突破:90%生成数据,VLA性能暴涨300%|开源
国产世界模型玩家获突破,VLA模型性能涨300%,90%训练数据由世界模型生成。极佳视界开源GigaWorld - 0及训练框架,在多方面优化,经对比性能领先,还验证其生成数据对具身任务的提升作用。