「测试时强化学习」共找到 2997 篇相关文章
142 TFLOPS 的差距:为什么在 Blackwell 上 FP4 MoE 算子工程至关重要
文章对三种主流MoE后端在Blackwell B200 GPU上做基准测试,发现SGLang与vLLM有142 TFLOPS差距,小batch时SGLang快1.84×。差异源于kernel融合、面向Blackwell的CUTLASS schedule及自适应grid sizing等优化。
视频模型也能推理,Sora2推理能力超过GPT-5
DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。
对话心资本吴炳见:我不问AI创业的“终局”|甲子光年
本文是对心资本合伙人吴炳见的访谈。他2022年底All in AI,分享投资理念,如共鸣时投资、关注当下问题;分析AI发展阶段、应用情况,认为Agent是核心应用形态;还谈及投资案例、学习方式及经验复用与摒弃等。
SPIRAL:零和游戏自对弈成为语言模型推理训练的「免费午餐」
新加坡国立大学等机构团队提出 SPIRAL,让模型在零和游戏自对弈强化推理,摆脱人工监督。研究发现游戏可培养推理能力并迁移到数学,还开发系统保障训练,虽有局限但为 AI 发展指明方向。
Cursor终结者?Grok 4正式登顶!马斯克扬言编程碾压,20万N卡年赚47亿美金!
时隔5个月,xAI发布通用模型Grok 4,后续还将推编码、多模态代理和视频生成模型。Grok 4已上线,有三个订阅版本。马斯克称其智能超博士生,在多基准测试中领先,编码或超Cursor。
R2没来,却等来综合性能更优的DeepSeek R1T2
抱抱脸热门排行榜出现R1变体模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。
Chiplet(芯粒) —— 后摩尔时代的芯片“乐高”玩法
当单芯片逼近物理极限,Chiplet技术应运而生,它将大芯片拆分成小芯片,通过先进封装技术整合。该技术成本低、良率高,应用场景多元,但面临热管理、测试和标准统一等挑战,未来发展前景广阔。
大模型也需要自我反思,上海AI Lab合成“错题本”让大模型数学成绩提升13.3%
上海AI Lab提出LEMMA方法,构建“错误 - 反思 - 修正”数据,让大模型从错误中学习。通过教师模型定向制造“学生会犯的错”构造数据,实验显示在Llama3 - 8B上数学解题准确率提升13.3%。
DeepSeek R1 迎来小更新大升级,性能直逼 OpenAI o3!
昨日,DeepSeek 发布 R1 大模型最新版本 DeepSeek - R1 - 0528 并开启公测。虽官方未附详细技术说明,但用户反馈推理和输出有改进,也有性能方面的不同看法,其在基准测试表现佳。
DeepSeek-R1今天一次「小更新」,颠覆了大模型格局,网友:尽快放R2
昨晚,DeepSeek官方宣布其R1推理模型升级到最新版本(0528),并公开模型及权重。该版本参数量高达6850亿,采用MIT许可证,性能提升明显,在多个基准测试中成绩优异,网友实测代码能力也大幅提升,但仍存在过度思考问题。