「基准表发现」共找到 1843 篇相关文章
AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。
揭示隐藏联系:RLHF/DPO即对比学习!
大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。
马斯克Grok 4正式发布:世界最大AI超级计算机就训练了这?
Grok 4公开基准测试有进步,但在高级推理测试表现差,视觉理解仍是短板。性能提升多靠整合符号工具,无重大技术创新,‘幻觉’问题没实质进展,xAI官方对道德对齐信心不足。
R2没来,却等来综合性能更优的DeepSeek R1T2
抱抱脸热门排行榜出现R1变体模型DeepSeek-TNG-R1T2,构建于多个父模型之上,在智能与输出token长度间达新平衡点,速度快且测试表现佳,还给出与不同模型对比的选择建议。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
“这半年,我也用AI救了6条活生生的命啊。”
本文讲述作者用AI对抗癌症的经历,介绍阿里达摩院发布的胃癌早筛模型GRAPE和胰腺癌早筛模型PANDA。作者亲身体验PANDA筛查流程,医生业余投入项目,半年额外发现6个早期患者,令人感动。
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索
AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。
Claude与人类共著论文,苹果再遭打脸!实验黑幕曝光
苹果一篇质疑大模型推理能力的论文引发争议。Open Philanthropy研究人员联手Anthropic发表论文,揭露苹果论文三大缺陷,指出部分测试无解却让模型“背锅”,还给出正确评价大模型推理能力的方法。
vLLM Ascend超越MindIE? 昇腾推理Qwen3与DeepSeek R1 Distill性能实测
国内开发者在昇腾NPU上进行大模型推理面临挑战,华为MindIE推理引擎使用门槛高。昇腾联合vLLM社区推出vLLM Ascend插件。本文用GPUStack平台实测其与MindIE性能差异,得出两者在不同场景各有优势的结论。