「推理训练」共找到 3552 篇相关文章
Gemini准确率从21%飙到97%!谷歌只用了这一招:复制粘贴
Google Research研究发现,将输入问题复制粘贴一遍,能让大模型在非推理任务上准确率惊人提升,如Gemini 2.0 Flash - Lite从21.33%升至97.33%,且几乎不影响生成速度,但不适用于推理场景。
林俊旸离职后首次发声!复盘千问的弯路,指出AI的新路
林俊旸离职阿里千问后发声,反思千问技术路线,认为千问合并两种模式未做好。他指出推理时代已过,未来是智能体时代,智能体思考将成主流,还阐述了其与推理思考区别及面临的挑战。
Ilya交卷!黄仁勋砸50亿押注SSI,首个模型疑本周发布
Ilya Sutskever创立的SSI或本周发布首个重磅模型,引发圈内关注。英伟达砸50亿美元合作,提升其算力。该模型基于测试时训练架构,能边学边进化,或终结大模型“预训练时代”。
推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品
在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。
刷新世界记录!40B模型+20万亿token,散户组团挑战算力霸权
Nous Research推出Psyche网络,用区块链汇聚全球计算资源,启动40B参数大语言模型Consilience预训练,达20万亿token创纪录。还解决带宽瓶颈等问题,让AI训练去中心化,推动创新与民主化。
The Batch: 968 | Muse Code 想获取你的数据
Meta推出Muse Code编码框架及Muse Spark 1.2模型,有不同输入输出、功能和性能表现。提供不同档位价格,贡献者档位低价但数据用于训练。测试显示其单任务成本低,Meta此举或为获取编码训练数据。
SFT远不如RL?永不过时的剃刀原则打开「终身学习」大模型训练的大门
现代AI系统学习新任务时会灾难性遗忘旧知识,限制其持续学习能力。麻省理工学院研究者对比SFT和RL后发现,相同性能下RL更不易遗忘,提出遗忘定律,解释了RL优势源于其on - policy特性。
全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压
港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。
LeCun点赞:国产开源模型占领硅谷,性价比超10倍
硅谷被中国开源模型占领,Cursor、Cognition等公司模型被曝套壳或基于中国开源模型后训练。巨头如Meta也用Qwen做训练,爱彼迎等青睐Qwen。因性价比高,中国开源模型在硅谷走红。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。