「前缀主导陷阱」共找到 191 篇相关文章
阿里:RL强化LLM推理,是技巧还是陷阱?
近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。
刚刚,斯坦福宣布发起首个AI 主导学术会议
斯坦福大学James Zou教授宣布Agents4Science 2025会议,这是首个要求AI作主要作者和审稿人的学术会议。会议玩法独特,有三大目标,顾问委员会豪华,引发网友热议,将于2025年10月22日虚拟举行。
AI Coding 产品的陷阱:有 PMF 但还没有做到 BMPF
AI Coding 产品增长迅速,如 Lovable 预计年底 ARR 达 2.5 亿美金。但也暴露出盈利难题,多数产品利润为负。解决办法要么自建模型,但成本高;要么等大模型成本下降,却不太可行。AI Coding 产品或未实现 BMPF。
两种小金属卡了AI脖子,中国供应链占主导
在AI数据中心扩产潮中,IEEE点出铒和钇两个此前少被关注的小金属,它们分别用于数据中心长距离光通信网络和供电燃气轮机。我国占这两种小金属近100%产量,且分离加工能力强。
告别 LEB128 的规范性陷阱,Bijou64 用结构设计解决安全问题
研究实验室Ink & Switch发布bijou64可变长度整数编码格式,由Brooklyn Zelenka开发。它消除规范性漏洞,在基准测试中超标准标量LEB128解码器。Hacker News社区对其有权衡讨论,实现已用Rust发布。
Anthropic Labs 负责人:AI 时代做产品,最大的陷阱是「做太多」
Anthropic Labs 负责人 Mike Krieger 在播客中探讨 AI 时代产品建造问题。他以重建 Bourbon 为例,指出 AI 加速开发有弊端,还分享产品易过度建设、需接受重写等观点,也谈到团队结构、企业客户矛盾等内容。
华人主导谷歌SLED,论文登顶会!一键让模型学会自救
大模型常「瞎编」,传统修复代价高。谷歌在NeurIPS 2024提出SLED方法,不依赖外部知识和额外微调,将各层预测纳入考量,减少模型幻觉。实验显示,SLED能显著提升模型准确率。
大模型刷数学题竟有害?CMU评估20+模型指出训练陷阱
CMU团队评估20多个大模型,发现只有强化学习(RL)训练的模型能将数学推理技能广泛迁移到其他任务,监督微调(SFT)训练的模型迁移有限甚至无迁移。研究还探索差异原因,表明RL微调更具优势。
专访|两位华人主导创办,Jeff Dean参投,伯克利开源项目SkyPilot转型初创
前沿模型团队算力瓶颈从不足变为分散,开源AI算力调度项目SkyPilot应运而生。7月末,它从高校走出成为初创公司,完成2000万美元种子轮融资。其免费版与商业版各有侧重,切入AI编排赛道潜力大。
震撼实锤!清华姚班校友揭「1.4×加速」陷阱:AI优化器为何名不符实?
为降低大模型预训练成本,近年新优化器频出,宣称加速1.4×到2×却难落地。斯坦福研究指出方法学缺陷,对比不同缩放范式加速差异,给出优化器设计见解,证实严格基准评测必要。