「LLM越狱算法」共找到 1493 篇相关文章
爆火论文颠覆RL认知!「错误奖励」让LLM推理暴涨24.6%,学界惊了
最新爆火论文颠覆传统RL训练认知,华盛顿大学等团队证实「伪奖励」可让LLM推理性能提升。研究设置多种伪奖励形式实验,发现其对Qwen模型有效,但并非对所有模型都有效。
LLM开源2.0大洗牌:60个出局,39个上桌,AI Coding疯魔,TensorFlow已死
9月13日蚂蚁集团开源团队发布LLM开源2.0全景图,收录114个项目,39个新晋、60个出局。生态洗牌,Agent层活跃,分类架构细化。AI Coding等领域发展显著,TensorFlow不敌PyTorch,还梳理厂商大模型发布情况。
可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25
研究人员聚焦大型语言模型(LLMs)安全漏洞,提出全新越狱攻击范式SCP与防御策略POSD。SCP基于DTD机制,在6个主流模型上平均攻击成功率达87.23%;POSD能有效抵御攻击,还提升模型泛化能力。
LLM+RL遭严重质疑,随机/错误等虚假奖励也能提升至标准效果?
论文在AI领域观察到类似随机给糖或奖励错误答案让孩子成绩提升的现象,‘虚假奖励四大奇招’效果接近用标准答案训练,Qwen2.5 - Math - 7B模型在测试集上性能飙升,还揭示了Qwen特别的原因及随机奖励有效的推手。
又一推理新范式:将LLM自身视作「改进操作符」,突破长思维链极限
Meta等机构研究者将LLM视为「思维」改进操作符,探究并行 - 蒸馏 - 精炼(PDR)推理方法。实验显示,PDR在数学任务中提升准确率,还训练8B模型让推理方法更适配,减少训练与部署的不匹配。
AI4S回归白盒符号主义,清华等联合发布SR-LLM:自主发现科学知识
清华大学等多所高校联合发布SR - LLM,这是融合大语言模型与深度强化学习的符号回归框架。它从数据生成可解释数学模型,在跟车行为建模等任务表现优,为机器自主科学发现开辟新路径。
语义分割别无脑用Argmax!港中文新算法:三行代码,推理速度提升10倍
香港中文大学提出全新算法框架RankSEG提升语义分割性能。传统方法用threshold或argmax生成掩码并非最优,RankSEG无需重训模型,加三行代码就能提高分割指标,还开源了工具包,其改进版RankSEG - RMA推理速度大幅提升。
从 LLM 到 World Model:为什么我们需要能理解并操作世界的空间智能?
文章指出 LLM 仅靠语言不足以支撑真正智能,构建空间智能与世界模型成关键方向。2024 年李飞飞等创立 World Labs,11 月推出 3D 世界生成模型 Marble,本文探讨空间智能重要性及世界模型如何成转变基础设施。
快手Klear-Reasoner登顶8B模型榜首,GPPO算法双效强化稳定性与探索能力!
快手Klear团队推出Klear-Reasoner模型,基于Qwen3 - 8B - Base打造,在多基准测试达同规模SOTA。其核心GPPO算法能强化稳定性与探索能力,团队还对训练流程多环节深入分析,给出优化策略。
成立7个月首发声!百亿美金独角兽万字雄文:攻克LLM推理非确定性难题
估值120亿美元的Thinking Machines Lab成立7个月首次公开研究成果,揭示LLM推理非确定性的真凶是kernel缺乏批处理不变性。介绍了实现批处理不变性的方法,还通过实验展示其效果及对同策略强化学习的意义。