语言模型安全」共找到 8423 篇相关文章

产品应用8

什么样的龙虾,才是「一人公司」的心头好?

AI时代,OPC概念火热,但过往大模型和Agent难落地。面壁智能官宣EdgeClaw Box,采用端云两栖架构,安全高效,适配多款硬件,可插电即用,还能降成本、保障数据安全,集成多种Skills,助力OPC提效。

AI科技评论
开源动态7

以小博大,仅1.7B媲美gemini2.5-pro,达到SOTA文档解析性能

dots.ocr是多语言开源文档解析器,把布局检测和内容识别统一在视觉语言模型中,虽LLM仅1.7B参数,却达SOTA性能。介绍了其预训练三阶段及SFT阶段关键策略。

PaperAgent
算法论文8

揭示隐藏联系:RLHF/DPO即对比学习!

大型语言模型输出符合人类价值观是挑战,主流技术RLHF复杂、昂贵且不稳定,DPO简化流程但有训练崩溃问题。论文揭示RLHF/DPO即对比学习,提出MIO算法解决DPO崩溃,实验验证其性能优势。

深度学习自然语言处理
算法论文7

「Next-Token」范式改变!刚刚,强化学习预训练来了

微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。

机器之心
新闻资讯7

美国解除Claude禁令,Fable 5与Mythos 5即将恢复访问

美国商务部解除针对Claude Fable 5和Claude Mythos 5的出口管制,Anthropic将恢复两款模型访问权限。此前因安全担忧模型被限制,政策逐步松动后现整体解禁,Anthropic还发布了Claude Sonnet 5。

DeepTech深科技
新闻资讯8

Claude Mythos官宣!性能碾压Opus 4.6,因太危险遭「囚禁」

Anthropic官宣最强模型Claude Mythos预览版,性能全方位碾压Opus 4.6。但它存在致命缺陷,攻击安全漏洞能力超多数黑客。Anthropic暂不向公众开放,联合巨头开展安全计划,称需各方共筑网络安全

量子位
新闻资讯9

刚刚!OpenAI与Anthropic CEO罕见同台,黄仁勋当场唱反调:AI到底要不要踩刹车?

Salesforce Dreamforce 2026大会上,OpenAI、Anthropic、英伟达三大AI巨头CEO罕见同台,围绕AI发展是否需要踩刹车展开激烈论战,各方立场背后暗藏产业利益博弈,头部模型厂商已密谈行业安全协同。

AI前线
新闻资讯8

突发!OpenAI紧急暂停GPT-6训练

OpenAI奥特曼官宣暂停下一代旗舰模型强化学习训练两周,原因是确保安全等标准跟上能力水平。触发因素有Hugging Face事故和Astra达安全红线,后续将让AI监管AI,加固三道安全防线。

新智元
产品应用8

英伟达拿出推理版VLA:Alpamayo-R1让自动驾驶AI更会动脑子

当今自动驾驶模型虽强大,但在‘长尾场景’易翻车。英伟达推出的Alpamayo - R1是带推理能力的视觉 - 语言 - 行动模型,有核心创新,实验中性能显著提升,训练分三阶段,让自动驾驶迈向可解释。

机器之心
算法论文8

DeepSeek-GRPO重要性权重设计错误?详解Qwen3新强化学习算法GSPO

论文指出GRPO在大语言模型训练中不稳定,因其重要性权重设计错误易引入高方差噪声。为此提出GSPO算法,从序列维度计算梯度,解决了MoE模型RL训练的稳定性问题,在Qwen3上效率更高。

深度学习自然语言处理