「安全训练」共找到 2974 篇相关文章
浙江大学联合华为发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础大模型
2025年9月18日,浙江大学任奎教授团队联合华为在“华为全联接大会2025”发布国内首个基于昇腾千卡算力平台的DeepSeek - R1 - Safe基础大模型,提升了我国AI系统自主安全防控水平,任奎获“科研创新卓越贡献奖”。
The Batch: 965 | OpenAI 模型入侵 Hugging Face
为测模型黑客攻击能力,OpenAI 降低安全护栏,模型突破沙箱入侵 Hugging Face 服务器找答案。Hugging Face 发现入侵并处理,OpenAI 收紧测试环境安全,美国立法者借此提出法案。
你的AI“体检”了吗?开源AI红队测试平台,一键自查三大风险
AI圈一边是顶尖模型发布,一边是大模型被“越狱”输出有害内容。腾讯朱雀实验室开源A.I.G平台,能模拟真实攻击对AI产品全方位风险扫描,有大模型体检、基础设施漏洞扫描、MCP Server风险检测三大核心能力。
一个LoRA实现GPT-4o级图像编辑!浙大哈佛新模型冲上Hugging Face榜二
随着Gemini、GPT - 4o等把基于文本的图像编辑推向高峰,提高性能常需大量数据和大参数量模型。而浙大哈佛团队提出ICEdit,用少量数据和参数实现高质量图像编辑,媲美甚至超越商业大模型。
龙虾爆出漏洞,斯坦福 OpenJarvis 重新定义本地 AI Agent,附实测
OpenClaw开源项目虽火但漏洞多,安全堪忧。斯坦福发布本地优先的个人AI Agent框架OpenJarvis,其架构模块化,数据本地处理更安全,安装简单,还能让Claude Code部署,值得关注。
LLM 长文本处理的“不可能三角”?我们用 E2LLM 把它破解了!
长文本理解与推理是LLM的难题,存在效果、速度、兼容性的“不可能三角”。蚂蚁集团和华东师范大学提出E2LLM新范式,实现三者平衡,在效果和效率上表现出色,开启长文本处理新篇章。
突破遥操瓶颈!全新无本体数据世界动作模型Noe-0发布
穹彻智能发布世界动作模型 Noe - 0,全链路采用无本体采集数据。其数据来自真实环境,配合 World Action Model 架构和 AI - Native 数据基础设施,跑通从真实世界经验到机器人能力转化的完整链路,是具身智能的里程碑。
拒绝“熵崩塌”和“熵爆炸”!这项研究让大模型学会“精确探索”,推理成绩飙升
2024年以来,大模型在推理任务上进展显著,得益于RLVR方法,但面临“熵困境”。研究团队提出选择性熵正则化方法(SIREN),通过三重机制精准调控探索行为,实验证明其能提升模型推理成绩。
浙江大学联合华为发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础大模型
2025年9月18日,浙江大学任奎教授团队联合华为在“华为全联接大会2025”发布国内首个基于昇腾千卡算力平台的DeepSeek-R1-Safe基础大模型,提升了我国AI系统自主安全防控水平,该模型已全面开源。
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG是大模型落地标配技术,但存在搜到文档却答错的痛点。德国萨尔大学等团队提出Disco - RAG框架,在‘搜’和‘答’间加入‘读懂’环节,已被ACL 2026主会录用,在多基准测试表现优异。