大模型安全」共找到 9537 篇相关文章

算法论文8

ICML 2025 Oral | 从「浅对齐」到「深思熟虑」,清华牵头搭起大模型安全的下一级阶梯

语言模型加速进入高风险应用场景当下,“安全对齐”是挑战。如今广泛采用的“浅对齐”脆弱不堪。清华团队提出STAIR框架,能提升开源模型鲁棒性,还推出RealSafe - R1模型进行安全对齐。

机器之心
算法论文8

瘦身不降智!模型训推效率提升30%,京东模型开发计算研究登Nature旗下期刊

京东探索研究院模型研究登Nature旗下期刊。其提出系统与方法,经四创新使模型推理提效30%、训练成本降70%。成果支撑JoyBuild平台,可帮企业将通用模型转化为专业模型,加速商业化落地。

量子位
新闻资讯8

中国中文信息学会模型与生成专委会2025模型战略研讨会成功举办

2025年6月27日,中国中文信息学会模型与生成专委会2025模型战略研讨会在哈尔滨举办。会议探讨技术革命、交流成果、发布基金,多位专家作报告、参与思辨讨论,聚焦模型多方面话题。

深度学习自然语言处理
新闻资讯8

语言模型 + 编程智能体 = 安全噩梦

作者结合黑帽会英伟达演讲,指出语言模型和编程智能体扩攻击面。如攻击者利用公共资源留恶意指令,实施水坑攻击。强编程智能体虽普及,但易造成安全漏洞,虽有防御措施但效果有限。

宝玉AI
开源动态7

新玩法!Karpathy周末手搓“模型智囊团”应用:各LLM同台互评,代码已开源

Andrej Karpathy周末手搓Web应用llm - council,让多个模型像顾问般提供建议。查询通过OpenRouter分发给多个模型,它们互评后由‘模型主席’生成最终回复,代码已开源。

AI寒武纪
产品应用8

九天模型变身:性能狂飙35%!还能一键P

7月26日,中国移动在2025世界人工智能会发布「九天」基础模型3.0,端到端技术全面升级,复杂推理能力提升35%,智能体调用效率提升21%,还推出代码、数学等专项模型,多模态能力也焕新。

新智元
产品应用8

模型“跑”在手机里:vivo蓝心端侧部署创新揭秘,性能功耗双优!

在AICon2025上海站,vivo AI研究院工程师章苏迟分享蓝心模型端侧部署方案。介绍端侧模型优势及应用场景,阐述内存、性能、功耗等指标优化方法,还提及多业务场景应对策略与安全合规措施。

InfoQ
算法论文8

AI自己给自己当网管,实现安全“顿悟时刻”,风险率直降9.6%

型推理模型安全风险,此前监督微调泛化能力有限。SafeKey团队提出创新的SafeKey框架,发现模型信息“越狱”两核心,通过双通路安全头和查询遮蔽建模强化模型安全,实验验证其有效性。

量子位
算法论文8

告别单一模型依赖!北航等机构发布综述:语言模型集成(LLM Ensemble)

北航等机构发布的论文系统性回顾了LLM Ensemble领域进展,介绍分类法、相关问题、方法、基准、应用和未来方向。LLM Ensemble指推理阶段综合利用多模型优势,现有推理前、中、后三集成范式。

PaperAgent
开源动态7

OpenAI解密模型失控:它不是变坏,而是「太听话」

OpenAI公开IH - Challenge,解决模型指令冲突难题。指出模型问题多因听信错误指令,给出系统>开发者>用户>工具的指令层级结构,设计数据集训练模型遵循高信任等级指令,提升安全可控性与抵御提示词注入能力。

新智元