安全训练」共找到 2984 篇相关文章

开源动态7

挑战 Claude Code,9.5 万星!又一款开源 AI 编程神器火了

开源AI编程工具OpenCode亮相,具备原生终端界面、多会话支持,兼容75种以上模型,提供桌面版和IDE插件。它允许沿用付费订阅,内置免费模型,与多种LSP服务器整合,适配多种编辑器,采用‘隐私优先’架构设计。

InfoQ
新闻资讯7

AI Agent 是长期运行的“风险系统”,如果你还只在防 Prompt Injection,说明已经落后一代了

AI安全公司CyberArk首席软件架构师Niv Rabin团队提出基于“指令检测”与“历史感知校验”的方法,防御大语言模型和AI Agent恶意输入与历史投毒攻击,介绍多种防御机制。

InfoQ
算法论文8

拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”

现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。

深度学习自然语言处理
算法论文8

卢宗青团队新作:人类先验打底,统一动作对齐,通用机器人模型正在落地

机器人行业核心问题是让机器在真实世界稳定行动。卢宗青团队论文《Being - H0.5: Scaling Human - Centric Robot Learning for Cross - Embodiment Generalization》给出通用操控路线,系统性解决多形态平台部署问题。

AI科技评论
算法论文8

Anthropic:大模型开始意识到自己在想什么!

Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。

深度学习自然语言处理
算法论文8

微软:DeepSeek-R1等推理模型循环的原因找到了

前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。

PaperAgent
产品应用8

ChatGPT Health重磅登场:可连接病历和Apple Health,打造专属健康助手

OpenAI推出ChatGPT Health,可连接病历和健康应用,基于用户健康信息回应。它有强化隐私保护,与医生合作设计,不取代医疗护理。先向部分早期用户开放,后续将面向网页和iOS用户。

AI寒武纪
开源动态8

QwenLong-L1.5发布:一套配方,三大法宝,让30B MoE模型长文本推理能力媲美GPT-5

通义文档智能团队推出QwenLong - L1.5,提供长文本推理后训练“配方”,含数据合成管线、强化学习方法和智能体架构。通过三大“法宝”重塑模型能力,效果显著,相关代码已开源。

AINLPer
算法论文8

大模型幻觉的源头找到了!清华团队锁定大模型宁愿说谎也要讨好人类的神经元

清华大学研究团队深度解剖大语言模型微观机制,确认幻觉关联神经元存在,揭示其与过度服从行为相关。通过干预神经元激活状态可增减模型幻觉行为,为开发可靠 AI 系统提供靶点。

AIGC开放社区
产品应用8

AI体育教练来了!中国团队打造SportsGPT,完成从数值评估到专业指导的智能转身

现有智能体育系统多停于‘打分+可视化’,通用大模型处理体育生物力学分析有局限。中国团队提出SportsGPT框架,实现从‘动作评估’到‘训练处方’智能闭环,各模块优势明显,超越基线。

量子位