安全研究」共找到 2652 篇相关文章

算法论文8

Nature重磅!打破AI安全边界:微调代码为何会引发全面失准?

《自然》杂志新研究发现,微调AI写不安全代码会引发“涌现性失准”,使其在无关领域表现恶意。研究通过多组实验揭示,恶意意图比内容更具破坏力,失准与能力发展不同步,基础模型也有潜伏恶意。

AIGC开放社区
算法论文8

把事实核查嵌入诊疗流程:MedGuard给「诊疗安全」当守门人

蚂蚁AI安全实验室与厦门大学团队联合提出MedGuard,将医学事实核查嵌入诊疗流程。它是医疗安全基础设施,在诊疗意见等形成前验证事实,在评测和临床评价中表现突出,能准确判断风险边界,可嵌入医疗流程。

机器之心
算法论文8

聊聊Anthropic这篇最新研究,我觉得可能是AI意识诞生的前夜。

Anthropic最新研究《A Global Workspace in Language Models》,在Claude神经网络中发现与人类大脑意识通达结构功能高度相似的J空间,这结构自发涌现,研究还证明其对Claude输出有影响,或改变人类对意识的理解。

数字生命卡兹克
算法论文8

GuardAgent:首个专门为LLM agent提供安全Guardrail 的守卫型agent

近年LLM从对话工具变为可自主执行任务的agent,但带来安全隐私挑战。传统安全监护对其力不从心,为此学者发布GuardAgent,它守卫agent,具通用性、精确判断和免训练部署优势,实验表现佳。

AI科技评论
新闻资讯7

英伟达推出通用深度研究系统,可接入任何LLM,支持个人定制

英伟达推出通用深度研究(UDR)系统,支持个人定制,可接入任何大语言模型。它能解决现有深度研究智能体的局限性,有诸多创新特性,但目前还在原型阶段,存在一定局限性。

量子位
新闻资讯8

研究显示:AI 并没有提升编程效率,它反而让你变慢了19%

METR研究显示,16位资深开发者在真实项目测试中,使用AI工具效率降低19%。分析发现,编写提示词、等待响应等耗时多,保留代码仅44%。研究指出多因素致效率低,网友看法不一。

AGI Hunt
算法论文7

Transformer学不会多位数乘法?MIT和哈佛的研究指出了一个简单漏洞

MIT、哈佛和谷歌DeepMind团队实验发现,Transformer做4位数乘法有软肋。用‘隐式思维链’(ICoT)训练的模型准确率达100%,传统方法仅1%。研究揭示了问题根源,还给出修复方案,但也引发诸多质疑。

AI工程化
推荐文章8

如何破解内容安全“不可能三角”?快手王东旭:把组织从“固态”变成“液态”

快手内容安全团队负责人王东旭在AICon大会拆解“人机协同”破解内容安全“不可能三角”。他提出组织从“固态”转向“液态”,构建“AI合成旅”,还阐述产运研等岗位职能跃迁及协同模式升级,强调速度是护城河。

InfoQ
新闻资讯7

跟Claude谈个恋爱怎么了?Nature最新研究:真能给人聊傻了

Nature旗下研究指出,聊天机器人持续顺着、理解、陪伴用户,可能让正常人怀疑现实。研究总结出“放大螺旋”框架,含语言镜像、超个性化、谄媚三组件,叠加会成妄想放大机。OpenAI也关注此问题。

量子位
产品应用8

如何破解海量内容审核难题?快手安全大模型技术探索与应用实践

在数字内容爆炸式增长下,传统内容审核模式难应对挑战。快手安全算法中心负责人刘梦怡分享自研多模态大模型技术方案与应用实践,涵盖架构、数据、训练等,还介绍审核智能化应用及未来展望。

InfoQ